Agent 训练数据市场
Market research · 2026-08
研究索引 · 两个专题

Agent 训练数据市场

当「真实的 agent 交互记录」被当成商品,两个问题立刻摆在面前:到底谁在买、按什么标准买,以及这些数据要处理到什么程度才敢卖。这两个专题各回答一个。

一句话结论

公开市场上真正在买 agent 数据的,不是模型厂商本身——OpenAI、Anthropic、Cursor 都没有公开的采购入口。挂着实时需求的是中间商。而且他们付费买的单位不是「历史日志」,是「买方先出题、贡献者在受控环境里做完、带着验收和授权证据交付」。

换句话说:「攒一堆日志再脱敏转卖」这条路,市场已经用「按需生产」绕过去了。

两个专题
🗺️
专题一 · 需求侧
思鹏 调研 · PlanD 逐条核实

数据买方品类地图

只认公开且能落地的采购证据——「技术方向」「在招人」「理论上需要数据」一律不算。按这个门槛筛下来,公开挂着需求的只剩两家,另外四家买的是产能不是数据。每条价格都回到官方页面重新核对过。

6 家 · 8 个数据品类 · 逐条核实 进入 →
🔒
专题二 · 供给侧
思鹏 实做 · PlanD 补充边界分析

数据脱敏相关调研

一套跑在 5.4 GB 真实 coding-agent 会话上的凭证清除方案,不是纸面方案。核心是一条反直觉的经验:对「密钥长什么样」建模是脆弱的,对「密钥出现在哪个语境」建模才稳。附一节讲清楚它没有解决什么。

18,380 条会话 · 两层机制 · 零残留 进入 →
读之前需要知道的

口径