我们最近跑产业,发现了一个AI方向上 国内景气度开启加速 且 对后面模型发展至关重要 的新赛道——【给模型供应高质量的后训练数据】。逻辑是,随着大模型开始进入后

图片

无图片

正文

我们最近跑产业,发现了一个AI方向上 国内景气度开启加速 且 对后面模型发展至关重要 的新赛道——【给模型供应高质量的后训练数据】。逻辑是,随着大模型开始进入后训练和长程 Agent 的时代,蒸馏数据有效性下降,模型能力提升的卡点,已经变成了高质量、合规、可获取的后训练数据。 美国是一个年化100亿美金的市场、而中国才刚刚开始、各家模型厂在数据上的预算都在结构性往这里转。

🔸海外:海外数据公司在今年上半年 deliver 了很快的增速。比如AI招聘转型的Mercor ARR 从去年下半年的 5 亿做到今年年中 20 亿,半年翻 4 倍;Handshake ARR 在年初三个月内从 5.5 亿美元冲到了 10 亿美元,翻了接近一倍。整体的增速与Frontier Lab相当。

🔸国内:考虑到国内模型的发展进度其实比海外晚几个月,后面后训练上投入扩大,是一个参考海外有迹可循的事情。目前我们也看到国内的这个赛道开始逐渐加速。包括字节最近又成立了一个新的一级部门,叫“AI 数据与安全”。这个一级部门跟 Seed、Flow、抖音平行,覆盖标准制定、寻源采购、合成清洗、质量评测的全流程。

我们最近聊了好几个本身在模型厂做核心业务,放弃千万级年薪来做这个方向,反馈说“一级投资人全球范围内在找标的”“业务和估值半年翻了10多倍”“供远远小于求”“最近1-2个月需求起来非常快”

【供给端】 这些公司是怎么做数据的? ---这些公司要理解+积极响应大厂对后训练数据要求,找各行业资深专家去搭建任务地图、设计题目、制定标准、质量把关等,以及搭建RL环境利用专家制作长程任务数据。 做这个业务需要什么资源禀赋? ---1是需要广泛的各行业专家网络资源(也就是为什么海外Mercer、Handshake是做AI招聘转型做这块的);2是对大模型迭代下对后训练数据的标准和需求有理解(也就是为什么那么多国内模型厂有很多人出来创业做这个)。

【需求端】 模型厂需求如何? ---1是在长程 agent 任务等需求在蒸馏数据的有效性在下降,导致数据预算 结构性往后训练数据转; 2是这类数据对外部专家资源更重,导致模型厂预算在 结构性往外部转; 3是数据采购频次更高、场景更多、每条数据价值量更大,导致这块业务 量价齐升加速放量。

我们跟踪产业下来确实这块跑的特别好,从产业逻辑来讲,在专家网络人脉、模型所需数据有know-how的公司有望在后面转型受益~

总体总结

主题正文

  1. 我们最近跑产业,发现了一个AI方向上 国内景气度开启加速 且 对后面模型发展至关重要 的新赛道——【给模型供应高质量的后训练数据】。
  2. 逻辑是,随着大模型开始进入后训练和长程 Agent 的时代,蒸馏数据有效性下降,模型能力提升的卡点,已经变成了高质量、合规、可获取的后训练数据。
  3. 比如AI招聘转型的Mercor ARR 从去年下半年的 5 亿做到今年年中 20 亿,半年翻 4 倍;
  4. 我们最近聊了好几个本身在模型厂做核心业务,放弃千万级年薪来做这个方向,反馈说“一级投资人全球范围内在找标的”“业务和估值半年翻了10多倍”“供远远小于求”“最近1-2个月需求起来非常快”
  5. ---这些公司要理解+积极响应大厂对后训练数据要求,找各行业资深专家去搭建任务地图、设计题目、制定标准、质量把关等,以及搭建RL环境利用专家制作长程任务数据。
  6. ---1是需要广泛的各行业专家网络资源(也就是为什么海外Mercer、Handshake是做AI招聘转型做这块的);
  7. 2是对大模型迭代下对后训练数据的标准和需求有理解(也就是为什么那么多国内模型厂有很多人出来创业做这个)。
  8. ---1是在长程 agent 任务等需求在蒸馏数据的有效性在下降,导致数据预算 结构性往后训练数据转;