---
title: "我们最近跑产业，发现了一个AI方向上 国内景气度开启加速 且 对后面模型发展至关重要 的新赛道——【给模型供应高质量的后训练数据】。逻辑是，随着大模型开始进入后"
topic_id: 45544145488428448
created_at: 2026-08-17T08:11:16.202+0800
source: zsxq
type: topic
cssclasses: zsxq-vault
---

# 我们最近跑产业，发现了一个AI方向上 国内景气度开启加速 且 对后面模型发展至关重要 的新赛道——【给模型供应高质量的后训练数据】。逻辑是，随着大模型开始进入后

- 序号：550
- 星球链接：[打开网页](https://wx.zsxq.com/group/15522451881222/topic/45544145488428448)
- 附件：图片 0，音频 0，文档 0
- 音频文件：_无音频_

## 图片

_无图片_

## 正文

我们最近跑产业，发现了一个AI方向上 国内景气度开启加速 且 对后面模型发展至关重要 的新赛道——【给模型供应高质量的后训练数据】。逻辑是，随着大模型开始进入后训练和长程 Agent 的时代，蒸馏数据有效性下降，模型能力提升的卡点，已经变成了高质量、合规、可获取的后训练数据。 美国是一个年化100亿美金的市场、而中国才刚刚开始、各家模型厂在数据上的预算都在结构性往这里转。

🔸海外：海外数据公司在今年上半年 deliver 了很快的增速。比如AI招聘转型的Mercor ARR 从去年下半年的 5 亿做到今年年中 20 亿，半年翻 4 倍；Handshake ARR 在年初三个月内从 5.5 亿美元冲到了 10 亿美元，翻了接近一倍。整体的增速与Frontier Lab相当。

🔸国内：考虑到国内模型的发展进度其实比海外晚几个月，后面后训练上投入扩大，是一个参考海外有迹可循的事情。目前我们也看到国内的这个赛道开始逐渐加速。包括字节最近又成立了一个新的一级部门，叫“AI 数据与安全”。这个一级部门跟 Seed、Flow、抖音平行，覆盖标准制定、寻源采购、合成清洗、质量评测的全流程。

我们最近聊了好几个本身在模型厂做核心业务，放弃千万级年薪来做这个方向，反馈说“一级投资人全球范围内在找标的”“业务和估值半年翻了10多倍”“供远远小于求”“最近1-2个月需求起来非常快”

【供给端】
这些公司是怎么做数据的？ ---这些公司要理解+积极响应大厂对后训练数据要求，找各行业资深专家去搭建任务地图、设计题目、制定标准、质量把关等，以及搭建RL环境利用专家制作长程任务数据。
做这个业务需要什么资源禀赋？ ---1是需要广泛的各行业专家网络资源（也就是为什么海外Mercer、Handshake是做AI招聘转型做这块的）；2是对大模型迭代下对后训练数据的标准和需求有理解（也就是为什么那么多国内模型厂有很多人出来创业做这个）。

【需求端】
模型厂需求如何？ ---1是在长程 agent 任务等需求在蒸馏数据的有效性在下降，导致数据预算 结构性往后训练数据转； 2是这类数据对外部专家资源更重，导致模型厂预算在 结构性往外部转； 3是数据采购频次更高、场景更多、每条数据价值量更大，导致这块业务 量价齐升加速放量。

我们跟踪产业下来确实这块跑的特别好，从产业逻辑来讲，在专家网络人脉、模型所需数据有know-how的公司有望在后面转型受益～

## 总体总结

主题正文
1. 我们最近跑产业，发现了一个AI方向上 国内景气度开启加速 且 对后面模型发展至关重要 的新赛道——【给模型供应高质量的后训练数据】。
2. 逻辑是，随着大模型开始进入后训练和长程 Agent 的时代，蒸馏数据有效性下降，模型能力提升的卡点，已经变成了高质量、合规、可获取的后训练数据。
3. 比如AI招聘转型的Mercor ARR 从去年下半年的 5 亿做到今年年中 20 亿，半年翻 4 倍；
4. 我们最近聊了好几个本身在模型厂做核心业务，放弃千万级年薪来做这个方向，反馈说“一级投资人全球范围内在找标的”“业务和估值半年翻了10多倍”“供远远小于求”“最近1-2个月需求起来非常快”
5. ---这些公司要理解+积极响应大厂对后训练数据要求，找各行业资深专家去搭建任务地图、设计题目、制定标准、质量把关等，以及搭建RL环境利用专家制作长程任务数据。
6. ---1是需要广泛的各行业专家网络资源（也就是为什么海外Mercer、Handshake是做AI招聘转型做这块的）；
7. 2是对大模型迭代下对后训练数据的标准和需求有理解（也就是为什么那么多国内模型厂有很多人出来创业做这个）。
8. ---1是在长程 agent 任务等需求在蒸馏数据的有效性在下降，导致数据预算 结构性往后训练数据转；
