当全球目光聚焦在预训练模型的参数竞赛时,一个更隐秘的瓶颈正在浮现:后训练数据的匮乏。所谓后训练,指的是模型在完成预训练之后,通过指令微调、人类反馈对齐等环节,被“调教”成听话、好用、懂规矩的可用产品。然而,高质量的后训练数据在中国市场长期稀缺,这催生了一批专门“造数据”的新玩家。 这些玩家的路线并非同质化竞争。梳理下来,大致可分为四条路径: 第一条是专家数据路线。这类公司直接向垂直领域的资深从业者采购经验和决策过程,将医生的诊断逻辑、律师的推理链条、工程师的调试思路转化为结构化的训练语料。难点在于如何让专家愿意持续产出,以及如何将模糊的经验转化为机器可读的格式。 第二条是Benchmark路线,即构建评测基准。这类玩家不直接提供训练数据,而是设计一套“考卷”来检验模型的能力边界。他们为模型的进步提供标尺,同时也为训练数据的质量提供反向验证。问题在于,考卷的更新速度是否能跟得上模型进化的速度,一旦滞后,就失去了参考价值。 第三条是RL环境路线,聚焦于强化学习所需的交互环境。大模型需要在实际场景中试错、被反馈、再调整,而这类公司构建高仿真的模拟环境,让模型在虚拟世界中进行“社会历练”。这条路线对工程能力和场景理解的要求极高,但也是护城河最深的方向。 第四条是合成数据路线。利用模型生成数据来训练模型,在数学推理、代码生成等领域,合成数据可以绕开人工标注的成本和隐私风险。但挑战同样明显:合成数据的多样性不足容易导致模型坍缩,如何控制质量和分布是核心技术难题。 值得注意的是,这些玩家的团队背景与商业模式呈现出明显分野。有的脱胎于高校实验室,以技术驱动见长;有的则带有浓厚的产业背景,深谙客户需求。商业化路径也各不相同:按量计费的订阅服务、定制化的项目制交付,或是与云厂商深度捆绑。 一个值得关注的信号是,这条赛道上的玩家大多刻意保持低调,鲜少出现在公众视野中。他们的客户,多是头部大模型公司,服务内容高度定制化,因此整体赛道呈隐性增长态势。 从宏观视角看,后训练数据的产业化和细分化,本身就标志着中国AI行业正在从“大力出奇迹”的暴力阶段,进入精耕细作的后工业化时代。谁能为模型提供更优质的“养成系”土壤,谁就有望在下一轮大模型竞赛中占据制高点。
