一句话结论
国内多家头部 AI 厂商因早期低质语料导致模型性能瓶颈,正集体重构预训练数据体系,以高质量数据治理替代单纯追求数据规模。
关键要点
- 多家国内基模厂商承认早期预训练混入大量网页垃圾与机器生成页,导致模型在评测中复现困难,被迫作废已训练版本并重启数据清洗。
- 业内流传的训练预算粗略拆解显示,在每投入 100 元 AI 训练成本中,约 40 元用于算力,30 元用于人才,20 元用于营销,仅 10 元用于数据,数据投入占比偏低。
- 高质量专家数据存在显著供需缺口,海外单条长程任务数据起价 1 至 2 万美金,而国内同类产品报价仅为 1 至 2 千元人民币,价格差异达数十倍。
- 部分模型厂商通过 API 中转站截留用户调用轨迹,以获取更接近真实任务的有效样本;Routing(模型路由)创业公司亦将沉淀异构模型数据视为核心资产。
- 头部基模公司数据专家指出,当前数据工程团队缺乏话语权,易陷入“只考核数据量不考核信息密度”的误区,需建立数据与预训练团队的双向互评机制。
背景与事实
过去大半年内,国内 AI 模型厂商密集启动“预训练返工”,核心动因并非算力不足或架构落后,而是数据质量缺陷。多位行业从业者指出,早期预训练普遍存在“数据量大即好”的认知误区,团队为凑齐数千亿乃至上万亿 token 语料库,大规模抓取网页垃圾、来源不明的清洗包,且缺乏成熟的标注筛选体系。头部基模公司数据专家赵翔向雷峰网表示,早期训练出的模型长期卡在 60 至 70 分水平,无法追上海外已达 90 分的模型,根源在于底层脏数据导致算力、资金与时间窗口三重浪费。
某模型厂商前高管王斌描述了一起典型案例:一家中部基模公司将整批爬取的技术博客灌入预训练语料,训练中期才发现其中相当比例为采集站的机器生成页,同一段落被重复数万遍,导致模型在评测集上出现不明原因的复读现象。团队定位问题时,已消耗数万次卡时,该版本最终作废重来。基元律动创始人王云鹤在接受媒体采访时强调,数据是机器学习的地基,数据不达标时,任何算法优化均无法弥补,且数据团队须对预训练团队拥有话语权,避免独立考核导致的混乱。
数据治理失当在头部厂商中亦有迹可循。有媒体曾报道,腾讯混元团队在早期数据治理中存在“标注规则定义不清,但验收线设定过高”的问题,团队为达标生产出大批无法使用的数据,叠加打榜数据与冗余数据污染,最终推倒重来并重新组建数据团队。赵翔进一步解释,大模型竞争的核心是数据的信息密度与干净程度,而非绝对体积。若考核机制仅盯着数据量,会诱导团队用垃圾数据凑数,数百 TB 脏数据注入后反而会导致模型能力退化甚至训练崩溃。
与此同时,传统互联网时代的场景数据壁垒在基模竞争中正逐渐失效。基模比拼的是通用能力,本地生活、社交、游戏、电商与搜索等单一场景数据的优势在通用能力上影响有限。基模公司算法负责人徐栋指出,即便如 Google 拥有海量场景数据,其基模表现也并非最优;相反,此前在数据上零积累的 Anthropic、OpenAI 反而冲得更猛。当前拉开差距的关键因素已转变为:算力储备、数据获取速度、数据质量以及将数据稳定转化为模型能力的管线成熟度。
影响分析
对中文开发者与从业者而言,数据工程正从辅助工种跃升为核心竞争岗位。多位 AI 猎头表示,当前市场极度缺乏数据清洗、数据管道搭建、数据工程及数据研究专业人才,这些岗位行情在最近时期才真正起步。开发者需建立新认知:数据团队不再是预训练的“后勤”,而是决定模型上限的“前场”。王云鹤提出的“数据团队对预训练团队有话语权”的机制设计,暗示未来 AI 组织架构中数据工程与算法工程的地位将趋于平等甚至更高。
预算结构的失衡将深刻影响从业者的职业路径选择。在 100 元训练预算中仅 10 元投向数据的现状下,数据岗位在薪资谈判中的话语权可能弱于算力与人才岗位。但这也意味着数据工程存在长期价值低估的红利:随着“数据飞轮”逻辑逐步落地,能沉淀高质量用户轨迹数据的团队将获得差异化优势。对于创业团队,API 中转站与 Routing 平台的数据截留模式提供了低成本获取真实任务样本的路径,但需警惕合规风险与技术壁垒的双重制约。
适用边界
上述结论主要适用于基模(Base Model)预训练阶段,不适用于后训练(Post-training)专家数据与 Agent 长程轨迹数据的获取场景。后训练数据的专业性与场景依赖性更强,其成本结构与供需矛盾与预训练语料清洗存在本质差异。此外,“数据飞轮”逻辑的验证仍需时间,当前“模型越强→用户越多→数据回流越多”的闭环尚未在多数厂商中真正跑通,受限于内部数据墙破除进度与外部高质量数据供给瓶颈。国内模型厂商在内生数据积累上亦面临特殊约束:AI Coding 领域市场份额被海外模型 Claude、Codex 占据,AI 办公产品能力处于初级阶段,覆盖的工作场景与复杂度有限,沉淀的轨迹数据仍较单薄,因此“场景数据壁垒失效”的结论在当前国内基模竞争语境下成立,但不可直接外推至垂直领域模型。
孤本观察
本文揭示的行业转向本质上是一场从“算力堆叠”到“数据密度”的范式迁移,其深层影响是 AI 工程化能力的重新定价。脏数据导致的返工成本远超算力采购本身,这意味着数据治理不再是可选项而是生存项;当行业开始为“一条专家数据”支付数十倍价差时,数据资产的稀缺性定价机制正在形成,这将重塑整个 AI 基础设施的价值分布。







![]()
![]()
![]()
![]()
![]()

![]()

常见问题
国内AI厂商早期预训练数据中混入的低质内容主要包括哪些?
早期预训练混入了大量网页垃圾、来源不明的清洗包以及机器生成页。
业内流传的每100元AI训练成本中,数据投入占比是多少?
在每投入100元AI训练成本中,仅10元用于数据。
海外与国内高质量专家长程任务数据的报价差异大致是多少?
海外单条长程任务数据起价1至2万美金,国内同类产品报价仅为1至2千元人民币,差异达数十倍。
腾讯混元团队在早期数据治理中遇到的具体问题是什么?
存在标注规则定义不清但验收线设定过高的问题,导致生产出大批无法使用的数据,最终推倒重来。
国内模型厂商在AI Coding领域的市场份额被哪些海外模型占据?
国内模型厂商在AI Coding领域的市场份额被海外模型Claude、Codex占据。
来源:雷峰网