孤本网
/ 0 阅读
0

阿里、字节与DeepSeek豪赌10万亿参数模型,算力军备竞赛加剧现金流压力

一句话结论

国产头部厂商集体冲击10万亿参数大模型,引发算力基建与现金流的高强度对赌。

关键要点

  • 阿里CEO吴泳铭在云栖大会披露,新一代模型参数规模计划介于5万亿至10万亿之间。
  • DeepSeek创始人梁文锋近期表示,公司下一步计划将模型参数规模推至8万亿,目前正训练约2万亿参数新模型。
  • 字节跳动2026年资本开支上限最高可达700亿美元,约为上一年三倍,且2027年可能冲至1000亿美元。
  • 阿里2026年第二季度单季资本开支达677亿元,同比大增75%,自由现金流由正738亿元骤转为负466亿元。
  • 阿里云计划到2032年运营全球数据中心规模超过20GW,较当前约3—4GW的已上线容量扩大5倍以上。

背景与事实

9月22日举办的云栖大会上,阿里巴巴正式将大模型的“大参数”路线重新摆上台面。阿里首席执行官吴泳铭在现场披露,公司正准备训练参数规模介于5万亿至10万亿之间的新一代人工智能模型。随后,阿里ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒补充指出,缩放定律是迈向超级人工智能的关键路径,未来Qwen4.5、Qwen5的参数规模计划迈向5万亿到10万亿。这一表态与两个月前的行业动向形成呼应。8月,英国《金融时报》援引知情人士称,字节跳动正在训练一个最高可达10万亿参数的大模型。与此同时,据The Information报道,深度求索(DeepSeek)目前正在训练一个约2万亿参数的新模型;其创始人梁文锋在近期的一场投资者会议上明确表示,公司下一步计划继续把模型推到8万亿参数。

参数作为大模型的“脑容量”,其规模直接决定了模型推理计算时调用的经验权重总量。目前,国产已发布模型的参数顶点是月之暗面7月推出的Kimi K3,其总参数为2.8万亿,是全球首个开源的3万亿级别模型。相比之下,阿里当前旗舰Qwen 3.8-Max约为2.4万亿参数,深度求索现役V4-Pro为1.6万亿参数。若将视线转向海外,闭源阵营的参数规模更高,业内估计Anthropic的Mythos 5约8万亿参数,Fable 5约5万亿参数。这意味着国产已发布模型的参数顶点,距离海外估计的头部水平,还差着一到两倍的身位。而若以10万亿为靶心,各家现役旗舰普遍还要再放大约5倍。

支撑“越大越好”观点的逻辑指向缩放定律,即在模型、数据、算力三者同步放大时,模型能力会随之提升。然而,缩放定律并非无限有效,在参数变大的同时,数据量和算力必须同比例跟上,且必须是高质量数据。到了万亿级别,单纯堆参数带来的边际回报明显递减。此外,实际使用中参数大也不等于“好用”,模型越大,推理越慢,用户等待时间拉长,推理成本水涨船高。因此,真正的分水岭在于算力效率,即单位算力能换回多少智能。

影响分析

对中文开发者与从业者而言,这场参数竞赛意味着技术路线的分化与资源门槛的急剧抬升。首先,MoE架构成为平衡成本与性能的关键工具。如Kimi K3总参数2.8万亿,但用了MoE架构,896个专家每次只激活16个,实际激活参数仅约1040亿。这种架构将总参数和实际调用参数彻底解耦,使得厂商可以用同一套底座,同时押注小而快与大而强两条路线。对于开发者,这意味着未来调用大模型API时,不同参数规模与激活策略将直接决定延迟与成本结构,技术选型需更精细地匹配场景。

其次,资金压力可能加速行业洗牌。当算力效率成为决定性因素,缺乏足够资本开支支撑的中小模型厂商将难以跟进10万亿级别的竞赛。阿里过去5个季度中有4个季度自由现金流为负,字节跳动今年上半年净利润同比下降个位数百分比,至约200亿美元。这种高强度投入意味着大模型厂商必须持续依赖外部融资或消耗巨额现金流,行业集中度将进一步提高,资源向头部厂商倾斜,中小开发者获取低成本、高性能模型的路径可能更加依赖于头部厂商开放的轻量级模型或效率优化方案。

适用边界

本文结论基于2025年9月的公开信息与行业预估,主要适用于评估当前头部厂商的战略动向及短期内的算力投入趋势。若未来高质量数据获取成本大幅下降,或出现革命性的训练算法突破使得10万亿参数无需等比例算力支撑,则“边际递减”与“高成本”的结论可能不成立。此外,海外厂商如Anthropic、OpenAI的最新进展未包含在内,若其参数规模或推理成本发生剧烈变动,国产厂商的相对身位评估需相应修正。对于非技术场景或仅需轻量级推理的业务,本文强调的10万亿参数竞赛直接影响有限。

孤本观察

从“成本革命”的Flash系列模型到“能力上限”的10万亿参数争夺,行业打法正在从单一追求参数规模转向算力效率与场景覆盖的精细化博弈。大参数模型争的不是当下体验,而是下一代模型的入场券,这种对能力上限的执念虽能定义行业排位,但也使得算力基建的投入成为一种停不下来的军备竞赛,其最终成本将由整个生态链共同承担。

阿里、字节与DeepSeek豪赌10万亿参数模型,算力军备竞赛加剧现金流压力

常见问题

阿里新一代模型与DeepSeek下一步计划的参数规模分别是多少?

阿里新一代模型参数计划介于5万亿至10万亿之间;DeepSeek目前训练约2万亿参数模型,下一步计划推至8万亿。

字节跳动2026年资本开支上限及2027年潜在水平是多少?

字节跳动2026年资本开支上限最高可达700亿美元,约为上一年三倍;2027年可能冲至1000亿美元。

阿里2026年第二季度资本开支是多少,自由现金流发生了何种变化?

阿里2026年第二季度单季资本开支达677亿元,同比增长75%;自由现金流由正738亿元骤转为负466亿元。

目前国产已发布模型中参数规模最大的是哪个,具体是多少?

国产已发布模型参数顶点是月之暗面7月推出的Kimi K3,总参数为2.8万亿。

Kimi K3采用MoE架构时,总参数与实际激活参数分别是多少?

Kimi K3总参数为2.8万亿,使用MoE架构,896个专家每次只激活16个,实际激活参数仅约1040亿。

来源:钛媒体