孤本网
/ 0 阅读
0

谷歌TPU v7推理Kimi K3性能超英伟达GB200 57%

一句话结论

谷歌TPU v7配合Inferact的megakernel内核与DSpark框架,推理Kimi K3速度超英伟达GB200达57%。

关键要点

  • 16块TPU v7跑Kimi K3达709 token/s,16块GB200仅452 token/s,提速57%。
  • Inferact用Pallas手写megakernel,将92层MoE计算合并为单程序,消除kernel切换带宽浪费。
  • TPU v7单TensorCore配64 MiB片上VMEM由软件管理,支持跨层权重预取,GPU侧Blackwell片上内存仅约38 MiB且由硬件自动调度。
  • 裸速下batch size 1时TPU为249 token/s,GB200为127 token/s;放大到batch size 8时TPU达865 token/s,GB200为636 token/s。
  • Inferact由vLLM原班团队创立,2026年1月成立,获a16z领投1.5亿美元种子轮,估值8亿美元,代码已开源。

背景与事实

此次性能对比由推理创业公司Inferact完成,测试条件为16块谷歌TPU v7 Ironwood对阵16块英伟达GB200,均运行Kimi K3模型,使用vLLM推理引擎,唯一变量为芯片硬件与底层kernel实现。测试中TPU在启用DSpark推测解码时输出速率达每秒709个token,GB200为每秒452个token。DSpark是DeepSeek提出的推理加速框架,其原理由小模型先猜测候选token序列,再由大模型批量验证,平均acceptance length达到6,即每轮猜出的token中平均有6个直接通过验证,单步decode耗时约8.5毫秒。关闭推测解码后,TPU裸速仍显著领先,batch size为1时TPU输出249 token/s,GB200仅127 token/s;batch size为8时TPU输出865 token/s,GB200输出636 token/s。

在另一组测试中,Inferact使用4块TPU v7运行Qwen 3.8 27B模型,输出速率为每秒1515个token,相同配置的GB200仅达到每秒695个token。精度验证方面,Inferact采用greedy decoding方式确认Kimi K3在TPU上的GPQA-Diamond得分为94.4%,GSM8K得分为97.2%,与GPU端结果完全一致,表明提速未造成精度损失。值得注意的是,TPU v7的HBM带宽为7380 GB/s,低于GB200的8000 GB/s,然而TPU速度反而更快,说明性能差距并非源于硬件带宽,而是来自芯片上方软件层的优化。

Inferact的核心技术是megakernel方案,针对Kimi K3的92层MoE计算结构,使用Pallas语言将整个前向传播逻辑写入单个程序,使跨层权重预取成为可能。第N层计算MoE时,第N+1层的attention权重已从HBM向片上缓存搬运,计算与数据搬运并行执行,内存带宽几乎无空转。TPU v7每个TensorCore配备64 MiB片上VMEM,生命周期由软件精确控制,容量足以同时容纳当前层计算数据与下一层预取权重。相比之下,英伟达Blackwell架构的片上内存分散在152个SM中,总量约38 MiB,由硬件自动调度,跨层编排受限。Inferact绕过TPU默认编译工具链XLA,因其跨92层调度分支过多,自动优化无法找到最优解;手写Pallas代码使编译耗时从30分钟以上降至90秒以内。该优化代码已通过tpu-megakernels仓库开源,是Inferact与Google Cloud联合工程合作的成果,双方目标是让TPU成为vLLM的一流支持对象。

影响分析

对中文开发者与从业者而言,这一结果具有直接的工程参考价值。首先,在自建大模型推理服务时,若选择谷歌TPU v7硬件平台并采用vLLM引擎,结合Inferact开源的megakernel内核与DSpark推测解码框架,可在不牺牲精度的前提下显著提升Kimi K3等模型的吞吐率。其次,TPU与GPU之间57%的性能差距并非由硬件带宽决定,而是由软件层kernel组织方式决定,这意味着现有基于英伟达GPU优化的推理方案迁移至TPU时需重新设计底层内核,不能简单复用CUDA代码。第三,Inferact团队由vLLM核心开发者组成,其开源代码与上游vLLM社区紧密集成,降低了国内团队接入TPU推理栈的学习成本与适配门槛。第四,编译耗时从30分钟降至90秒的工程实践,对需要频繁迭代kernel调优的团队具有显著的效率提升意义,尤其在模型架构更新频繁的预研场景中。

适用边界

该性能优势仅在特定条件下成立:首先,megakernel目前为Kimi K3的92层MoE结构定制,更换模型架构需重新适配,不适用于任意模型直接开箱即用;其次,测试基于16块TPU v7 Ironwood与16块GB200的对称配置,实际部署中若TPU与GPU数量、互联拓扑不同,性能差距可能发生变化;第三,DSpark推测解码的6 token acceptance length依赖于小模型与大模型的匹配度,若更换底层模型组合,加速比可能波动;第四,该测试未覆盖多机分布式推理场景,单机16卡的结果不能直接外推至集群环境;第五,精度验证仅覆盖Kimi K3在GPQA-Diamond与GSM8K两项基准,未涉及多模态或其他领域任务,不能保证所有推理场景精度完全一致。

孤本观察

本次对比中TPU带宽低于GB200却速度更快,揭示了一个易被忽视的事实:大模型推理的瓶颈已从硬件算力与带宽转向软件调度粒度,内核组织方式正在成为芯片性能的实际决定变量,这对业界长期形成的“看带宽定推理速度”的直觉构成了直接挑战。

常见问题

16块TPU v7和16块GB200在推理Kimi K3时的具体吞吐量分别是多少?

16块TPU v7达709 token/s,16块GB200仅452 token/s。

TPU v7的片上VMEM容量及管理模式与英伟达Blackwell GPU有何区别?

TPU v7单TensorCore配64 MiB VMEM由软件管理;Blackwell片上内存约38 MiB且由硬件自动调度。

使用Inferact手写Pallas代码后,模型编译耗时发生了怎样的变化?

编译耗时从使用默认工具链XLA的30分钟以上降至90秒以内。

Inferact公司何时成立,获得的种子轮融资金额及估值是多少?

2026年1月成立,获a16z领投1.5亿美元种子轮,估值8亿美元。

该性能对比测试中,TPU与GPU在精度验证上表现是否一致?

完全一致,Kimi K3在TPU上的GPQA-Diamond和GSM8K得分与GPU端结果相同。

来源:量子位