一句话结论
xAI 以低价策略推出 Grok 4.7,但其多项基准测试成绩明显落后于 Claude Fable 5.1 和 GPT-6。
关键要点
- Grok 4.7 定价为每百万输入令牌 2 美元、每百万输出令牌 6 美元,价格更接近中国模型而非西方前沿模型。
- 在 Artificial Analysis Intelligence Index v4.3.2(综合十项基准)中,Grok 4.7 得分为 46 分,位列中游;Claude Fable 5.1 和 GPT-6 均以 53 分领先。
- 在终端智能体编程基准 Terminal-Bench 4.0 上,Grok 4.7 仅得 26%,低于 GPT-6 Astra 的 60%、Claude Fable 5.1 的 55%,甚至低于 DeepSeek V4.1 Flash 的 27%。
- 该模型通过 Grok API、Cursor 和 Grok Build 三个渠道提供访问。
背景与事实
xAI 于近期正式推出其迄今能力最强的模型 Grok 4.7,定位为面向编程与知识工作的旗舰产品。公司表示,该模型基于更大的基础模型构建,采用更长的强化学习训练流程,并特别设计了自我验证输出能力的机制,以提升回答的可靠性。在定价方面,xAI 将输入令牌价格定为每百万 2 美元,输出令牌每百万 6 美元。这一价格水平与当前中国市场的同类模型更为接近,而非与其西方竞争对手的前沿模型定价接轨。
在第三方独立评测平台 Artificial Analysis 发布的 Intelligence Index v4.3.2 中,该指数综合了十项基准测试。Grok 4.7 最终获得 46 分,处于整体排名中游位置。作为对比,Claude Fable 5.1 和 GPT-6 分别以 53 分的成绩位列前茅,两者之间形成了 7 分的明显差距。
差距在智能体编程领域进一步扩大。在 Terminal-Bench 4.0 测试中,Grok 4.7 的完成率为 26%。相比之下,GPT-6 Astra 达到 60%,Claude Fable 5.1 为 55%,而价格更低的 DeepSeek V4.1 Flash 也达到了 27%,略高于 Grok 4.7。这一结果表明,即便在 xAI 重点投入的编程场景中,其最新模型仍未达到竞争头部水平。目前,开发者可通过 Grok API、Cursor 集成环境以及 Grok Build 平台调用该模型。
影响分析
对中文开发者而言,Grok 4.7 的发布提供了一个新的低价选项,尤其适合对成本敏感、对极端基准性能要求不高的日常编码和知识检索任务。然而,分析判断认为,在需要高可靠性智能体编程的场景下,由于其在 Terminal-Bench 4.0 上仅 26% 的表现,Grok 4.7 可能无法替代 GPT-6 或 Claude Fable 5.1 作为核心生产工具。其低价优势能否转化为实际市场份额,取决于用户对其自我验证机制在实际工程中的稳定性信任度。
对于国内从业者,DeepSeek V4.1 Flash 在价格更低的情况下仍略胜 Grok 4.7 的现象值得关注,这暗示了国产模型在性价比竞赛中的实际竞争力。开发者在选型时可能需要将基准测试成绩与实际业务场景需求分离评估,避免单纯依据指数排名做出决策。
适用边界
本结论基于 Artificial Analysis Intelligence Index v4.3.2 和 Terminal-Bench 4.0 的测试结果,可能不适用于未包含在这些基准中的特定领域任务(如多模态理解或超长上下文处理)。若 xAI 后续更新模型参数或训练数据,当前的性能差距评估可能失效。此外,价格优势假设竞争对手维持当前定价不变,若西方前沿模型下调价格,Grok 4.7 的成本竞争力将被削弱。
孤本观察
Grok 4.7 在强化学习时长增加和自我验证机制升级后,基准成绩仍未能超越价格更高的 DeepSeek V4.1 Flash,这可能反映出架构或数据层面的瓶颈而非单纯的训练资源问题。编辑判断认为,xAI 此次定价策略更像是一种市场防守而非进攻,试图以价格换取用户留存,而非通过性能突破重建技术领先形象。

![]()


常见问题
Grok 4.7的输入和输出令牌价格各是多少?
每百万输入令牌2美元,每百万输出令牌6美元。
在Artificial Analysis Intelligence Index v4.3.2中,Grok 4.7与Claude Fable 5.1及GPT-6的得分差距是多少?
Grok 4.7得46分,Claude Fable 5.1和GPT-6均得53分,差距为7分。
在Terminal-Bench 4.0基准测试中,Grok 4.7的完成率是多少?
Grok 4.7在Terminal-Bench 4.0上的完成率为26%。
开发者可以通过哪些渠道访问Grok 4.7模型?
可通过Grok API、Cursor和Grok Build三个渠道提供访问。
DeepSeek V4.1 Flash在Terminal-Bench 4.0中的成绩是否高于Grok 4.7?
是的,DeepSeek V4.1 Flash达到27%,略高于Grok 4.7的26%。
来源:The Decoder