孤本网
/ 0 阅读
0
0

四款前沿模型密集发布:GPT-6 Astra与Gemini 4 Argon分获工程与代理场景优势,价格差达5倍

一句话结论

Anthropic、OpenAI与Google在一个月内发布四款前沿模型,性能与价格呈现显著分化,选型需依据具体任务场景。

关键要点

  • OpenAI在30天内发布GPT-6 Astra与GPT-6.1 Sol,取消GPT-6.1 Astra,因其在9月28日未通过内部范围与授权测试。
  • GPT-6 Astra与Claude Fable 5.1每百万token输入/输出价格为10/50美元;GPT-6.1 Sol与Gemini 4 Argon入门价为2/10美元,后者缓存输入价格最低为0.10美元。
  • 基准测试中Gemini 4 Argon在DeepSWE v1.1(77.9%)与Vals Index(68.9%)领先;GPT-6 Astra在FrontierSWE v2(65.5%)与OSWorld-2.0(72.6%)领先。
  • 独立数据Artificial Analysis显示Claude Fable 5.1智能指数得分66(高于GPT-6 Astra的61),但单任务成本为9.18美元,是后者的1.9倍。
  • 访问限制存在差异:Gemini 4 Argon仅向Fairwind网络防御者开放;GPT-6 Astra高级安全能力需通过OpenAI Daybreak计划获取。

背景与事实

2026年9月1日至30日,Anthropic、OpenAI与Google DeepMind密集发布了四款前沿大模型。Claude Fable 5.1于9月1日由Anthropic发布;OpenAI于9月3日发布GPT-6 Astra;9月28日,OpenAI取消原计划发布的GPT-6.1 Astra,因其在当日未通过内部范围与授权测试;9月29日,OpenAI发布GPT-6.1 Sol;9月30日,Google DeepMind宣布Gemini 4 Argon。

四款模型在定价策略上差异显著。GPT-6 Astra与Claude Fable 5.1的标准价格为每百万token输入10美元、输出50美元;GPT-6.1 Sol与Gemini 4 Argon的入门价格为此价格的五分之一,即输入2美元、输出10美元。Gemini 4 Argon的价格结构较复杂,入门价之后会翻倍为4/20美元。在缓存输入价格方面,GPT-6 Astra每百万1.00美元,Claude Fable 5.1为0.25美元,GPT-6.1 Sol与Gemini 4 Argon均为0.10美元。针对超过272K token的长提示,GPT-6 Astra价格升至20/75美元;GPT-6.1 Sol输入价格加倍、输出增加1.5倍;Claude Fable 5.1则保持固定价格直至1M token。

上下文窗口与输出能力方面,GPT-6 Astra与GPT-6.1 Sol支持1.05M上下文,Claude Fable 5.1支持1M上下文,Gemini 4 Argon未披露具体数值。最大输出长度上,Gemini 4 Argon支持1M token,其余三款模型均支持128K token。在推理控制机制上,OpenAI的两款模型提供5档强度调节,Anthropic提供低、中、高等级,Google未披露相关参数。四款模型目前均不开放权重。

厂商报告的基准测试显示性能分化。在长程软件工程基准DeepSWE v1.1上,Gemini 4 Argon以77.9%领先,GPT-6 Astra为74.1%,Claude Fable 5.1为67.4%。在前沿软件工程基准FrontierSWE v2上,GPT-6 Astra以65.5%领先。在终端智能体基准Terminal-Bench 4.0上,OpenAI报告GPT-6 Astra得分为57.9%,而Google对比表中列出为58.2%,两者微幅领先。在漏洞修复基准CWE-bench v1上,GPT-6 Astra与Gemini 4 Argon并列68%。在计算机使用基准OSWorld-2.0上,GPT-6 Astra以72.6%领先。值得注意的是,GPT-6.1 Sol未出现在Google的对比表中。

影响分析

对于中文开发者与从业者而言,模型选型成本与场景匹配度是核心考量。分析判断表明,若项目预算有限且处理高流量编码代理、CI机器人及PR审查任务,GPT-6.1 Sol与Gemini 4 Argon的入门价格(2/10美元)具有显著优势,其缓存输入价格0.10美元更低。但若追求极致性能处理最难的开放式工程任务,GPT-6 Astra在FrontierSWE v2的领先优势(65.5%)值得支付5倍于入门模型的价格(10/50美元)。

在长编码会话场景中,Claude Fable 5.1虽然单任务成本高达9.18美元(GPT-6 Astra为4.72美元),差距约1.9倍,且Anthropic新分词器对相同文本产生多约30%的token消耗,但其在Claude Code中人工分析编码代理评分最高(70分,GPT-6 Astra为67分),且缓存读取费0.25美元较低,适合对编码智能体能力要求极高且容忍较高成本的团队。法律、金融及商业自动化场景建议优先评估Gemini 4 Argon,其在Vals Index(68.9%)、AutomationBench(51.3%)及Harvey Legal(19.6%)中领先。但需注意,Gemini 4 Argon目前仅向Fairwind网络防御者开放,且GPT-6 Astra的高级进攻性安全能力需通过OpenAI Daybreak计划获取,公开版本拒绝高级进攻性网络任务,这限制了部分安全研究场景的应用。

适用边界

上述结论基于厂商报告的基准测试数据与Artificial Analysis独立数据,不适用于未涵盖的特定领域任务(如多模态生成、非编码类科研模拟等)。价格与性能优势对比依赖于特定的token长度(如272K长提示阈值)与缓存状态,实际生产环境中若上下文长度波动大,成本结构可能偏离示例计算(如200K上下文下100步消耗成本:Astra 20.00美元,Fable 5.1 5.00美元,Sol与Argon 2.00美元)。访问限制条件(如Fairwind网络、Daybreak计划、受信任访问计划)意味着部分模型功能在公开渠道不可用,结论仅适用于已获授权的访问环境。四款模型均不开放权重,因此不适用于需要本地部署或权重微调的场景。

孤本观察

编辑判断认为,本次密集发布反映出前沿模型竞争已从单纯的性能比拼转向“性能-成本-访问权限”的三维定位。GPT-6 Astra保持顶级地位但价格高昂,Claude Fable 5.1以高成本换取编码代理优势,而GPT-6.1 Sol与Gemini 4 Argon通过低价切入高流量场景,这种分层策略将迫使企业根据任务关键性与预算进行精细化模型编排,而非单一模型通吃。

常见问题

GPT-6 Astra与GPT-6.1 Sol的每百万token输入/输出价格分别是多少?

GPT-6 Astra为输入10美元、输出50美元;GPT-6.1 Sol为输入2美元、输出10美元。

在FrontierSWE v2基准测试中,哪款模型得分最高,具体是多少?

GPT-6 Astra得分最高,具体为65.5%。

Gemini 4 Argon的访问限制是什么?

目前仅向Fairwind网络防御者开放。

Claude Fable 5.1与GPT-6 Astra的单任务成本对比如何?

Claude Fable 5.1单任务成本为9.18美元,是GPT-6 Astra(4.72美元)的1.9倍。

四款模型是否开放权重?

四款模型目前均不开放权重。

来源:MarkTechPost


评论