一句话结论
xAI Grok 4.6 于 2026 年 8 月 18 日在 Amazon Bedrock 上线,提供 50 万 Token 上下文及四级推理力度,强化长时智能体场景应用。
关键要点
- 该模型提供 50 万 Token 上下文窗口,支持 low、medium、high、xhigh 四级可配置推理力度。
- 在 High 基准数据中,Grok 4.6 的 AA Intelligence Index 得分为 61,CursorBench v3.2 得分为 69.9%。
- bedrock-mantle 端点仅支持 us-west-2 区域推理,但支持结构化输出;bedrock-runtime 支持全球跨区但不支持结构化输出。
- Standard 层级输入价格为每百万 Token 2 美元,Priority 层级费率为 1.75 倍,Flex 层级费率为 0.5 倍。
- 缓存输入按标准输入价约四分之一计费,生产环境建议使用 aws-bedrock-token-generator 包生成短期 Bearer 令牌。
背景与事实
xAI 于 2026 年 8 月 18 日正式在 Amazon Bedrock 平台上线 Grok 4.6 模型。这是 XAI 在该平台上线的第二个模型,此前该平台已接入其前代模型。此次发布的核心特性包括 50 万 Token 的超大上下文窗口,以及支持 low、medium、high、xhigh 四个层级的可配置推理力度,允许开发者根据任务复杂度动态调整模型的计算资源分配。该模型基于 Grok 4.5 开发,技术优化重点侧重于长时运行智能体(Long-running Agents)与视觉交互场景。优化过程通过重新生成监督微调轨迹(Supervised Fine-Tuning Trajectories)及强化学习(Reinforcement Learning)实现。在安全方面,该模型在部署前经过严格测试及第三方评估,旨在优化包括漏洞修补在内的安全性场景表现。
关于性能数据,XAI 于 2026 年 8 月 12 日发布了 High 基准测试结果。数据显示,Grok 4.6 的 AA Intelligence Index 评分为 61,GDPVal-AA v2 评分为 1753。在编程与智能体基准中,CursorBench v3.2 得分 69.9%,DeepSWE v1.1 得分 65.9%,FrontierCode v1.1 扩展版得分 61.3%,APEX-Agents 得分 57.5%,Terminal-Bench v3.0 得分 26%,APEX-SWE 得分 56.4%,AA-Briefcase 得分 1577,Harvey LAB 得分 15.8%。
在端点架构与功能限制方面,该模型支持 bedrock-mantle 和 bedrock-runtime 两种端点。bedrock-mantle 端点(模型 ID:xai.grok-4.6)仅支持美国西部 us-west-2 区域的推理服务。该端点支持客户端工具调用、结构化输出、提示缓存、响应流、项目及滥用检测功能。相比之下,bedrock-runtime 端点(模型 ID:us.xai.grok-4.6 或 global.xai.grok-4.6)支持地理跨区(覆盖 us-east-1/2、us-west-1/2)及全球跨区(覆盖 30 多个区域)推理。该端点支持工具调用、提示缓存、响应流、调用日志及默认项目,但不支持结构化输出、服务器端工具使用及智能提示路由。此外,该模型兼容 Converse API、Chat Completions 及 Responses 接口,但不支持 Invoke API、音频、语音、视频、嵌入及图像生成功能。
在定价策略上,Standard 层级按 Token 付费。Priority 层级费率为 Standard 层级的 1.75 倍,Flex 层级费率为 Standard 层级的 0.5 倍。XAI 官方起步价为每百万输入 Token 2 美元、每百万输出 Token 6 美元,快速版本价格翻倍。在跨区推理中,global 端点的输入价格分别为跨区 2.20 美元/百万令牌和全球 2.00 美元/百万令牌。提示缓存方面,缓存输入按标准输入价的约四分之一计费。在 IAM 权限配置上,bedrock:InvokeModel 权限需匹配推理配置文件和基础模型 ARN。若使用 OpenAI 兼容端点,需额外添加 bedrock:CallWithBearerToken 权限;使用 boto3 Converse 依赖 AWS 凭证 SigV4 签名。长期 API Key 仅限探索阶段使用,生产环境建议使用 aws-bedrock-token-generator 包生成短期 Bearer 令牌,并在使用后删除密钥以规避账户暴露风险。
影响分析
对于中文开发者与企业从业者而言,Grok 4.6 在 Amazon Bedrock 的上架意味着多了一家第三方大模型厂商进入 AWS 云服务生态。这一变化对开发者的直接影响在于技术选型灵活性的提升。此前,AWS Bedrock 主要聚焦于 Anthropic、Amazon 自家及 AI21 等模型,xAI 的接入打破了单一供应商依赖。50 万 Token 的上下文窗口对于处理长文档分析、大规模代码库重构及长期记忆型智能体开发具有实际价值,开发者无需再分片处理上下文,从而降低了应用架构的复杂度。
从成本与合规角度分析,Amazon Bedrock 的统一账单体系使得预算控制更加透明,而四级推理力度的配置允许团队在延迟敏感型场景(如实时交互)与成本敏感型场景(如离线批处理)之间进行精细权衡。然而,开发者需注意端点功能的差异:若业务依赖结构化输出(如 JSON Schema 校验),则受限于 us-west-2 区域的 bedrock-mantle 端点,这可能增加全球业务部署的数据延迟与合规考量;若需要调用日志审计,则需使用 bedrock-runtime 端点,但需接受其不支持结构化输出的限制。这一架构差异要求团队在系统设计初期进行明确的端点规划,避免后期迁移成本。
适用边界
本结论及功能描述基于 2026 年 8 月 18 日发布的版本,不适用于通过其他云平台(如 Azure OpenAI、Google Vertex AI)访问 XAI 模型的场景,因各平台功能支持、定价及区域可用性存在差异。bedrock-mantle 端点的结构化输出功能严格限制在 us-west-2 区域,对于要求数据驻留(Data Residency)在其他 AWS 区域的欧洲或亚洲合规场景不适用。由于该模型不支持音频、语音、视频及图像生成,任何涉及多模态非文本处理(如视频摘要、语音转写)的业务流程不能依赖此模型,需结合其他专用模型实现。此外,长期 API Key 的安全建议不适用于短期测试或本地开发调试场景,这些场景下使用静态密钥的风险可接受度较高,但生产环境严禁此操作。
孤本观察
编辑观察到,xAI 在 Bedrock 的布局呈现出“功能割裂”特征,将高价值但受区域限制的结构化输出与高可用性的全球端点分离,这种设计虽提升了底层架构灵活性,但可能增加应用集成的逻辑复杂度,值得开发者警惕。同时,通过 aws-bedrock-token-generator 强制短期令牌的实践,反映了云厂商在模型服务安全层面的收紧趋势,静态密钥的逐步淘汰已成行业共识。
常见问题
Grok 4.6 在 High 基准测试中的 AA Intelligence Index 和 CursorBench v3.2 得分分别是多少?
AA Intelligence Index 得分为 61,CursorBench v3.2 得分为 69.9%。
bedrock-mantle 与 bedrock-runtime 端点在结构化输出支持上有哪些主要差异?
bedrock-mantle 支持结构化输出但仅限 us-west-2 区域;bedrock-runtime 支持全球跨区推理,但不支持结构化输出。
使用 Grok 4.6 时,Priority 和 Flex 层级的费率相对于 Standard 层级分别是多少倍?
Priority 层级费率为 Standard 层级的 1.75 倍,Flex 层级费率为 Standard 层级的 0.5 倍。
生产环境中建议如何使用 API 密钥以规避账户暴露风险?
建议不长期使用 API Key,而是使用 aws-bedrock-token-generator 包生成短期 Bearer 令牌,并在用后删除密钥。