一句话结论
AWS 推出开源通用智能体框架 Strands Harness,在保持同等准确率前提下将 Token 成本降低 28%。
关键要点
- 提供 Python 和 TypeScript 双语言支持,采用 Apache 2.0 开源协议,可通过一行代码快速初始化智能体。
- 在 6 项基准测试中,对比 Claude Code 等竞品,平均成本降低 28%,准确率接近持平。
- 在 Terminal-Bench 2.1 测试中,使用 Claude Fable 5 模型时成本为 56.29 美元,准确率为 69.7%。
- 内置上下文管理规则,包括缓存提示词、压缩长上下文、保留关键状态,显著驱动 Token 效率提升。
- 支持本地运行及一键生成 AWS、GCP、Azure、Cloudflare 和 Modal 云部署配置。
背景与事实
亚马逊云科技(AWS)的 Strands Agents 团队近期发布了名为 Strands Harness 的开源项目。该项目旨在解决开发者在将智能体构想从 Claude Code 或 Codex 等封闭环境迁移至自有代码循环时遇到的困难。Strands Harness 并非针对编码场景优化,而是一个通用的智能体框架,将 Strands Harness SDK 中原本分散的循环、工具、上下文处理、内存及恢复机制打包为可工作的默认配置。用户通过 `create_harness()` 函数即可初始化智能体,支持连接 Amazon Bedrock、Anthropic、OpenAI、Google、Ollama 或 LiteLLM 等多个模型服务。
在性能评估方面,Strands Agents 团队在 Amazon EC2 上使用了 Terminal-Bench 创作者提供的 Harbor 评估框架进行分布式基准测试。测试涵盖 ALFWorld、ContextBench、GAIA、WebShop、τ²-bench 和 Terminal-Bench 2.1 六个基准。数据显示,在运行相同的 Claude 或 GPT 模型时,Strands Harness 的平均成本比其他框架低 28%,且准确率几乎持平。值得注意的是,图表中得分最高的点是运行在 Strands Harness 上的 Claude Opus 5,准确率接近 85%。尽管 DeepSeek Harness 在 Token 效率上表现更佳(比 Strands Harness 便宜约 14%),但其在所有基准测试中的得分均较低。
针对明确的对抗测试,团队使用了 Terminal-Bench 2.1 和 Claude Fable 5 模型,每种框架运行 89 次。结果显示,Strands Harness 成本为 56.29 美元,准确率为 69.7%;相比之下,Claude Code 成本高达 248.05 美元,准确率仅为 61.8%。这意味着 Strands Harness 比 Claude Code 便宜 77%,且准确率高出 7.9 分。另一框架 Oh-my-pi 虽然准确率相同(69.7%),但成本高出 54%。该团队指出,上下文管理是驱动 Token 效率和准确率提升的主要因素,其内置的三条规则包括提示词缓存、长上下文压缩及关键状态保留,这与近期关于 HarnessTax 的独立研究结论一致,即框架选择对成功率影响较小,而相同模型在不同框架下成本差异可达 5 倍。
影响分析
对于中文开发者而言,Strands Harness 的发布降低了构建生产级智能体的技术门槛。由于该项目采用 Apache 2.0 协议并支持主流云服务商,企业无需担心许可证合规性问题,可直接在现有云基础设施上部署。更重要的是,其“本地原型与生产环境一致性”的设计意味着开发者可以在笔记本电脑上通过 CLI 工具使用自然语言快速原型验证,随后通过 `/export` 命令生成包含特定 MCP 服务器配置的 Python 或 TypeScript 代码包,直接嵌入生产系统。这种工作流大幅缩短了从实验到上线的周期。分析认为,对于预算敏感且需要控制推理成本的团队,Strands Harness 提供的默认优化策略(如上下文管理)具有显著的经济学价值,尤其在使用高成本旗舰模型时,28% 的成本削减能直接转化为运营利润。
适用边界
该结论主要适用于需要构建通用型智能体、且追求成本效益最大化或希望摆脱单一编码工具链限制的场景。如果开发者的核心需求是极度复杂的代码重构、特定编程语言深度补全,或已在 Claude Code 等封闭生态中建立了高度定制化的工作流,迁移至 Strands Harness 可能不会带来显著优势,甚至可能因学习曲线增加短期开发负担。此外,尽管 Strands Harness 在成本上优于 Claude Code,但它在绝对 Token 效率上仍不及 DeepSeek Harness,若极端成本敏感且对准确率容忍度较高,后者可能是更优选择。
孤本观察
Strands Harness 将“框架本身”抽象为一种可部署的产品而非仅仅是代码库,这种策略试图在模型能力趋同的当下,通过基础设施层的优化来构筑差异化竞争力。
常见问题
Strands Harness 的开源协议和语言支持是什么?
采用 Apache 2.0 开源协议,支持 Python 和 TypeScript 双语言,可通过一行代码快速初始化智能体。
在 Terminal-Bench 2.1 测试中,Strands Harness 相比 Claude Code 的成本和准确率表现如何?
使用 Claude Fable 5 模型时,Strands Harness 成本为 56.29 美元,准确率 69.7%;Claude Code 成本 248.05 美元,准确率 61.8%。
Strands Harness 支持连接哪些模型服务和云部署平台?
支持连接 Amazon Bedrock、Anthropic、OpenAI、Google、Ollama 或 LiteLLM;可一键生成 AWS、GCP、Azure、Cloudflare 和 Modal 部署配置。
Strands Harness 平均成本降低 28% 是基于哪些基准测试得出的?
基于 ALFWorld、ContextBench、GAIA、WebShop、τ²-bench 和 Terminal-Bench 2.1 这 6 项基准测试,对比 Claude Code 等竞品得出。
如果极致追求 Token 效率且能容忍较低准确率,哪个框架比 Strands Harness 更便宜?
DeepSeek Harness。它比 Strands Harness 便宜约 14%,但在所有基准测试中的得分均较低。
来源:MarkTechPost