如今,AI 智能体已在生产环境中运行,每日操作规模达到数十亿次,一种反复出现的架构模式也随之浮现:智能体需要一个计算“草稿纸”。这不仅适用于编码任务,也适用于数据聚合、分析、验证,以及任何仅靠语义推理不足以完成的工作流。
Abnormal AI 是一家行为安全服务提供商,为超过 25% 的《财富》500 强企业提供防护。该公司已部署 Amazon Bedrock AgentCore Code Interpreter(Amazon Bedrock AgentCore 的一项能力),用于支撑其实时内联邮件威胁检测的智能体。这些系统目前已在生产环境中运行,处理数十亿封邮件,并以同等规模执行由智能体驱动的代码,在威胁进入收件箱之前就将其内联检测并拦截。
这项工作也是 Abnormal AI 构建软件方式的一部分。目前,该公司 80% 的代码变更在某种程度上借助智能体完成,40% 由后台智能体端到端构建(完全由 AI 构建,而非 AI 辅助)。他们将 AgentCore Code Interpreter 用于威胁检测,正体现了这种 AI 原生方法在生产运行时中的应用。
在本文中,我们分享 Abnormal AI 如何架构这些系统、其沙箱方案背后的设计决策,以及为大规模部署 Code Interpreter 的构建者提供的实践经验。
什么是 Amazon Bedrock AgentCore Code Interpreter?
Amazon Bedrock AgentCore Code Interpreter 为智能体动态执行代码提供了一个完全托管、无服务器的运行时。其主要特性包括:
- 临时 MicroVM 会话:生存时间可配置,从 15 分钟(默认)到 8 小时,以支持长时间运行的任务。
- 安全性:会话在安全沙箱中运行,在主机操作系统层面完全隔离,旨在帮助防止会话之间发生意外泄露。
- 灵活网络:可配置为沙箱虚拟私有云(VPC)模式,或接入公共互联网。
- 文件处理:通过 API 直接处理最大 100 MB 的文件,或连接 Amazon Simple Storage Service(Amazon S3)以处理更大数据集。
- 预加载运行时:提供 Python 和 Node.js 环境,并预装常用的可视化、统计和数据处理库。
- 内置可观测性:日志发送至 Amazon CloudWatch 和 AWS CloudTrail,便于监控。
关键在于,Code Interpreter 以 API 形式对外提供。这意味着它不规定智能体的工作流,而是提供一个“盒子”,智能体可以在其中运行命令、上传文件并获取结果。对于已有智能体基础设施的团队来说,这种即插即用的设计让集成变得直接。
为什么智能体需要一个计算“草稿纸”
大语言模型(LLM)擅长推理和语义连贯,但许多现实世界的操作并不属于语义推理范畴:
- 基础数学与计数:“过去一小时我们检测到多少封钓鱼邮件?”这需要计算,而不是语言生成。
- 数据处理与可视化:将原始数据转换为图表、PDF 或结构化报告。
- 代码验证:运行单元测试、代码检查(linting)和集成测试,以验证智能体生成的输出。
通过将大语言模型与 Code Interpreter 配合使用,可以增强智能体的能力,使其超越仅靠推理所能达到的水平。
“基本上任何智能体,无论它是否在编写代码,都需要一个代码解释器沙箱,让它能够真正处理数据并得出结论。”
—— Shrivu Shankar,Abnormal AI 人工智能战略副总裁
Abnormal AI 的架构:十亿级邮件规模的三层检测
Abnormal AI 通过三层检测架构处理数十亿封电子邮件,如图 2 所示。
第一层——