孤本网
/ 0 阅读
0

AWS 发布基于 Amazon Bedrock AgentCore 与 Nova Sonic 的语音旅行管家构建方案

一句话结论

AWS 发布了一套利用 Amazon Bedrock AgentCore、托管知识库及 Nova Sonic 模型构建实时语音旅行管家的完整架构方案。

关键要点

  • Amazon Bedrock AgentCore 是用于大规模安全构建、部署和运行 AI 智能体的代理平台,支持选择框架和模型。
  • Amazon Nova Sonic on Bedrock 是用于实时语音的语音到语音模型,支持 16 kHz PCM 音频传输。
  • Amazon Bedrock Knowledge Bases 是 fully managed 的检索增强生成(RAG)服务,基于文档 grounding 回答。
  • 架构分为前端、AI 智能体和后端服务三层,支持独立开发和扩展。
  • MCP(Model Context Protocol)是连接 AI 应用与外部工具和数据的开放标准,实现智能体与后端的松耦合。

背景与事实

亚马逊云科技(Amazon Web Services,AWS)在其机器学习博客中发布了一篇关于构建语音旅行管家的详细技术指南。该方案核心依赖三个主要服务组件:Amazon Bedrock AgentCore 作为代理平台,负责智能体的构建、部署与运行;Amazon Nova Sonic 作为实时语音模型,处理语音转写与响应合成;以及 Amazon Bedrock Knowledge Bases 提供基于文档 grounding 的检索增强生成(RAG)能力。整体架构采用分层设计,明确划分为前端、AI 智能体和后端服务三个独立层面,这种结构允许各层组件独立开发与扩展,从而提升系统维护的灵活性。

在后端基础设施层面,该方案通过 5 个 AWS Cloud Development Kit (CDK) 栈进行部署。具体组件包括用于数据存储的 Amazon DynamoDB 表,该表包含客户配置、预订、乘客、座位图、购买历史、偏好、对话记录和航班状态等示例航空公司数据模型,具备单位数毫秒延迟和按需扩展特性;用于处理业务逻辑的 Lambda 函数和 API Gateway 端点;以及用于身份认证的 Amazon Cognito。此外,Amazon Bedrock Knowledge Bases 被集成其中,用于处理行李限制、改签费、宠物旅行及忠诚度条款等政策查询。知识库的底层存储基于 Amazon S3 Vectors,并利用 Smart Parsing 技术处理源 PDF 文档,以确保表格和结构化布局的准确检索。当政策文档更新后,知识库会同步刷新,新内容立即可用,无需重新部署整个 pipeline。

AgentCore Gateway 部分由 1 个 CDK 栈创建,它利用 MCP(Model Context Protocol)协议将后端端点暴露为工具,实现智能体与后端的松耦合连接。AgentCore runtime 部分则由 2 个 CDK 栈配置,使用 Amazon ECR 存储容器镜像,Amazon S3 存储源代码,并通过 AWS CodeBuild 构建 ARM64 Docker 镜像。运行时环境采用 Strands Agents 框架,结合 Amazon Nova 2.5 Sonic 模型,并支持 WebSocket 通信。前端应用是一个基于 React 的界面,通过 1 个 CDK 栈部署,运行在 AWS Amplify 平台上。部署前需预先安装 aws-cdk 并执行 `npx cdk bootstrap` 命令。API Gateway 发布 REST API,采用 IAM 授权和 Lambda 集成模式。

影响分析

对于中文开发者而言,这一方案展示了如何在生产环境中结合多模态 AI 与大模型能力来解决复杂业务场景。该架构的显著影响在于其通过 MCP 协议实现了工具调用的标准化,使得开发者无需修改代理代码即可通过添加 Lambda 函数来扩展功能,极大地降低了后续迭代的成本。语音交互部分采用 16 kHz PCM 音频经 WebSocket 传输,由 Nova 2.5 Sonic 进行实时处理,这种低延迟特性对于要求即时响应的客户服务场景具有重要参考价值。此外,该方案强调“写入前确认”模式,即代理在执行变更操作前需获得用户确认,并逐字符播报关键信息(如航班号),这在提升用户体验的同时,也引入了额外的交互步骤,开发者需根据具体业务场景权衡交互流畅度与安全性之间的平衡。对于涉及敏感数据处理的场景,生产部署建议添加 Amazon Bedrock Guardrails 以过滤提示注入并验证响应依据,这为合规性要求严格的行业提供了可落地的技术路径。

适用边界

该方案主要适用于能够接受按使用量付费模式,且具备一定云计算基础设施维护能力的团队。由于架构依赖多个 AWS 托管服务(如 DynamoDB、S3、Cognito、Amplify),对于希望完全自建后端或部署在非 AWS 云环境的项目不适用。此外,样本中不包含联络中心应用,人工升级功能依赖预配置的支持号码,因此缺乏即时通讯或呼叫中心集成的场景下,该部分功能需自行开发适配。语音交互基于 WebSocket 的单向连接,对于网络不稳定或移动场景下的长连接维持可能存在挑战,需结合具体网络环境测试。

孤本观察

本方案通过分层架构与 MCP 协议的结合,确立了“智能体作为工具调用者”而非“功能实现者”的设计范式,这一思路正成为构建复杂 AI 应用的主流趋势。值得注意的是,该架构在强调灵活扩展的同时,通过 microVM 隔离和自动扩缩容机制试图解决托管代理平台在安全性与成本控制之间的固有矛盾。

常见问题

Amazon Nova Sonic 支持的音频传输格式是什么?

支持 16 kHz PCM 音频传输。

该架构通过什么协议实现智能体与后端的松耦合连接?

通过 MCP(Model Context Protocol)协议将后端端点暴露为工具,实现松耦合连接。

AgentCore runtime 部分使用哪些服务存储和构建容器镜像?

使用 Amazon ECR 存储容器镜像,Amazon S3 存储源代码,并通过 AWS CodeBuild 构建 ARM64 Docker 镜像。

该方案为何不适合部署在非 AWS 云环境的项目?

因为架构依赖多个 AWS 托管服务(如 DynamoDB、S3、Cognito、Amplify),完全自建后端或非 AWS 环境不适用。

知识库如何处理源 PDF 文档以确保表格和结构化布局的准确检索?

利用 Smart Parsing 技术处理源 PDF 文档,确保表格和结构化布局的准确检索。

来源:AWS Machine Learning Blog