孤本网
/ 2 阅读
0
0

openJiuwen WorkSwarm推出全双工多模态交互,实现实时对话与后台Agent任务并行处理

一句话结论

openJiuwen开源平台发布WorkSwarm全双工多模态能力,支持用户实时插话与后台复杂Agent任务并行执行,降低等待感并优化人机协同节奏。

关键要点

  • WorkSwarm全双工多模态能力允许用户在AI播报时随时插话,系统检测到有效人声即停止当前播报并处理新指令,语音活动检测与噪声门限降低背景误打断。
  • 实时模型负责即时回应音视频交互,Core Agent负责后台拆解任务、调用工具并执行搜索、分析、文件生成等工作,两者并行运行互不阻塞。
  • 支持任务队列管理,用户可调整任务顺序、一键置顶或手动停止等待中及正在执行的任务,音视频连接与工具任务分别管理,关闭音视频后后台任务仍可继续。
  • 支持Windows、Mac、HarmonyOS系统一键安装,提供在线体验入口及免费Token领取。
  • 支持基于华为云ModelArts平台与vLLM-Omni推理框架,在昇腾系列NPU上部署全双工多模态模型并对接WorkSwarm能力。

背景与事实

openJiuwen是由华为2012实验室、华为云、终端、计算、算力先遣队等团队联合高校、企业等广大开发者共同构建的开源AI Agent平台。WorkSwarm作为其开源的办公编码统一工作台,近期推出了全双工多模态能力,将实时音视频交互与Core Agent执行接入同一任务流程。该能力使用户可以展示眼前画面、随时插话,同时把需要进一步处理的复杂工作交给后台Core Agent执行。

在全双工交互机制下,传统语音助手的"对讲机"式回合制通信被打破。用户无需等待AI说完再开口,可在播报过程中直接补充指令,例如在AI朗读《岳阳楼记》时语音要求切换为朗读《兰亭集序》,系统可自然快速响应。已生成的文字内容仍保留在任务记录中,插话仅改变当前对话状态。已交给Core Agent的工具任务拥有独立运行状态,需通过任务控制界面手动停止,用户说话时系统同步处理对话层新要求与任务层已有工作两个层面。

在"一边聊,一边办事"场景下,用户可先询问"这是什么品牌",随后补充"查一下它的资料,整理成一份文档"。实时模型处理即时画面识别与口头回应,Core Agent在后台执行搜索、分析与文件生成。搜索运行期间,用户可继续追问画面内容、打断播报或补充要求。任务进入Core Agent后,页面持续呈现任务状态、工具调用记录、执行结果及文件产物。任务完成后,系统不会打断正在进行的对话,而是先在文本框输出总结信息,待当前对话轮次结束后再汇报工作完成,并以提取重要信息的方式说明结果,而非全量语音输出。

WorkSwarm全双工任务队列支持多任务并行管理。当用户在前一个搜索任务未结束时交代第二项工作时,新任务进入队列等待,用户可手动调整顺序、一键置顶或停止执行中任务。音视频连接与工具任务解耦管理,即使关闭全双工音视频通道,已提交给Core Agent的任务仍可继续执行,完成后的文字、工具结果和文件会回到原对话中。

影响分析

对中文开发者与从业者而言,WorkSwarm全双工多模态能力的落地意味着AI Agent交互模式从串行回合制转向并行实时协作,直接压缩用户等待感知。在办公编码、资料检索、文档生成等高频场景中,用户可在保持对话流畅性的同时触发复杂后台任务,无需在中断对话或等待任务完成之间做取舍。这一模式为基于昇腾NPU的国产算力平台提供了原生亲和的多模态Agent部署路径,开发者可通过华为云ModelArts平台结合vLLM-Omni推理框架部署全双工模型,降低对特定海外芯片或云服务的依赖。当前支持JoyAI协议和Qwen Omni协议,其中Qwen Omni realtime websocket可填写官网base_url或本地部署地址,JoyAI协议则支持ASR、LLM、TTS三种模型的独立配置与混合调用,为不同技术栈团队提供了灵活接入选项。

适用边界

该全双工多模态能力依赖实时音视频交互通道与Core Agent后台执行架构的协同,适用于办公编码、资料检索、文档生成等需要"即时响应+后台处理"双节奏的场景。若用户仅需纯文本对话、不涉及实时音视频输入或后台工具调用,则无需启用全双工模式,直接通过文本接口调用Core Agent即可。此外,当前支持的系统为Windows、Mac、HarmonyOS,Linux桌面环境未提供官方安装包;协议层面目前支持JoyAI和Qwen Omni,尚未覆盖其他主流模型协议,使用其他模型需自行适配。昇腾NPU部署依赖华为云ModelArts平台及vLLM-Omni框架,非昇腾架构的NPU或GPU环境不适用该特定部署路径。

孤本观察

WorkSwarm将"对话不中断、任务不停跑"作为核心体验目标,实际上把人类团队协作中"边聊边办事"的自然节奏移植到了人机交互层,这一设计判断表明开源Agent平台正在从单轮任务执行转向持续性并行协作。

openJiuwen WorkSwarm推出全双工多模态交互,实现实时对话与后台Agent任务并行处理

openJiuwen WorkSwarm推出全双工多模态交互,实现实时对话与后台Agent任务并行处理

openJiuwen WorkSwarm推出全双工多模态交互,实现实时对话与后台Agent任务并行处理

openJiuwen WorkSwarm推出全双工多模态交互,实现实时对话与后台Agent任务并行处理

openJiuwen WorkSwarm推出全双工多模态交互,实现实时对话与后台Agent任务并行处理

常见问题

WorkSwarm全双工模式下,用户在AI播报时插话会发生什么?

系统检测到有效人声即停止当前播报并处理新指令,语音活动检测与噪声门限降低背景误打断,已生成的文字内容仍保留在任务记录中。

WorkSwarm支持哪些操作系统的官方安装?

支持Windows、Mac、HarmonyOS系统一键安装,Linux桌面环境未提供官方安装包。

关闭音视频连接后,后台Core Agent任务还能继续运行吗?

可以,音视频连接与工具任务解耦管理,关闭全双工音视频通道后,已提交给Core Agent的任务仍可继续执行。

WorkSwarm全双工模型部署依赖哪些技术栈?

依赖华为云ModelArts平台与vLLM-Omni推理框架,在昇腾系列NPU上部署,非昇腾架构的NPU或GPU环境不适用该部署路径。

除了JoyAI和Qwen Omni协议,还支持其他模型协议吗?

目前仅支持JoyAI和Qwen Omni协议,尚未覆盖其他主流模型协议,使用其他模型需自行适配。

来源:InfoQ 中文 AI


评论