OpenAI 已重构其 WebRTC 技术栈,用以支撑实时语音 AI 的低延迟、全球规模与无缝对话轮次切换。这意味着其语音产品的底层实时传输链路被重新设计,重点从“能通话”转向“像真人一样自然接话”。
按照 OpenAI 新闻页面公布的摘要,这项工作围绕三个方向展开:为实时语音 AI 提供低延迟、支撑全球规模,以及实现顺畅的对话轮次切换(turn-taking)。WebRTC 是浏览器与终端设备间实时音视频通信的通用技术标准,OpenAI 选择在这一层动手,指向的是语音交互中延迟与打断衔接这类体验瓶颈。
该摘要未披露具体架构方案、性能数字、上线时间或涉及的模型版本,也未说明改动影响哪些产品或地区。
孤本观察:实时语音 AI 的体验短板常常不在模型能力,而在传输延迟与轮次切换的衔接上,OpenAI 把工程叙事放在 WebRTC 而非模型上,说明这一赛道的竞争正部分转向基础设施层。不过仅有摘要级信息,实际改善幅度仍需更细的技术说明来验证。
来源:OpenAI News