OpenAI发布GPT-Live语音系统 解决AI对话延迟问题

2026-08-04 11:40:28    来源:新经网    作者:冯思韵
很多朋友不知道【OpenAI发布GPT-Live语音系统 解决AI对话延迟问题】,今天小绿就为大家解答一下。

  【CNMO科技消息】8月4日消息,OpenAI正式发布经过全面重构的语音交互系统GPT-Live,解决了AI语音助手长期存在的对话停顿和回合切换生硬等核心痛点。该公司工程师Justin Uberti和Zahan Malkani在技术博文中详细披露了这一历时六个月的底层架构改造。

版权所有,未经许可不得转载

  传统AI语音交互采用回合制模式,依赖"回合检测器"来判断用户何时结束发言。这种机制存在明显缺陷:检测过早会打断用户说话,检测过晚则造成不自然的沉默等待。GPT-Live彻底摒弃了这一方案,转而采用全双工架构,能够在接收用户语音的同时生成回复,系统每秒多次自主决策应该倾听、发言、暂停还是允许用户打断。

  GPT-Live的推出标志着AI语音交互从"对讲机模式"向自然人机对话的跨越。通过分离即时语音与重型计算任务,OpenAI构建的语音界面在体验上更接近人际交流,为大规模商用语音AI服务树立了新的技术基准。

OpenAI

  为实现流畅对话,OpenAI将系统拆分为两个独立层级。音频流通过专用低延迟快速通道在用户设备与GPT-Live模型之间传输,而网络搜索、代码执行、调用GPT-5.5等前沿模型进行深度推理等重负载任务则在异步边界之外的后台路径完成。这意味着即使复杂查询需要额外数秒处理,语音层仍能保持自然对话,不会出现掉帧、卡顿或连接冻结。

  在传输层优化方面,OpenAI将原有的Python asyncio代码替换为Go语言,为超过1.5亿周活跃用户实现更稳定的帧传输。针对连接建立延迟,团队开发了名为WARP(WebRTC Abridged Roundtrip Protocol)的开放规范,配合Instant Connect功能,将传统WebRTC需要六次网络往返的启动流程压缩至单个数据包,使用户几乎可以瞬间发起实时语音会话。


以上问题已经回答了。如果你想了解更多,请关新经网网站 (https://www.xinhuatone.com/)
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。