返回快讯列表
开发者动态

OpenAI 公开 GPT-Live 全双工语音架构:推理引擎从 Python 迁到 Go

OpenAI 8 月 3 日公开第三代语音系统 GPT-Live 架构:从回合制转向流式全双工、取消轮次检测器,推理引擎迁至 Go,会话启动压缩至 1 次往返。

OpenAI 在 8 月 3 日发布了一篇工程深度文章,披露第三代语音系统 GPT-Live 的架构。最大的变化是从回合制转向流式全双工:模型可以同时听和说,传统的「轮次检测器」被彻底取消——此前所有语音助手都依赖它来判断用户是否说完,这也是打断体验生硬的根源。

工程侧的改动同样激进。推理引擎从 Python asyncio 迁移到 Go,效果是帧交付的 p95 延迟已经能匹配旧架构的 p50;配套的 WARP 协议把会话启动所需的网络往返从 6 次压缩到 1 次,直接决定了「按下就能说」的体感。这套系统目前已经在驱动 ChatGPT 桌面端的电脑控制与智能体协调功能,后续将支撑对外的 GPT-Live API。

对开发者的参考意义有两层。一是架构层面:全双工不是在回合制上加一个打断功能就能实现的,取消轮次检测意味着上下游整条链路都要按流式重写,打算自建语音交互的团队应该先评估这个改造量。二是选型层面:语音类应用的体验差距正在从「模型说得好不好」转向「首字延迟和打断是否自然」,评估工具时值得把冷启动往返次数和 p95 帧延迟当作硬指标,而不只看合成音色。

更多快讯