深入 GPT-Live:一种能自我中断的语音模型
此次发布在技术上与以往 ChatGPT 语音功能的不同之处在于全双工能力:GPT-Live 于 2026 年 7 月 8 日首次发布,设计为可同时监听与说话,而非像对讲机那样轮流响应 [1]。这使得用户可在句子中途纠正或打断,模型也能实时调整。OpenAI 自身的产品负责人也将此视为迈向语音成为通用计算接口的关键一步,而不仅仅是一种聊天模式。
此次桌面端实现(发布版本为 26.715)[3]实际上采用双模型协作,而非单一系统包办一切:GPT-Live 负责实时对话,而另一个独立的推理模型 GPT-5.6 Terra 则真正启动并协调 Work 或 Codex 中的代理任务 [2]。在 macOS 上,这一架构进一步延伸出“屏幕上下文”或 Appshot 功能,用户说“看看这个”时,系统会将最前端窗口内容作为上下文传递给模型,无需手动截图 [4]。这种架构解释了该功能的核心亮点(说话后,后台代理持续工作)以及用户报告的某些异常:由于涉及两个模型,系统在会话中途偶尔需切换模型,当出现问题时,这种切换痕迹便暴露出来。


