Live 与 Extended Thinking:边思考边说话的技术机制
Gemini 3.8 Live 及其 Extended Thinking 版本基于相同的 Gemini 3 多模态架构构建,支持文本、图像、音频和视频输入,上下文窗口达 128K tokens [2]。两者的区别在于对延迟与深度的处理方式:Live 经过优化以实现规模化和成本效率,结合流畅对话与视觉理解能力;而 Extended Thinking 则设计为在回答时同步进行推理与表达,而非在回应前暂停思考 [1]。两款模型均可在后台启动工具和 API 调用而不中断对话——确认请求后继续聊天,任务在后台完成后将结果整合进来 [1]。两款模型还可在对话中途自动检测并切换 97 种语言 [1]。独立开发者评论指出,其底层架构与 OpenAI 的语音到语音 GPT-Live 模型属于同一家族,可通过类似的 WebSocket API 访问,无需定制集成 [4]。


