Google Gemini 3.8 Live Avatar 发布
TECH

Google Gemini 3.8 Live Avatar 发布

28+
Signals

战略概览

  • 01.
    Google 于 2026 年 9 月 24 日在 Gemini Enterprise 中向公众推出 Gemini 3.8 Live 与 Live Avatar,为其原生实时对话模型增加了近乎实时的视频生成功能。
  • 02.
    该虚拟形象支持 97 种语言,具备自动的会话中语言切换、精准的口型同步,以及异步工具调用功能,可在不中断对话的情况下于后台获取 CRM 或 ERP 数据。
  • 03.
    Cox Automotive 是首发旗舰客户,正在为 Autotrader 构建由 Live Avatar 驱动的购物助手;目前该功能仅对 Gemini Enterprise 客户开放,且仅限美国和欧盟节点使用。
  • 04.
    自定义虚拟形象的创建需要企业白名单准入和身份验证,而非自助服务;所有生成的音频和视频均带有 SynthID 水印,以确保来源可追溯。

实际工作原理:视频生成与实时通话深度融合

Live Avatar 并非附加在 Gemini 上的独立虚拟形象产品——它是在与 Gemini 语音处理相同的实时对话调用中运行的近乎实时的视频生成技术[1],从而产生一个能倾听、注视并说话的虚拟形象,具备精准的口型同步、自然的表情和流畅的对话轮转[4]。它能理解并使用 97 种语言,并在会话中途切换语言,同时自动调整口型和表情,视频质量不会下降[1]。动画与 Gemini 的推理能力和异步工具调用并行运行,因此虚拟形象可在后台触发 CRM 或 ERP 查询,同时保持对话流畅,避免尴尬的停顿[2]。Cox Automotive 已基于此技术栈为 Autotrader 推出了一款由 Live Avatar 驱动的助手,该助手可高亮屏幕部分内容,并实时调用工具,帮助购物者比较车辆和融资选项[3]。企业也可从预建的虚拟形象库中部署,或使用单张参考照片和音频样本创建自定义虚拟形象——但该路径需通过严格的企业白名单准入和身份验证,而非自助服务[4]。

一场因视角不同而反响迥异的发布

在官方渠道,此次发布被视为一次自信而常规的平台扩展——作为工具调用和 Gemini Enterprise 整体路线图中的一项新企业功能,未见明显反对声音。然而,社区层面的反应则要激烈得多:主要讨论帖嘲讽这些虚拟形象诡异而呆板,质疑为何该功能仅面向企业而非消费者推出,并将其与 Meta 同周发布的竞争性虚拟形象演示进行不利对比。这种官方自信表述与基层怀疑态度之间的差距,恰好印证了 Engadget 在发布时提出的担忧——即该视觉形象本身“可能不会普遍受欢迎”[4]——表明 Google 正在押注企业买家会重视其功能性,即使终端用户觉得该形象令人不适。

反方观点:虚拟形象只是对真正升级的干扰

并非所有观察者都将虚拟形象视为核心。Choosely 的 AI Radar 行业分析指出,视觉层仅在“能改善代理原本应完成的工作”时才有价值[5],而更关键的升级在于其背后的底层能力——异步工具调用、视觉理解以及后台函数执行,这些功能使代理能真正完成任务,而不仅仅是看起来在对话[5]。这种解读与至少一位客户对底层平台的描述相符:Equal AI 的 CEO 将基础的 Gemini Live 系统更多地视为一种代表用户“完成任务”的软件,而非一个会说话的面孔[1]。

竞争格局与为何仅限企业使用

Live Avatar 的推出正值多家公司竞相为其 AI 模型添加会说话、会动的虚拟形象之际——Meta 自己的虚拟形象演示也在同周发布,并引发类似比较——而 Synthesia、HeyGen 和 D-ID 等独立虚拟形象生成厂商现在面临一个新对手,该对手将逼真的视频生成直接融入实时对话调用中,无需预先编写脚本或额外集成[6]。这种竞争压力有助于解释其异常严格的准入机制:自定义虚拟形象的创建需要企业白名单准入,并提供所用面部和声音的权利或同意证明[5],且每一段生成的音视频流都带有不可察觉的 SynthID 水印,即使经过重新编码仍可追溯,确保 AI 生成内容在离开平台后仍可被追踪[7]。将该功能限制在经验证的企业客户,并仅在美欧节点开放,而非向消费者开放,显然是为了防范逼真自定义虚拟形象系统可能引发的身份滥用和深度伪造风险。

经济模型:按使用计费的虚拟形象,未来价格将上涨

Google 将 Live Avatar 的视频输出与音频和文本令牌分开计价:虚拟形象视频按每秒 6,192 个令牌转换,仅在虚拟形象实际说话时计费,2026 年底前的 introductory 价格为每百万视频令牌 1.00 美元——相当于每分钟虚拟形象说话时间约 0.37 美元[5]。该费率计划从 2027 年 1 月 1 日起上调至标准的每百万令牌 1.50 美元输入/7.50 美元输出结构,此外还需支付基础对话上下文令牌的费用[6]。结合 Google 自身模型卡中承认的当前连续虚拟形象交互最多仅支持几分钟,无法支持长时间会话[5],这一定价模式显然是为短时、高价值、任务导向的交互而设计——例如购车咨询、支持分诊电话——而非全天候的数字接待员。

历史背景

支撑 Gemini Live 音视频能力的实时多模态 AI 代理研究项目 Astra,首次在 2024 年 Google I/O 大会上公布。
Live Avatar 背后的 Gemini Enterprise Agent 平台能力于 2026 年 Google Cloud Next 大会(4 月 22 日至 24 日,拉斯维加斯)前后预览,与 Gemini Enterprise Agent 平台整体发布同步。
面向实时语音代理的 Gemini 3.8 Live 与 Extended Thinking 模型在 Live Avatar 正式发布前约一周推出。
Gemini 3.8 Live 与 Live Avatar 已在 Gemini Enterprise 的美国和欧盟节点全面上线。

关键关系图

关键玩家
主题

Google Gemini 3.8 Live Avatar 发布

GO

Google / Google Cloud (Gemini Enterprise)

Product owner and launcher; ships Live Avatar as a Gemini Enterprise capability, controls the avatar library, custom-avatar allowlisting, and SynthID watermarking safeguards.

CO

Cox Automotive / Autotrader

Launch customer; built an AI shopping assistant for Autotrader using Live Avatar with live screen-highlighting and tool-calling to guide car shoppers through search, comparison, and financing in real time.

EQ

Equal AI

Enterprise customer cited by Google as using the underlying Gemini Live platform for a personal-AI product handling over 1 million live calls daily across nine Indian languages.

SA

Salesforce

Cited integration partner, connecting Gemini Live/Live Avatar capabilities with Agentforce for intelligent customer service.

SY

Synthesia, HeyGen, D-ID

Standalone AI-avatar and video-generation competitors facing new direct pressure now that Google bundles avatar generation into the same real-time call as its conversational model rather than as a separate product.

事实来源

7 条引用
  1. [1] Gemini 3.8 Live with Live Avatar is now generally available
  2. [2] Gemini Live Avatar brings asynchronous tool-calling to video agents
  3. [3] Google Gemini 3.8 Live Avatar for enterprise agents
  4. [4] Google's new video avatars for Gemini 3.8 Live agents
  5. [5] Gemini 3.8 Live Avatar Explained
  6. [6] Google releases Gemini 3.8 Live
  7. [7] Gemini 3.8 Live with Live Avatar

来源文章

Top 5

THE SIGNAL.

Analysts

“认为这些虚拟形象在视觉上令人不安,并预计鉴于此前对 AI 生成视频内容的抵制,公众反应将褒贬不一。”

Steve Dent
记者,Engadget

“认为虚拟形象界面本身并非真正价值所在——底层的工具调用、视觉理解和异步函数执行比虚拟形象本身更重要——且当前演示超前于实际企业需求。”

Choosely AI Radar
行业分析媒体,choosely.ai

“将 Autotrader 助手视为满足消费者对自然语言交互日益增长的期望,而非传统筛选和菜单。”

Marianne Johnson
执行副总裁兼首席产品官,Cox Automotive

“将底层的 Gemini Live 平台定位为能代表用户完成任务的助手,而不仅仅是回答问题。”

Akhilesh Damaraju
CEO,Equal AI
The Crowd

“Power your agents: Gemini 3.8 Live with Live Avatar is now generally available in Gemini Enterprise. Key capabilities include: video avatars, fluid dialogue, tool calling, and more. Start building today ↓ https://t.co/MD9Smf29Hq”

@@GoogleCloudTech370

“Check out this week's updates and releases: — Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS, two of our most expressive audio generation models yet — Gemini 3.8 Live with Live Avatar, bringing near real-time visual presence to Gemini's conversational AI — @Gemini_Notebook”

@@GoogleAI297

“$GOOGL launched Gemini 3.8 Live with Live Avatar, bringing low-latency AI video avatars to Gemini Enterprise. It supports real-time audio and visual interaction across 97 languages, with background tool use and SynthID watermarking. https://t.co/AxwmeRJIrL”

@@Sam_Badawi47

“Introducing Gemini 3.8 Live with Live Avatar”

@u/Gaiden20687
Broadcast
Gemini 3.8 Live with Live Avatar gives Google's AI a face

Gemini 3.8 Live with Live Avatar gives Google's AI a face

Gemini 3.8 Live Avatar Is Here... Google Gives AI a Face.

Gemini 3.8 Live Avatar Is Here... Google Gives AI a Face.

[16:9] Google Gives Gemini a Live Face

[16:9] Google Gives Gemini a Live Face