Google发布EmbeddingGemma 2多模态嵌入模型
TECH

Google发布EmbeddingGemma 2多模态嵌入模型

30+
Signals

战略概览

  • 01.
    Google DeepMind于2026年10月6日发布了EmbeddingGemma 2,这是其首款开源、原生支持多模态的嵌入模型,在Apache 2.0许可下将文本、代码、图像、视频和音频映射到一个共享的向量空间中。
  • 02.
    该模型参数量为7.4亿,采用模块化编码器设计——一个2.7亿参数的文本/代码核心,外加可选的1.7亿参数视觉编码器和3亿参数音频编码器,在Pixel 11 Pro上仅需约191MB内存即可运行纯文本任务,全多模态版本则需约567MB内存。
  • 03.
    其上下文窗口扩大至8,000个token,768维的嵌入向量可通过Matryoshka表示学习截断为512、256或128维,使本地向量数据库的存储空间最多减少6倍。
  • 04.
    Google已在自家产品中部署该模型,包括AI Edge Gallery应用中的视频片段查找器演示,以及完全本地运行的Mac版Google AI Edge Foresight会议笔记应用。

模块化编码器与Matryoshka截断:将四种模态压缩进500MB内存

EmbeddingGemma 2的诀窍并非依赖单一巨型网络,而是采用一个2.7亿参数的文本/代码核心,按需加载可选的1.7亿参数视觉编码器或3亿参数音频编码器[2]。这种模块化设计使得手机在仅运行文本任务时仅需约191MB活动内存,而在Pixel 11 Pro上加载全部编码器的完整多模态版本也仅需约567MB内存[3]。此外,该模型生成的每个嵌入向量初始为768维,但可通过Matryoshka表示学习截断为512、256或128维,使本地向量数据库的存储空间最多减少6倍[2]。实际上,该技术通过训练确保向量的前N维独立承载最重要的语义信息,从而允许截断尾部而不影响整体性能。上下文窗口也扩大了4倍至8,000个token,足以在单次推理中处理约5.5分钟的音频、29张图像或58帧视频[7]——这使得在手机上实现整场会议或完整视频的搜索成为现实,而非理论设想。

开源权重与同日运行支持:为何其传播速度远超封闭API

Google在Apache 2.0许可下发布了EmbeddingGemma 2,并已为MediaPipe、LiteRT、transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama和LMStudio等平台提供运行时支持,同时获得Qdrant和Unsloth等生态伙伴的集成,未来还将登陆Gemini企业代理平台的模型花园[1]。这种广泛的生态支持是其与仅提供托管服务的封闭嵌入API之间的真正差异点:开发者不再受限于单一供应商的推理栈或定价策略,工具项目可在发布首日即提供量化版本(如GGUF、MLX),无需等待供应商适配。这也明显呼应了初代EmbeddingGemma的发布策略——Google DeepMind的工程师曾表示其采用率“远超预期”[4],而此次更新可视为有意将这一开源权重策略扩展至图像、音频和视频领域,而非将多模态嵌入能力锁在API付费墙之后。

基准测试的差距:‘最多缩小6倍’并未完全兑现的承诺

Google公布的数据显示:通过Matryoshka表示学习将维度截断至256维时,图像、视频和语音嵌入的质量仍能保持全维宽度的约95%;进一步截断至128维时,文本和代码嵌入保留约90%质量,多模态嵌入保留约75%质量;同时MTEB代码评分从68.76提升至78.68,较初代EmbeddingGemma提升约14%[2][3]。这些数据源自Google自有的基准测试套件,而基准测试本身只是代理指标,并非绝对保证。由于Matryoshka截断本质上是信息有损的,压缩后保留的质量高度依赖于开发者自身语料库与模型测试数据的相似度——产品目录或会议转录数据集的行为可能与MTEB构建所用的检索集大相径庭。标题中的压缩比率与特定、复杂、真实世界数据集上的实际表现之间的差距,正是大多数发布报道所忽略的关键细节。

并非通用升级:专用文本嵌入模型仍占优势的领域

EmbeddingGemma 2的核心卖点是效率与模态覆盖,而非纯文本检索的绝对性能。Google自身的定位是:它在参数量低于10亿的多模态嵌入模型中处于领先地位,并能在图像、视频和音频任务上击败部分体积超过其两倍的专用模型[4]——这一说法明确限定在该参数量级和特定模态范围内。若模型将全部参数预算专用于文本处理,而非在四种模态间分配资源,则在具备足够算力的硬件上,其纯文本嵌入质量仍可超越EmbeddingGemma 2。对EmbeddingGemma 2最诚实的定位是:当设备端资源受限且需由单一小型模型处理文本、代码、图像、音频和视频时,它是最佳选择;而非在算力不受限时替代最大型专用文本嵌入模型的即插即用方案。

从研究演示到已发布产品:Google已在内部‘自用’该模型

与许多仅停留在模型卡阶段的发布不同,EmbeddingGemma 2已实际运行于Google已上线的功能中——AI Edge Gallery应用中的视频片段查找器演示允许用户通过语音备忘录定位特定视频片段,而Mac版Google AI Edge Foresight应用则完全在本地处理会议转录和音频数据,无需上传至服务器[5]。这对Google强调的隐私优先框架至关重要:离线多模态搜索并非假设性用例,而是已交付用户手中的产品所依赖的同一技术管线。市场报道还单独指出,GuruFocus标记Alphabet股价较其GF价值估计高出约35.5%,伴随混合的内部人士与专家交易活动[6]。这提醒我们,发布日的股价评论与模型实际技术价值通常由截然不同的受众关注。

历史背景

发布了初代EmbeddingGemma,一款基于Gemma 3、3亿参数、仅支持文本的嵌入模型,可在200MB内存内运行;该模型下载量超过2,000万次。
发布了Gemma 4,包含E2B、E4B、31B和26B A4B多种尺寸,成为后续EmbeddingGemma 2的架构基础。
宣布EmbeddingGemma 2:7.4亿参数,原生支持多模态,8,000 token上下文窗口(为初代4倍),MTEB代码评分为78.68,高于初代的68.76。

关键关系图

关键玩家
主题

Google发布EmbeddingGemma 2多模态嵌入模型

GO

Google / Alphabet Inc (NASDAQ: GOOGL)

发布方的母公司及商业受益者

GO

Google DeepMind

构建并发布EmbeddingGemma 2的研究部门

SA

Sahil Dua

Google DeepMind研究工程师,EmbeddingGemma 2的发布者之一

HE

Henrique Schechter Vera

Google DeepMind研究工程师,模型开发的引述作者之一

HU

Hugging Face / Kaggle

模型权重的托管与分发平台

UN

Unsloth及更广泛的运行时生态(Qdrant、Ollama、vLLM、llama.cpp、MLX)

首日集成伙伴,支持跨设备的本地部署

事实来源

7 条引用
  1. [1] Introducing EmbeddingGemma 2
  2. [2] EmbeddingGemma 2: The Developer Guide
  3. [3] Google claims EmbeddingGemma 2 outperforms rival embedding models twice its size
  4. [4] Google expands EmbeddingGemma beyond text to images, audio and video
  5. [5] Google AI Edge Foresight brings on-device meeting notes to Mac
  6. [6] Google DeepMind Launches EmbeddingGemma 2 AI Model, Boosting On-Device Search
  7. [7] Google Launches EmbeddingGemma 2 for On-Device Multimodal Search

来源文章

Top 5

THE SIGNAL.

Analysts

“两人表示,开发者对初代纯文本EmbeddingGemma的积极反馈促使了多模态续作的诞生,并指出‘初代的反响远超我们的预期。’”

Sahil Dua and Henrique Schechter Vera (Research Engineers, Google DeepMind)
EmbeddingGemma 2开发团队

“评论者认为开源许可对嵌入模型尤为重要,写道‘尤其是对于嵌入模型,使用封闭、专有、仅托管的模型毫无意义。’”

Hacker News developer community
评估开源权重发布的独立开发者
The Crowd

“Introducing EmbeddingGemma 2, a new open multimodal model that sets the standard for on-device efficiency. - our first open, natively multimodal embedding model - handles text, code, image, video, and audio tasks within a lightweight, modular 740M parameter form factor - ideal”

@@sundarpichai8384

“Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.”

@@GoogleDeepMind4291

“Introducing EmbeddingGemma 2! Our lightweight, multimodal embedding model maps text, code, images, video, and audio into a single, unified embedding space. Optimized for on-device use cases, it features: - 740M parameter form factor with modular encoders - Flexible dimension”

@@googlegemma3384

“Google releases EmbeddingGemma 2”

@u/yoracale939
Broadcast
Introducing EmbeddingGemma 2: An open model for natively multimodal embeddings

Introducing EmbeddingGemma 2: An open model for natively multimodal embeddings

Embedding Gemma 2: On-Device Multimodal RAG Made Easy

Embedding Gemma 2: On-Device Multimodal RAG Made Easy

Google EmbeddingGemma 2: Multimodal Open Model for on-Device Embeddings

Google EmbeddingGemma 2: Multimodal Open Model for on-Device Embeddings