三个编码器,一个向量空间:EmbeddingGemma 2 背后的机制
EmbeddingGemma 2 最引人注目的特点并非单一更大的模型,而是三个独立训练但最终落在同一坐标系中的编码器。总共 7.4 亿参数被划分为一个 2.7 亿参数的文本模型(1.3 亿参数的 Transformer 主干网络加 1.4 亿参数的嵌入器)、一个 1.7 亿参数的视觉编码器和一个 3 亿参数的音频编码器,每个编码器将其对应模态的数据投影到相同的 768 维空间 [1]。正是这种共享的几何结构使得文本查询、照片和视频片段可以通过简单的点积进行比较,而无需事后拼接多个独立的检索系统。
第二个值得理解的机制是 Matryoshka Representation Learning(MRL),它训练嵌入向量使其前 512、256 或 128 维度本身仍具有实用性——而不仅仅是完整的 768 维。结合 8,000–8,192 token 的上下文窗口(是原始 EmbeddingGemma 的四倍),这使得同一模型既能索引短代码片段,也能处理足够长、需要真实检索的文档块 [2]。在 MacBook M5 Pro GPU 上,视觉编码每张图像耗时 37.3 毫秒,对 500 个候选选项的决策路由任务可在 100 毫秒内完成——速度足以让该嵌入器作为零样本意图路由器使用,而不仅仅是一个搜索索引 [3]。
其优势在代码检索方面表现最为明显,EmbeddingGemma 2 在 MTEB Code 基准测试中从 68.76 跃升至 78.68,提升了 9.92 分,这一提升超过了模型其他大多数改进,表明架构变化而不仅仅是更多训练数据正在发挥实际作用 [4]。



