模块化编码器与Matryoshka截断:将四种模态压缩进500MB内存
EmbeddingGemma 2的诀窍并非依赖单一巨型网络,而是采用一个2.7亿参数的文本/代码核心,按需加载可选的1.7亿参数视觉编码器或3亿参数音频编码器[2]。这种模块化设计使得手机在仅运行文本任务时仅需约191MB活动内存,而在Pixel 11 Pro上加载全部编码器的完整多模态版本也仅需约567MB内存[3]。此外,该模型生成的每个嵌入向量初始为768维,但可通过Matryoshka表示学习截断为512、256或128维,使本地向量数据库的存储空间最多减少6倍[2]。实际上,该技术通过训练确保向量的前N维独立承载最重要的语义信息,从而允许截断尾部而不影响整体性能。上下文窗口也扩大了4倍至8,000个token,足以在单次推理中处理约5.5分钟的音频、29张图像或58帧视频[7]——这使得在手机上实现整场会议或完整视频的搜索成为现实,而非理论设想。



