← 文章 / AI技术
DeepMind 博客 2小时前 · 2026-10-07 04:29:32 · 0 阅读

EmbeddingGemma 2:开放、轻量级多模态嵌入模型

去年我们发布了 EmbeddingGemma,为高质量文本 embedding 提供了一个轻量级方案,让应用可以直接在消费级硬件上组织、搜索和关联信息。开发者社区的反响远超预期:下载量超过 2000 万,众多开发者用它构建了更智能的端侧搜索工具和注重隐私的检索增强生成(RAG)流水线。

今天,我们推出 EmbeddingGemma 2,不再局限于文本,而是将代码、图像、视频和音频统一到同一个 embedding 空间中。EmbeddingGemma 2 基于 Gemma 4 架构构建,以商用友好的 Apache 2.0 许可证发布,拥有 7.4 亿参数,非常适合端侧推理。它可以从语音备忘录中找到某段特定视频,也能用文本查询搜索数小时的音频记录,这一切都由一个原生多模态模型完成。

EmbeddingGemma 2 采用与 Gemini Embedding 模型相同的技术构建,具备以下特点:

  • 同尺寸中的佼佼者:在 MTEB(Massive Text Embedding Benchmark)Code 和 MAEB(Massive Audio Embedding Benchmark)等基准测试中,其得分在 10 亿参数以下的多模态 embedding 模型中名列前茅,同时在文本、视觉和音频任务上持平甚至超越许多更大的模型。
  • 模块化设计:纯文本场景最低只需 2.7 亿参数,可按需搭配视觉(1.7 亿)和音频(3 亿)编码器,获得完整的多模态支持。
  • 节省存储:借助 Matryoshka Representation Learning(MRL),开发者可以将输出向量从 768 维动态截断到 512、256 或 128 维,本地向量数据库的存储和内存占用最多可减少 6 倍。
  • 针对端侧性能优化:在严苛的资源限制下高效运行。经量化后,在 Google Pixel 11 Pro 上,EmbeddingGemma 2 纯文本权重最低只需约 191MB 活跃内存,完整多模态模型约需 567MB。
  • 支持长上下文:拥有 8K token 上下文窗口(是 EmbeddingGemma 1 的 4 倍),可直接在本地硬件上处理长达 5.5 分钟的音频、29 张图像、58 个视频帧,或它们的混合输入。

在代码、视觉和音频上达到顶级质量

EmbeddingGemma 2 在保持 EmbeddingGemma 强大多语言文本性能的同时,将代码处理能力(MTEB Code)大幅提升了 9.92 分(从 68.76 升至 78.68)。这使其非常适合用于本地代码库索引、语义代码搜索以及编码智能体的检索。在图像、视频、文档和音频等模态上,它不仅树立了 10 亿参数以内模型在质量与参数比上的新标准,甚至表现超越了一些规模超过它两倍的专用模型。

完整的评估指标和模型信息请参见 EmbeddingGemma 2 模型卡片。

实现全端侧的语义搜索、路由和检索

EmbeddingGemma 2 将强大的能力直接带到了边缘硬件上。本地生成嵌入向量有助于确保数据隐私、降低管道延迟,并支持开发者构建完全离线工作的跨模态搜索与检索系统。

与 Gemma 4 等生成式模型配合使用时,EmbeddingGemma 2 能够构建理解复杂多模态数据的端侧 RAG 管道。由于 EmbeddingGemma 2 基于 Gemma 4 构建,并共享其文本分词器和音频编码器,开发者可以在统一管道中同时运行这两个模型,从而降低总体内存占用。

使用文本或图像,基于语义相似度在媒体库中查找最匹配的内容。您可以在 Google AI Edge Gallery 的“即时媒体搜索”中尝试。

使用文本或音频查询,定位视频中的特定时刻。您可以在 Google AI Edge Gallery 的“视频时刻查找器”中尝试。

将 EmbeddingGemma 2 用于本地文件检索,搭配 Gemma 4 进行上下文推理。请在 Google AI Edge Foresight 应用中体验。

利用多模态上下文,通过 MediaPipe Decision Task API 构建实时决策引擎,实现分类、路由和预测功能。

想了解如何使用 LiteRT 构建端侧搜索和 RAG 系统,请阅读Google AI Edge 博客文章。

EmbeddingGemma 2 上手指南

我们与以下合作伙伴紧密合作,确保 EmbeddingGemma 2 能在你的开发环境中直接运行:

  • 下载模型:在 Hugging Face 和 Kaggle 获取模型权重,Gemini Enterprise Agent Platform 模型花园即将上线。访问 Hugging Face 上的 LiteRT 社区 查找针对端侧优化的模型。
  • 端侧部署:使用 Google AI Edge MediaPipe 开发跨平台应用,支持即插即用的嵌入、检索和决策任务;或使用 LiteRT 进行自定义模型集成。也可使用 transformers.js 或 WebGPU 进行浏览器端开发。
  • 使用你熟悉的开发工具:使用 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 高效服务模型。使用 Qdrant 存储嵌入向量。
  • 微调:参考 Unsloth 提供的指南,根据具体用例对 EmbeddingGemma 2 进行微调。

欢迎查看我们的开发者指南、文档,以及关于推理和微调的教程。

原始来源: DeepMind 博客

评论 (0)