← 文章 / AI技术
Hacker News 2小时前 · 2026-10-07 06:29:00 · 4 阅读

EmbeddingGemma 2 发布:开源轻量级多模态嵌入模型

去年,我们推出了EmbeddingGemma,旨在为高质量文本嵌入提供轻量级方案,帮助应用直接在消费级硬件上组织、搜索和连接信息。开发社区的反响远超预期。超过 2000 万次的下载量显示,构建者利用它实现了更智能的端侧搜索工具和隐私优先的检索增强生成(RAG)流水线。

今天,我们正式发布 EmbeddingGemma 2。它将能力从文本扩展至代码、图像、视频和音频,在共享的嵌入空间内实现多模态统一。基于 Gemma 4 架构构建,并采用商业友好的 Apache 2.0 许可证发布,EmbeddingGemma 2 拥有 7.4 亿参数,专为端侧推理优化。借助这一原生多模态模型,你可以通过语音备忘录定位特定视频片段,或基于文本查询检索数小时的音频录音。

与 Gemini 嵌入模型同源,EmbeddingGemma 2 具备以下特性:

  • 同尺寸下性能领先:在 MTEB(Massive Text Embedding Benchmark)代码子集和 MAEB(Massive Audio Embedding Benchmark)等基准测试中,在亚 1B 参数规模的多模态嵌入模型中取得领先分数,同时在文本、视觉和音频任务上匹配或超越许多更大规模的模型。
  • 模块化设计:纯文本负载仅需 2.7 亿参数;若需完整多模态支持,可可选附加视觉(1.7 亿参数)和音频(3 亿参数)编码器。
  • 存储高效:采用 Matryoshka 表示学习(MRL),开发者可将输出向量从 768 维动态截断为 512、256 或 128 维,为本地向量数据库和内存使用带来高达 6 倍的存储缩减。
  • 端侧性能优化:能在严格资源约束下高效运行。配合量化技术,在 Google Pixel 11 Pro 上,纯文本权重仅需约 191MB 活动内存,完整多模态模型也仅需约 567MB。
  • 扩展上下文就绪:具备 8K token 上下文窗口(是 EmbeddingGemma 1 的 4 倍),允许直接在本地硬件上处理长达 5.5 分钟的音频、29 张图像、58 帧视频或它们的交错组合。

实现代码、视觉和音频的高水准质量

EmbeddingGemma 2 保持了 EmbeddingGemma 的强大多语言文本性能,同时在代码任务上大幅提升 9.92 分(MTEB Code 从 68.76 提升到 78.68),非常适合本地代码库索引、语义代码搜索和编码智能体检索。在图像、视频、文档和音频方面,它为 1B 参数以下的模型树立了单位参数质量的新标杆,甚至超越了部分体积超过它两倍的专用模型。 完整的评测指标和模型信息请见 EmbeddingGemma 2 模型卡片。

在端侧实现语义搜索、路由与检索

EmbeddingGemma 2 将强大的能力直接带到边缘硬件上。在本地生成 embedding 有助于保护数据隐私、降低链路延迟,也让开发者能够构建完全离线运行的跨模态搜索与检索功能。

配合 Gemma 4 等生成式模型,EmbeddingGemma 2 可以在设备端构建理解复杂多模态数据的 RAG 管线。由于 EmbeddingGemma 2 基于 Gemma 4 构建,并共享其文本 tokenizer 和音频编码器,开发者可以在统一的管线中同时运行两个模型,总内存占用也更低。

用文本或图像按语义相似度在媒体库中查找最匹配的内容,可以在 Google AI Edge Gallery 的 Instant Media Search 中体验。

用文本或音频查询定位视频中的特定片段,可以在 Google AI Edge Gallery 的 Video Moments Finder 中体验。

将 EmbeddingGemma 2 用于本地文件检索,搭配 Gemma 4 进行上下文推理,可以在 Google AI Edge Foresight 应用中体验。

通过 MediaPipe Decision Task API 利用多模态上下文,构建用于分类、路由和预测的实时决策引擎。

如需了解如何基于 LiteRT 构建端侧搜索和 RAG 系统,请阅读这篇 Google AI Edge 博客。

快速上手 EmbeddingGemma 2

我们与以下合作伙伴密切合作,确保 EmbeddingGemma 2 能直接在你的开发环境中投入使用:

  • 下载模型:在 Hugging Face 和 Kaggle 上获取模型权重,Gemini Enterprise Agent Platform Model Garden 的支持即将上线。访问 Hugging Face 上的 LiteRT 社区 获取针对端侧优化过的模型。
  • 端侧部署:使用 Google AI Edge 的 MediaPipe 开发跨平台应用,以处理嵌入、检索及决策等任务;或使用 LiteRT 进行自定义模型集成。也可基于 transformers.js 或 WebGPU 构建浏览器端应用。
  • 使用你熟悉的开发工具:利用 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 高效部署模型。并使用 Qdrant 存储嵌入向量。
  • 微调:参考 Unsloth 提供的指南,针对你的使用场景微调 EmbeddingGemma 2。
探索我们的 开发者指南、文档,以及针对 推理 和 微调 的指南。
原始来源: Hacker News

评论 (0)