Google DeepMind 于 2026-10-06 发布 EmbeddingGemma 2:基于 Gemma 4 架构、740M 参数、Apache 2.0 许可,把文本、代码、图像、音频、视频映射到同一 768 维向量空间,上下文 8K,MTEB Code 从 68.76 提升到 78.68,量化后在 Pixel 11 Pro 上纯文本仅需约 191MB 内存。Hugging Face Transformers v5.19.0 已原生支持。

核心要点速览

  • ✓规模:740M 参数,模块化拆分为 270M 文本主干 + 170M 视觉编码器 + 300M 音频编码器,可按需加载(官方博客)
  • ✓代码检索:MTEB Code 68.76 → 78.68(+9.92 分),官方称在 1B 以下多模态嵌入模型中 MTEB Code、MAEB 领先
  • ✓存储:Matryoshka 表示学习,768 维可截断到 512/256/128 维,本地向量库最多省 6 倍存储
  • ✓端侧:量化后 Pixel 11 Pro 纯文本约 191MB、全多模态约 567MB 内存;8K 上下文(一代的 4 倍),可一次处理 5.5 分钟音频、29 张图或 58 帧视频
  • ✓生态:Apache 2.0,权重在 Hugging Face 与 Kaggle;Transformers v5.19.0 已加入支持,官方列出 sentence-transformers、vLLM、llama.cpp、SGLang、Ollama、MLX 等
Google DeepMind 发布 EmbeddingGemma 2:740M 开源多模态嵌入模型,文本/代码/图像/音频/视频同一向量空间,MTEB Code 提升近 10 分
🖼️要闻配图
点击全屏高清查看
🧭

把技术选型换算成你的开发预算

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

做 RAG 和代码检索的团队常常要为文本、图片、音频各部署一套嵌入模型,跨模态检索得自己拼管线,数据还要上云。一代 EmbeddingGemma 只支持文本,却已有超过 2000 万次下载。Google DeepMind 于 10 月 6 日推出 EmbeddingGemma 2,目标是用一个可在手机上跑的开源模型统一五种模态。

架构亮点与底层机制

模型基于 Gemma 4 架构,总参 740M,采用模块化设计:纯文本只需 270M,视觉编码器 170M、音频编码器 300M 可选加载。输出 768 维向量,借助 Matryoshka 表示学习可截断到 512/256/128 维,最多省 6 倍存储。上下文 8K,是一代的 4 倍,可一次编码 5.5 分钟音频、29 张图片或 58 帧视频;与 Gemma 4 共享分词器和音频编码器,组合部署时总内存更低。

权威 Benchmark 与实测跑分对比

官方给出的硬数字是 MTEB Code 从 68.76 提升到 78.68(+9.92),并称在 1B 以下多模态嵌入模型中 MTEB Code 和 MAEB 领先。量化后在 Pixel 11 Pro 上纯文本约需 191MB 内存,全多模态约 567MB。其他视觉、音频分项请以 模型卡 为准,目前尚无独立第三方复测。

开发者实战落地与开箱指南

权重以 Apache 2.0 发布在 Hugging Face 和 Kaggle。Transformers v5.19.0 已加入支持(文档),官方还列出 sentence-transformers、vLLM、llama.cpp、SGLang、Ollama、MLX、LM Studio 和 transformers.js。做本地代码库索引或编码 agent 检索时,可先用纯文本模式加 256 维截断,在召回率和存储之间取平衡。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。