Google DeepMind 于 2026-10-06 发布 EmbeddingGemma 2:基于 Gemma 4 架构、740M 参数、Apache 2.0 许可,把文本、代码、图像、音频、视频映射到同一 768 维向量空间,上下文 8K,MTEB Code 从 68.76 提升到 78.68,量化后在 Pixel 11 Pro 上纯文本仅需约 191MB 内存。Hugging Face Transformers v5.19.0 已原生支持。
核心要点速览
- ✓规模:740M 参数,模块化拆分为 270M 文本主干 + 170M 视觉编码器 + 300M 音频编码器,可按需加载(官方博客)
- ✓代码检索:MTEB Code 68.76 → 78.68(+9.92 分),官方称在 1B 以下多模态嵌入模型中 MTEB Code、MAEB 领先
- ✓存储:Matryoshka 表示学习,768 维可截断到 512/256/128 维,本地向量库最多省 6 倍存储
- ✓端侧:量化后 Pixel 11 Pro 纯文本约 191MB、全多模态约 567MB 内存;8K 上下文(一代的 4 倍),可一次处理 5.5 分钟音频、29 张图或 58 帧视频
- ✓生态:Apache 2.0,权重在 Hugging Face 与 Kaggle;Transformers v5.19.0 已加入支持,官方列出 sentence-transformers、vLLM、llama.cpp、SGLang、Ollama、MLX 等

开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
做 RAG 和代码检索的团队常常要为文本、图片、音频各部署一套嵌入模型,跨模态检索得自己拼管线,数据还要上云。一代 EmbeddingGemma 只支持文本,却已有超过 2000 万次下载。Google DeepMind 于 10 月 6 日推出 EmbeddingGemma 2,目标是用一个可在手机上跑的开源模型统一五种模态。
架构亮点与底层机制
模型基于 Gemma 4 架构,总参 740M,采用模块化设计:纯文本只需 270M,视觉编码器 170M、音频编码器 300M 可选加载。输出 768 维向量,借助 Matryoshka 表示学习可截断到 512/256/128 维,最多省 6 倍存储。上下文 8K,是一代的 4 倍,可一次编码 5.5 分钟音频、29 张图片或 58 帧视频;与 Gemma 4 共享分词器和音频编码器,组合部署时总内存更低。
权威 Benchmark 与实测跑分对比
官方给出的硬数字是 MTEB Code 从 68.76 提升到 78.68(+9.92),并称在 1B 以下多模态嵌入模型中 MTEB Code 和 MAEB 领先。量化后在 Pixel 11 Pro 上纯文本约需 191MB 内存,全多模态约 567MB。其他视觉、音频分项请以 模型卡 为准,目前尚无独立第三方复测。
开发者实战落地与开箱指南
权重以 Apache 2.0 发布在 Hugging Face 和 Kaggle。Transformers v5.19.0 已加入支持(文档),官方还列出 sentence-transformers、vLLM、llama.cpp、SGLang、Ollama、MLX、LM Studio 和 transformers.js。做本地代码库索引或编码 agent 检索时,可先用纯文本模式加 256 维截断,在召回率和存储之间取平衡。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察