Perplexity 10 月 7 日发布 pplx-embed-v2-late 多模态后期交互(ColBERT)检索模型,0.6B(激活 340M)与 9B(激活 7.4B)两档,基于 Qwen3.5 双向注意力,每个 token 输出 128 维向量并用 MaxSim 打分,可直接检索文本、图片与渲染后的 PDF/幻灯片。两档共享嵌入空间,0.6B 可查询 9B 建好的索引。ViDoRe v3 图像 nDCG@10 为 62.3% / 65.2%,MIT 许可上架 Hugging Face。

核心要点速览

  • ✓ViDoRe v3(公开集)nDCG@10:0.6B 图像 62.3% / Markdown 61.2%,9B 图像 65.2% / Markdown 64.7%(0.6B 模型卡)
  • ✓官方称 0.6B 在 ViDoRe V3 上可比肩激活参数约 5 倍的模型(Perplexity 博客)
  • ✓共享嵌入空间:用 9B 建索引、0.6B 做在线查询,压低查询端成本
  • ✓训练:由内部 18B ColBERT 教师蒸馏(token 级 LEAF 式目标);9B 最后 8 层全量微调,其余层与视觉编码器用 LoRA
  • ✓上手:需要 sentence-transformers ≥ 6.0.0、transformers ≥ 5.4.0,MIT 许可;文本批与图像批要分开编码(9B 模型卡)
🧭

把技术选型换算成你的开发预算

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

传统 RAG 处理 PDF 和幻灯片时要先 OCR、再切块、再用单向量嵌入,表格和图表在这一步很容易丢失信息。后期交互(ColBERT)检索精度更高,但向量多、成本高。Perplexity 继上周的 pplx-embed-v2-context 之后,于 10 月 7 日在官方博客发布 pplx-embed-v2-late。

架构亮点与底层机制

模型基于 Qwen3.5 改成双向注意力,每个 token 输出 128 维向量,打分时每个查询 token 取文档中最相似的 token,再把这些最大相似度求和(MaxSim)。它能直接检索文本、图片和渲染后的文档页,不需要 OCR。0.6B 和 9B 共享同一嵌入空间,所以可以用 9B 建索引、用 0.6B 做查询。两者都由内部 18B ColBERT 教师蒸馏而来。

权威 Benchmark 与实测跑分对比

据模型卡,公开 ViDoRe v3 的 nDCG@10:0.6B 图像 62.3%、Markdown 61.2%;9B 图像 65.2%、Markdown 64.7%。官方称 0.6B 可比肩激活参数约 5 倍的模型。完整技术报告预计今年晚些时候发布。

开发者实战落地与开箱指南

安装 sentence-transformers ≥ 6.0.0 和 transformers ≥ 5.4.0 后,用 MultiVectorEncoder 加载 9B 或 0.6B 即可,许可为 MIT。文本批和图像批要分开编码,不支持图文混合输入;用 PyLate 时要注意 Q/D 标记的位置。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。