自主深度研究智能体(Deep Research Agents)正在从传统的纯文本网页检索,全面迈向针对图像细节、复杂图表与长视频的跨模态研究任务。然而,现有多模态模型在面对单图、多图与长视频输入时,往往无法精确定位细粒度视觉锚点,缺乏从画面线索跨越到外部搜索验证的严密逻辑链条。复旦大学等联合研究团队在最新研究(arXiv:2610.12419)中发布了 OneSearch-VL:业界首个针对图像与长视频全场景的统一多模态深度研究智能体框架。OneSearch-VL 创新性地提出了‘视觉锚定证据图(VGEG)’架构,将视觉定位、外部工具检索、实体关联与事实聚合显式编码为统一的依赖图谱。基于 VGEG,团队构建了包含 110K 样本的 SFT 数据集与 10K 样本的强化学习(RL)数据集,并在后训练中引入了证据感知的视觉对齐奖励函数(EVGR)。在专门针对多图与长视频深度研究的全新评测集 OneSearch-MI-Bench 与 OneSearch-Video-Bench 上,仅 8B 参数的 OneSearch-VL-8B 相比挂载工具的 Qwen3-VL-8B 成功率分别大幅跃升 20.2 和 17.6 个百分点,并在 7 项传统图像基准与 VideoDR 上全线刷新纪录,官方代码已开源。
核心要点速览
- ✓复旦等开源 OneSearch-VL,首创基于视觉锚定证据图(VGEG)的统一图像与视频深度研究智能体
- ✓在多图与长视频基准上超越挂载工具的 Qwen3-VL-8B 高达 20.2 和 17.6 个百分点,视觉引证可靠率达 91.8%
- ✓开源 110K SFT 与 10K RL 数据集及 EVGR 细粒度过程奖励,为多模态 Agent 奠定可追溯工程标准
把技术选型换算成你的开发预算
40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
随着 OpenAI Deep Research 等系统的流行,自主信息检索与长程研报生成已成为智能体落地的战略高地。然而,真实世界中的大量专业研究——如医学病理影像对比、卫星遥感图跨期变化分析、长达数小时的技术演讲视频关键信息溯源——都要求智能体具备跨模态的“多模态深度研究(Multimodal Deep Research)”能力。现有的视觉语言模型(VLMs)在面对此类任务时暴露出三大致命缺陷:
- 视觉定位与事实检索严重脱节:模型在看到复杂图像时,往往只能泛泛生成粗略描述,无法精准框定局部实体并带着针对性视觉特征触发外部搜索工具;
- 多图与视频帧间的依赖漂移:面对前后数十张图像或跨越数十秒的视频片段,模型极易产生时间序列与空间维度的混淆,导致证据链断裂;
- 缺乏端到端过程监督数据:行业缺乏记录“定位视觉锚点 -> 检索外部证据 -> 逻辑事实合成”完整推演轨迹的高质量监督与强化学习数据集。
架构亮点与底层机制
针对多模态深度研究中视觉锚点与推理链条断裂的问题,复旦大学团队打造了以图谱为核心的 OneSearch-VL 统一架构(arXiv:2610.12419,开源项目 appletea233/OneSearch-VL):
- 视觉锚定证据图(VGEG)统领任务拓扑:VGEG 首次将复杂的视觉研究任务形式化为有向图结构。图节点明确区分局部视觉锚点(Bounding Box/帧号)、外部检索实体、引证事实片段以及回答生成操作,边结构则固化因果依赖,为全流程提供精准的过程级参照;
- 全流程合成数据引擎与规模化数据集:基于 VGEG 自动校验引擎,团队构建了大规模专业数据集:包含 110K 高质量专家交互轨迹的 OneSearch-VL-SFT-110K,以及包含 10K 严苛对抗样本的 OneSearch-VL-RL-10K;
- 证据感知视觉对齐细粒度奖励(EVGR):在后训练强化学习阶段,团队抛弃传统的最终答案二元打分(Binary Reward),设计了 EVGR 细粒度奖励函数。该函数对智能体在推理链条中“视觉定位是否精准”、“外部引证是否真实存在”、“逻辑推导是否忠实于图谱”展开多维度阶梯式评分,从根本上杜绝看图编造事实的幻觉。
权威 Benchmark 与实测跑分对比
研究团队设计了涵盖多图跨模态对比(OneSearch-MI-Bench)与长视频深度研报(OneSearch-Video-Bench)的严苛基准评测:
- 多图与视频基准大胜 20.2 / 17.6 个百分点:在包含细粒度图文交叉验证的 OneSearch-MI-Bench 上,仅 8B 参数的 OneSearch-VL-8B 相比挂载了外部搜索引擎的 Qwen3-VL-8B 准确率高出 20.2 个百分点;在长视频基准 OneSearch-Video-Bench 上领先 17.6 个百分点;
- 全面刷新 7 大经典基准与 VideoDR:在主流单图与多图事实问答、图表分析基准上,OneSearch-VL 全面刷新同尺寸开源多模态模型的最优水准;在专业的视频长程检索基准 VideoDR 上表现出极其出色的跨帧时间戳定位能力;
- 视觉证据溯源可靠率提升 43%:在人工与模型联合盲审中,OneSearch-VL 给出的研报中引用的外部搜索来源与图中真实物体吻合度高达 91.8%,相比基线模型的证据漂移率下降 43% 以上。
开发者实战落地与开箱指南
复旦团队已将 OneSearch-VL 的代码、模型权重与评测套件在 GitHub 全面开源(appletea233/OneSearch-VL)。对于正在开发垂直领域“多模态研报助手”、“图表分析 Coding Agent”或“视频审计 Agent”的技术团队,OneSearch-VL 提供了极具参考价值的落地架构:切忌单纯把图像 base64 喂给模型然后让其直接自由调用 Search API。工程架构应当遵循 OneSearch-VL 的设计范式:在系统提示词中规范 VGEG 结构化推理协议,强制模型先输出视觉框定坐标与特征描述,再触发针对性的检索指令,最后依托局部证据池完成事实交叉检验,从而在复杂的视觉多模态业务中交付高精度、可追溯的专业研报。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察