腾讯与浙江大学 REAL 实验室(@huggingface)联合开源了革命性的深度搜索智能体框架 IterSynth(arXiv: 2609.29444,GitHub: Tencent/IterSynth)。针对传统 ReAct 智能体将规划、证据搜集与信息归纳单一绑定的角色耦合问题,以及多轮检索中历史上下文无限堆积导致的注意力污染难题,IterSynth 首创“规划者(Planner)与归纳者(Synthesizer)动态解耦 + 演化式摘要状态机”范式,并提出角色解耦强化学习算法(RDPO)。在 BrowseComp 与 Xbench-DS 等顶级长程深搜基准中,IterSynth-8B 平均得分达 50.7,显著超越同等规模所有前沿 Agent。

核心要点速览 (Key Takeaways)

  • ✓彻底打破传统 ReAct 智能体单一策略模型强行兼顾搜索规划与长文归纳的严重能力内卷。
  • ✓提出基于状态摘要机(Evolving Summary)的上下文压缩方案,杜绝网页多轮抓取产生的海量噪声污染。
  • ✓提出角色解耦强化学习(RDPO),结合最终收益与多轮过程细粒度 Rubric 奖惩,信用分配精准度大幅提升。
  • ✓IterSynth-8B 在 BrowseComp、Xbench-DS 等基准评测中跑出 50.7 分,且能作为通用 Prompt 范式直接赋予闭源大模型。
  • ✓完整训练脚本、评测基准与模型权重已在 GitHub 和 Hugging Face 遵照宽松开源协议全量公开。
🔬

深度技术解析与实战评估

核心背景与行业痛点 深度搜索(Deep Search)要求大模型智能体面对开放复杂问题时,自主拆解子问题、发起多轮网络检索、甄别真实证据并合成高置信度回答(如 OpenAI Deep Research、Perplexity 深度模式)。然而,现有的开源方案多采用经典的 ReAct 闭环:单个模型必须同时充当规划者、检索器和总结者。这带来了两大致命痛点:一是“角色耦合(Role Coupling)”,一个策略网络难以同时精通微观信息提取与宏观推理规划;二是“上下文无限膨胀(Context Saturation)”,随着检索页面不断累加,提示词中充斥大量无关网页噪点,导致大模型发生严重幻觉。 ### 架构亮点与底层机制 腾讯与浙大联合团队在 IterSynth 中构建了创新的系统工程: 1. 双角色解耦交互范式(Decoupled Planner & Synthesizer):将任务分解为专注挖掘核心信息缺口的“规划者(Planner)”,以及专注将最新抓取内容熔炼入核心事实的“归纳者(Synthesizer)”; 2. 演化式摘要持久层(Evolving Summary State):抛弃保存全部原始网页的粗暴做法,以持续演化的紧凑摘要作为搜索全局状态,将搜索历史的 Token 开销压缩 70% 以上,保持模型注意力高度聚焦; 3. 角色解耦策略优化算法(RDPO):在强化学习微调中,不仅考量最终答案正确率,更引入多轮细粒度 Rubric 评测机制,分别向 Planner 和 Synthesizer 反向传播独立的优势函数(Role-Specific Advantages),解决长期信用分配失真。 ### 权威 Benchmark 与实测跑分对比 在涵盖长程复杂推理的 BrowseComp、Xbench-DS 等五大严苛深度搜索基准实测中: - IterSynth-8B 平均得分达 50.7 分,较同级别最强 8B 开源基线绝对提升了 4.2%; - 在零样本(Zero-Shot)Prompting 模式下适配闭源旗舰模型(如 GPT-4o、Claude 3.5 Sonnet),其复杂事实检索回答准确率较原生 ReAct 范式提升 18.6%; - 面对包含 20+ 轮网页深度跳转的复杂场景,幻觉断言率较常规 RAG 管道下降 53.4%。 ### 开发者实战落地与开箱指南 智能体与搜索引擎开发者可按以下步骤极简落地: - 克隆 GitHub 官方仓库:git clone https://github.com/Tencent/IterSynth; - 项目提供开箱即用的 Python 推理框架与多搜索引擎(Bing、Google、Tavily)适配器; - 国内开发者可直接在 Hugging Face 页面查阅论文预印本与轻量化 8B 检查点权重。