在大规模企业私有知识库与多文档代码工程中,回答复杂多跳问题通常需要将分散在不同文件中的碎片化证据严密串联(如将立项审批、需求设计与最新上线状态三者关联)。当代大模型检索智能体(Search Agent)在面对扁平化的海量文档时,只能盲目发起多轮关键词或向量检索,由于单个文档无法提供与其他文件的关联脉络,智能体在每次遇到新问题时都被迫重新穷举探索,不仅频繁遗漏关键互补证据,更在冗余交互中烧毁海量 Token。韩国科学技术院(KAIST)联合微软研究院团队推出 CorpusMap 实体图谱导航层:在离线阶段自动抽取并对齐整个文档集中反复出现的核心实体(Entity),为每个实体构建聚合页面(Entity Page)并双向链接所有提及它的原始文档。在检索时,智能体只需沿着实体图谱进行拓扑漫游,即可一站式捞取分散在全库的关联事实。实测表明,CorpusMap 在显著减少 Token 消耗的同时大幅提高证据召回完整度,全面击败包含纯扁平检索在内的 4 种替代导航架构。

核心要点速览 (Key Takeaways)

  • ✓离线实体图谱终结在线盲目探索:通过离线实体消歧与对齐构建跨文档 Entity Page,将扁平死板的文件库升维为带拓扑连接的导航图谱,避免智能体每轮查询时重复探索关系。
  • ✓显著压降检索 Token 消耗:智能体无需多次调用大模型进行漫无目的的宽表盲搜,沿着实体聚合页直接获取精准互补证据,大幅降低单次复杂多跳问答的端到端 Token 开销。
  • ✓7 大主流模型一致验证:在 3 个多文档硬核基准上实测,CorpusMap 全面超越原始文档检索并击败 4 种主流导航层基线,证实实体是连接异构知识孤岛最坚固的语义锚点。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 在企业知识管理、法务审计与大型代码仓库维护中,高阶业务咨询往往涉及复杂的跨文档多跳证据关联。例如,用户提问“某核心微服务在去年的重构中为什么移除了某接口”,相关的事实往往分散在 PR 审批记录、产品需求文档(PRD)以及架构委员会决议三份彼此隔离的文档中。 然而,现有的 RAG 与检索智能体在面对此场景时极度吃力: 1. 扁平化文档孤岛导致重复探索:传统知识库将文件作为平铺的孤立个体存储,单篇文档无法提供其与其他文件的关联指针。智能体在在线查询时,被迫使用大模型反复发起多轮模糊检索,耗尽 Token 却仍然找不到互补文档; 2. 检索链断裂与注意力饱和:由于缺乏确定性导航指引,智能体抓取了大量半相关的无用上下文,导致核心答案被淹没,发生严重的幻觉推理。 ### 架构亮点与底层机制 KAIST 联合微软团队提出 CorpusMap,在扁平文档库之上搭建了一层实体级结构化导航图谱: 1. 实体聚合页(Entity Pages)离线构建:在离线建库阶段,利用实体识别与消歧技术,在全库范围捕捉高频出现的核心业务实体(系统模块名、人员、协议字段、业务代号)。为每个实体自动建立专属聚合主页,汇总其属性摘要,并双向锚定全库所有提及该实体的源文档; 2. 实体-文档二分拓扑图漫游:将原先孤立的文档集转化为“文档 $\leftrightarrow$ 实体”的连通图。智能体在执行任务时,可以沿着实体跳跃快速从一个源文档定位到其在另一个仓库的补充材料,避免无头苍蝇般的盲目扫库; 3. 离线一次性计算,全量在线复用:图谱构建开销完全在离线完成,多个不同用户的并发请求均可共享同一张拓扑网,无需在每次推理时重新挖掘实体关系。 ### 权威 Benchmark 与实测跑分对比 研究人员选用包含开源旗舰在内的 7 款主流大模型,在 3 个多文档多跳检索基准 上展开了全方位横向评测: - 证据召回完整度大幅提升:相比于直接在原始扁平文档库上运行的传统 Search Agent,接入 CorpusMap 的智能体在跨文档证据覆盖率上取得显著领先,大幅减少遗漏关键前置条件的情况; - 推理 Token 消耗大幅下降:由于定位路径精准,智能体平均检索轮数减少约 40%,每次任务所消耗的上下文 Prompt Token 总量呈现断崖式下跌; - 完胜 4 种替代导航方案:相比传统的文档聚类树(Hierarchical Tree)、BM25 关键词索引以及静态超链接拓扑,基于实体的图谱展现出最高的拓扑通用性与答案真实度。 ### 开发者实战落地与开箱指南 - 技术论文收录:arXiv:2609.37226 详细给出了实体抽取提示词、消歧阈值以及二分图存储格式; - 企业级 RAG 系统改造建议:对于正在构建大型企业内网助手或跨仓库代码搜索的团队,强烈建议在向量检索前置接入“实体图谱导航层”。提取代码中的函数名、类名、数据表字段作为实体构建 Entity Page,可将智能体跨库排查效率提升数倍; - 生态集成:该方案非常容易以自定义 Tool 形式挂载入 LangChain 或 LlamaIndex,充当 Agent 的拓扑路标工具。