在长达数小时的长视频理解与长程时序智能体决策中,模型必须通过数十步推理连续收集跨片段证据。然而现有方法普遍采用“仅追加”(Append-Only)的工作记忆模式,随着上下文不断塞入新观测,核心证据的注意力迅速坍缩,智能体无法有效调取先前已发现的关键事实——这种系统性记忆失调现象被正式命名为“语义抖动”(Semantic Thrashing)。罗切斯特大学与微软研究院团队推出 VideoLoop 双循环工作记忆智能体:设计了外层全局推理循环与内层工作记忆重写循环。内层循环在每一步后从无边界文件系统中按需检索历史观测与中间分析,并在有限大小的工作记忆中动态执行提炼与覆写。VideoLoop 作为即插即用框架覆盖四大主流大模型底座,在 VideoMME(长视频)基准上平均提升 4.2 个百分点,配合 Gemini 3.1 Pro 达到 88.3% 历史新高,彻底根治了超长时序智能体的上下文注意力崩溃难题。

核心要点速览 (Key Takeaways)

  • ✓首次形式化定义“语义抖动”(Semantic Thrashing):严格证明了仅追加式(Append-Only)线性记忆架构在没有显式重写算子(Rewrite Operator)的情况下,无法从根本上消除噪声累积与注意力分散。
  • ✓内外双循环工作记忆系统:外层负责宏观时序推理,内层在每步结束后从无限制外部文件系统索引历史切片,并将当前上下文覆写精炼为一个有界(Bounded)的高信噪比工作记忆。
  • ✓VideoMME 斩获 88.3% 破纪录得分:在 VideoMME 长视频最难的 25% 题目上,仅读工作记忆的盲审模型准确率从 60.9% 暴涨至 81.1%;结合 Gemini 3.1 Pro 斩获 88.3%,并在 VideoMMMU 达 88.8%。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 处理长达数小时的长视频审阅、复杂监控追溯或自动化自动驾驶仿真时,多模态长程智能体(LVLM Agent)必须在长达数十甚至数百步的交互中不断检索、暂存并综合时空证据。然而,工业界普遍采用的“仅追加日志式”(Append-Only)上下文管理方案在此类任务中遭遇致命瓶颈: 1. 语义抖动(Semantic Thrashing):当输入的多轮观测记录无节制膨胀时,注意力机制被海量无关背景噪声严重稀释。模型不仅会把早已找到的核心事实挤出有效注意力窗口,更会在记忆混乱中反复翻看无效切片,陷入类似操作系统内存换页颠簸的死循环; 2. 缺乏状态覆写与重构能力:现有的上下文管理要么依赖暴力截断,要么依赖只增不减的拼接,缺乏像人类工作记忆一样“边读边整理、不断重写提炼摘要”的动态维护机制。 ### 架构亮点与底层机制 罗切斯特大学与微软研究院联合团队提出 VideoLoop 架构,将工作记忆维护抽象为双重解耦循环: 1. 内外双重循环解耦拓扑: - 外层推理循环(Outer Loop):专注于宏观任务规划与视频探针下发,决定下一步重点观察哪一时段; - 内层重写循环(Inner Loop):在每个外层步结束后被触发,利用专门的重写算子(Rewrite Operator),从基于持久化文件系统的无限历史观测库中按需拉取关键证据片段,并在严格限制长度(Bounded)的工作记忆槽中执行覆写与浓缩; 2. 无边界外部存储 + 有界工作记忆:彻底将“原始观测归档”与“决策活跃上下文”进行物理隔离,使 LLM 的上下文窗口永远保持在最高信噪比区间。 ### 权威 Benchmark 与实测跑分对比 - 权威长视频基准全线突破:VideoLoop 在主流开源与商业模型上展现出通用的即插即用加速效果,在 VideoMME(长视频)评测中平均带来 +4.2 个百分点 的绝对净增益; - 盲审测试根治语义抖动:在 VideoMME 长视频难度最高的前 25% 极限试题中,让一个对视频完全不可见的评判模型仅通过阅读智能体留存的工作记忆进行答题,其准确率从传统追加模式的 60.9% 暴增至 81.1%,证实核心证据被高纯度留存; - Gemini 3.1 Pro 创历史纪录:搭载 Gemini 3.1 Pro 后,VideoLoop 在 VideoMME(长视频)达到 88.3%,在 VideoMMMU 达 88.8%,并在 LongVideoBench 达到 80.9%,刷新了业内超长时序多模态问答纪录。 ### 开发者实战落地与开箱指南 - 技术论文收录:arXiv:2609.38119 详尽披露了重写算子的提示词拓扑与有界上下文容量实验; - 长程 Agent 架构建议:无论是开发视频内容分析 Agent 还是包含海量多轮对话的桌面 Coding Agent,切忌无脑向 messages 数组不断追加历史记录。应借鉴 VideoLoop 的“外部持久化文件系统 + 定期触发重写算子精简工作内存”模式,以极低显存代价换取超高的长程推导稳定性; - 多模型即插即用:该工作记忆重写流水线无需改变模型底层权重,可作为中间件无缝集成至 LangGraph 或 AutoGen 流程中。