在长达数小时的长视频理解与长程时序智能体决策中,模型必须通过数十步推理连续收集跨片段证据。然而现有方法普遍采用“仅追加”(Append-Only)的工作记忆模式,随着上下文不断塞入新观测,核心证据的注意力迅速坍缩,智能体无法有效调取先前已发现的关键事实——这种系统性记忆失调现象被正式命名为“语义抖动”(Semantic Thrashing)。罗切斯特大学与微软研究院团队推出 VideoLoop 双循环工作记忆智能体:设计了外层全局推理循环与内层工作记忆重写循环。内层循环在每一步后从无边界文件系统中按需检索历史观测与中间分析,并在有限大小的工作记忆中动态执行提炼与覆写。VideoLoop 作为即插即用框架覆盖四大主流大模型底座,在 VideoMME(长视频)基准上平均提升 4.2 个百分点,配合 Gemini 3.1 Pro 达到 88.3% 历史新高,彻底根治了超长时序智能体的上下文注意力崩溃难题。
核心要点速览 (Key Takeaways)
- ✓首次形式化定义“语义抖动”(Semantic Thrashing):严格证明了仅追加式(Append-Only)线性记忆架构在没有显式重写算子(Rewrite Operator)的情况下,无法从根本上消除噪声累积与注意力分散。
- ✓内外双循环工作记忆系统:外层负责宏观时序推理,内层在每步结束后从无限制外部文件系统索引历史切片,并将当前上下文覆写精炼为一个有界(Bounded)的高信噪比工作记忆。
- ✓VideoMME 斩获 88.3% 破纪录得分:在 VideoMME 长视频最难的 25% 题目上,仅读工作记忆的盲审模型准确率从 60.9% 暴涨至 81.1%;结合 Gemini 3.1 Pro 斩获 88.3%,并在 VideoMMMU 达 88.8%。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察