LatentPress 提出第三种上下文载体:连续 memory tokens。小 writer(约 4.2M–26.2M 参数适配器,约等于解码器 0.1%)把对话史与长文档压成 4–16×,冻结 decoder 经输入嵌入接口直接读取,推理时无需重建文本。LongMemEval 上 7.70× 压缩准确率 0.504,高于未压缩证据 0.490,并明显优于文本摘要与 OCR 压缩;写入约 43ms/会话,读取比原始上下文快 5–9×,利于长上下文智能体记忆。
核心要点速览 (Key Takeaways)
- ✓表示:连续 memory tokens,冻结 LLM 经嵌入接口直读,无需重建文本。
- ✓压缩:4–16×;LongMemEval 7.70× 时准确率 0.504,高于未压缩 0.490。
- ✓效率:写入约 43ms/会话,读取比原始上下文快 5–9×,适配长上下文智能体。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察