开发者 3 秒速决决策指标
论文 arXiv:2610.02163(PDF 时间戳 2026-10-02)与项目页 autocompact.github.io 提出 AutoCompact:在终端 REPL 脚手架上给 Agent 增加可主动调用的 compact(),用裁判在线纠偏轨迹做 SFT,再以任务成败做 GRPO,把「何时压缩 / 保留什么 / 如何续跑」写进策略。基座 Qwen3-Coder-30B-A3B-Instruct;SWE-bench Verified 39.6%(基线 30.4%,+9.2 pp),SWE-PolyBench Verified 24.5%(基线 19.5%,+5.0 pp)。未见公开权重/代码仓库。
核心要点速览
- ✓官源:arXiv:2610.02163 + 项目页 autocompact.github.io;PDF Last-Modified 2026-10-02
- ✓机制:主动
compact()→# Auto Context Summary;相对长度触发压缩,按任务阶段压缩 - ✓训练:SWE-rebench 上裁判纠偏 1052 条轨迹 SFT(触发 24% / 摘要 53% / 续跑 23%);再 SWE-Gym + GRPO,奖励仅为补丁是否过测
- ✓跑分(同脚手架三跑均值):SWE-bench Verified 39.6% vs Base 30.4%(+9.2);PolyBench Verified 24.5% vs 19.5%(+5.0);RL 后主动压缩覆盖 58.5% 任务
- ✓落地提醒:论文/站点未放出训练权重或独立 GitHub 实现;当前价值在方法与对照表,勿当成可
pip install产品
Claude Code 高频使用:比较订阅额度与 API 账单
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
仓库级编码 Agent 在定位、改写、跑测之间会堆积大段探索:失败假设、长工具输出、已否决路径。长度触发压缩(接近窗口才摘要)常在阶段中途打断,或把过时噪声留到下一阶段。Claude Code / Codex 等生产 harness 目前也主要是「窗口将满再压」。AutoCompact(arXiv:2610.02163,项目页 autocompact.github.io)主张:压缩应是策略动作,由模型在任务阶段切换时主动调用,而不是只看 token 余额。
架构亮点与底层机制
脚手架仍是终端 REPL,额外暴露 compact()。调用后用模型生成的 # Auto Context Summary 替换较旧历史,保留原任务与近期轮次。作者用 GPT-5.5-Codex 作裁判,在线纠正三类失败:该不该压、摘要是否漏关键状态、压完后是否按摘要续跑;纠偏结果真正写回环境再继续滚轨迹。SWE-rebench 上得到 1052 条冷启动轨迹做 SFT(触发/摘要/续跑约 24%/53%/23%),再在 SWE-Gym 上用 GRPO、仅以补丁是否过测为奖励,把编码与压缩联合优化——无单独的压缩 shaping。
权威 Benchmark 与实测跑分对比
同基座 Qwen3-Coder-30B-A3B-Instruct、同脚手架、三跑均值(论文 Table 1):SWE-bench Verified 上 AutoCompact 39.6% vs Base 30.4%(绝对 +9.2 pp);SWE-PolyBench Verified 24.5% vs 19.5%(+5.0 pp)。相对 SelfCompact / SWE-Compressor / CompactionRL 等同表方法亦居首。256K 下无轨迹触达强制压缩阈值仍有增益;16K 与基线共享强制回退时仍领先。RL 后主动压缩覆盖从 SFT 的 44.3% 升到 58.5%;忽略同一 checkpoint 的 compact() 会掉分,说明收益不全是「训过」 alone。勿外推到其他基座或 Claude/Codex 官方产品分。
开发者实战落地与开箱指南
- 先读:项目页 与 arXiv HTML——交互示意把 Keep/Summarize/Drop 讲清楚。
- 预期:本稿检索未见独立 GitHub 实现或公开权重;短期只能复现思路,不能
npx开箱。 - 可借鉴:在自建 Agent 加显式
compact工具;评估时做「执行 vs 忽略摘要」消融;优先在阶段边界(定位完成→开始改码)压,而不是只盯长度。 - 对照生产:Codex/Claude Code 仍偏长度触发——论文 Limitations 亦建议未来与官方 harness 组合。
- 跟踪:以 arXiv / 项目页为准;有权重或代码仓再升级本条。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察