Hugging Face 论文页披露《An Empirical Study of Harness Design for Coding Agents》:在固定执行循环下拆开规划、动作空间与上下文管理,用 4 个模型在 SWE-Bench Verified 与 Terminal-Bench 2.1 上跑 176 组对照。核心结论包括:上下文变紧时上下文管理价值上升(主要靠防止溢出失败);规则省略再接 LLM 摘要效率最佳;规划对弱模型更像精度脚手架、对强模型收益变弱。

核心要点速览 (Key Takeaways)

  • 固定执行循环,单独消融规划、动作空间与上下文管理,共 176 组对照。
  • 评测覆盖 SWE-Bench Verified 与 Terminal-Bench 2.1,跨 4 个模型。
  • 上下文越紧管理越重要;规则省略+LLM 摘要效率最佳;规划对弱模型更有用。
ADSponsored