在复杂终端操作系统运维与代码修复任务中,收集高难度问题的成功解决轨迹对于大模型后期微调(SFT)至关重要。然而高难任务往往依赖带有特化先验与调试介入的专用外壳(Specialized Harnesses),这些外壳在生产真实部署时无法复现,且直接在专用外壳轨迹上微调会导致严重的“外壳过拟合”与测试泄漏。来自马里兰大学(UMD)与腾讯 AI Lab 团队推出了 RSR(Recursive Self-Rewrite)递归自重写架构:仅利用单一 Qwen-3.8-27B 底座,构建包含规划器(提取可复用操作规程 Runbook)、批判员(过滤验证器泄露并指导递归重构)与执行器(在纯净独立沙箱中复现)的三位一体工作流。在 3,000 个终端任务实测中,RSR 将 2,001 条高杂质源轨迹递归重写扩增为 11,094 条通用沙箱标准轨迹;微调后驱动模型在 Terminal-Bench 2 上 Pass@3 飙升至 74.2%,在极难评测 Terminal-Bench Hard 上成功率从 39.0% 暴拉至 63.0%。

核心要点速览

  • ✓首创 RSR 递归自重写架构,仅依托单模型自主将特化外壳高杂质轨迹提炼为通用无泄露训练数据
  • ✓将 2,001 条特异源轨迹自动化清洗扩增为 11,094 条纯净沙箱可复现轨迹(扩增超 5.5 倍)
  • ✓微调驱动 Terminal-Bench 2 Pass@3 跃升至 74.2%,极难基准 Terminal-Bench Hard 成功率由 39% 狂拉至 63%
终端智能体轨迹自进化!马里兰等提出 RSR 递归自重写:从特化外壳蒸馏通用能力,Terminal-Bench Hard 暴涨至 63%
🖼️要闻配图
点击全屏高清查看
🧭

把技术选型换算成你的开发预算

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

在操作系统运维、云原生容器调度以及硬核系统软件修复等终端智能体(Terminal Agents)场景中,任务天然具备超长交互步骤、复杂的环境变量依赖以及苛刻的确定性报错。为了在训练前期攻克超难终端难题,算法团队往往开发了形形色色的“特化外壳(Specialized Harnesses)”——例如提供预置目录提示、注入临时辅助探针或定制断言工具。虽然这些特化外壳能帮助模型侥幸通关并留下宝贵的成功轨迹,但如果直接将这些带有外部介入的轨迹用于监督微调(SFT),模型便会严重患上“外壳依赖症”;一旦在真实无干预的标准通用生产终端环境中部署,智能体由于失去辅助支架便会全面瘫痪。

架构亮点与底层机制

针对特化外壳轨迹无法向通用部署泛化的结构性矛盾,联合研发团队提出了 RSR(Recursive Self-Rewrite)递归自重写数据扩增流水线:

  1. 单模型自组织三位一体流水线(Single-Model Tripartite Pipeline):完全基于同一个开源底座 Qwen-3.8-27B,通过角色 Prompt 划分出规划器(Planner)、批判员(Critic)与执行器(Executor),实现零外部模型依赖的闭环数据自提炼;
  2. 操作规程(Runbook)抽象与解耦:规划器从多源特化外壳记录的杂乱执行流中,精准剥离特定外壳的私有注入逻辑,将核心问题拆解为具备普适性指导价值的标准操作规程 Runbook;
  3. 防作弊批判与递归重构机制(Leakage-Proof Recursive Critic):批判员对 Runbook 与历史交互进行全方位安全审查,严苛过滤测试套件泄漏(Verifier Leakage)与隐式答案透传,针对瑕疵步骤递归指示规划器重新编写;
  4. 通用全新沙箱独立复现验证(Fresh Sandbox Execution):执行器严格在没有任何辅助支架的纯净通用终端沙箱(General Harness)中逐行复现 Runbook,唯有在空白环境中完全自洽且顺利通关的轨迹,才被准入最终的微调数据池。

权威 Benchmark 与实测跑分对比

在跨越 3,000 个复杂自建终端任务以及权威开源基准的严酷考验中,RSR 展现出了强大的数据放大与能力跃迁效果:

  1. 高质量合成轨迹 5.5 倍无损倍增:RSR 成功从 2,001 条特异源轨迹中,提炼并衍生出 11,094 条通用沙箱合规高质量轨迹,解决了高难度代码轨迹严重稀缺的问题;
  2. Terminal-Bench 2 Pass@3 狂涨至 74.2%:经过 RSR 轨迹微调的模型在权威 Terminal-Bench 2 上的 Pass@3 表现由原始基座的 57.0% 大幅跃升至 74.2%;在极度严苛的 Terminal-Bench 4 上实现从 1.5% 到 9.1% 的数倍突破;
  3. 极难基准 Terminal-Bench Hard 斩获 63.0%:在最具挑战的 Terminal-Bench Hard 评测中,任务成功率由 39.0% 暴增至 63.0%(净增 24 个百分点),在长程过程奖励(Process Reward)上从 0.21 显著攀升至 0.29。

开发者实战落地与开箱指南

RSR 的数据重构流水线与训练配方已正式公开发布。对于正在研发企业级运维 Copilot、CI/CD 自动化修复 Agent 以及 Linux 桌面助手的技术团队,RSR 提供了一套极其高明的“数据脱敏与去外壳化”工程解法。开发者可以在内部用最强辅助工具攻克难题,随后利用 RSR 自动化将其降维重构为通用终端标准解答,以极低的数据清洗成本,让单体终端智能体在无任何外部支架的白盒环境中展现出顶级系统工程师般的自主攻坚硬实力。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。