大语言模型能力的爆发越来越依赖高质量、可验证的智能体交互数据(SFT 与 RLVR),然而目前这类工业级训练数据的生产仍然极度依赖高技能人类专家的手工标注,难以实现随算力自然扩展的递归自我进化(Recursive Self-Improvement, RSI)。香港中文大学、思谋科技等联合团队推出首个直接对齐工业数据验收标准的智能体自主数据合成评测基准 AutoDataBench。与以往必须花费高昂算力训练一个完整下游模型才能检验数据质量的间接做法不同,AutoDataBench 模拟生产流水线验收准则,直接对智能体单一样本生成结果的合法性、新颖度、挑战难度以及行为覆盖度进行样本级严苛打分。实测显示:在 45 分钟默认测试时预算下,当前顶级智能体得分均未超过 20/100;然而将时间预算增加 4 倍后,优质可用样本的产出率大幅跃升且单样本生产成本保持稳定,充分证实智能体具备完全自主生产高质量训练数据的潜力,但亟待突破推理效率瓶颈。

核心要点速览 (Key Takeaways)

  • ✓首创工业生产级单样本验收评估:打破必须重新预训练或微调模型才能反向评测合成数据好坏的昂贵陈规,建立直接评估单条任务合法性、新颖度与行为覆盖率的自动化流水线。
  • ✓大模型自主数据合成实测现状:在 45 分钟默认预算下,当前主流顶级 Coding Agent 得分普遍低于 20 分(满分 100),揭示自主构建自进化数据与单纯解题之间存在巨大的认知落差。
  • ✓算力扩展验证 RSI 可行性:将智能体测试时思考与验证时间延长 4 倍后,有效可用任务产出率显著跃升,且折算到单个可用样本的算力成本近乎恒定,证实以算力替代人类标注员的数据自产范式完全走得通。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 当前前沿大模型能力的持续突破,核心驱动力已从单纯的模型架构堆叠转向高质量可验证数据(SFT 与 RLVR 数据飞轮)。然而,在现实工业生产中,构建包含真实执行环境、高保真边界断言与严格评分准则的智能体训练任务,仍然极度依赖全球高水平标注工程师的人力堆砌: 1. 专家人力成本不可持续:随着模型能力逼近人类专家,由人撰写更难、更新颖的代码与系统级任务不仅薪酬昂贵,更面临严重的认知上限; 2. 自进化数据评估的算力黑洞:学术界此前评估“AI 能否自主编写训练数据”通常采用端到端重新微调小模型的方法,单次验证动辄耗费数千 GPU 算力时,既无法定位具体脏数据,更无法匹配工业数据流水线“单样本准入、逐条严审”的交付实务。 ### 架构亮点与底层机制 香港中文大学联合思谋科技等机构学者推出了首个面向智能体自主数据生成的评测基准 AutoDataBench: 1. 工业流水线样本级准入验收:给定原始基准任务以及目标模型挑战失败的执行日志(Trajectory),要求数据生成智能体自主编写一道同属该评测套件但具备全新解题路径的高质量可验证新任务,并从以下四大工业验收维度进行全自动无损裁决: - 合法性(Validity):任务环境可完全重现,判定测试用例逻辑严密,真值答案唯一可解; - 新颖性(Novelty):绝非简单的数字替换或变量重命名,必须具备全新的推导拓扑; - 难度梯度(Difficulty):目标模型无法轻易秒杀,具备适度的认知阻力; - 行为覆盖(Behavioral Coverage):激发模型调用多工具协同、环境探索等复合行为; 2. 免训练闭环验证:完全摆脱了对下游微调训练的重度依赖,实现毫秒级自动化验收与多维度归因分析。 ### 权威 Benchmark 与实测跑分对比 - 严峻的生成基线现状:在三个涵盖真实软件工程与命令行执行的复杂智能体任务集上,设置 45 分钟标准测试时预算时,包括 GPT-4o、Claude 3.5 Sonnet 在内的所有顶级智能体得分普遍在 20 分以下(满分 100 分),暴露出现阶段智能体在“创造任务并设计验证断言”这一元认知维度的严重不足; - 测试时算力扩展(Test-Time Scaling)释放潜力:当为表现最强的智能体提供 4 倍思考与环境反复调试时间预算时,其综合通过率呈现出陡峭上升趋势; - 单样本边际成本保持恒定:令人振奋的是,尽管单次尝试耗时更长,但由于有效合格样本比例成倍提高,折算到单个最终可用优质样本的综合算力成本几乎完全持平,为工业界利用廉价离线算力替代高昂标注团队提供了坚实的经济学与工程学依据。 ### 开发者实战落地与开箱指南 - 开源代码与基准套件:代码、评测工具与数据集已全部开源在 GitHub(StarDewXXX/AutoDataBench); - 自研数据飞轮落地指引:构建企业自研 Agent 的开发团队可直接将 AutoDataBench 的准入校验器集成至离线数据生产流中,让主力模型扮演“出题人”生成海量回归任务,经四维准入判定后直接打入 RLVR 训练池; - 演进路线:团队正持续扩展跨多文件仓库级任务生成,并探索通过自对弈(Self-Play)形成更高效的任务生成博弈格局。