大语言模型能力的爆发越来越依赖高质量、可验证的智能体交互数据(SFT 与 RLVR),然而目前这类工业级训练数据的生产仍然极度依赖高技能人类专家的手工标注,难以实现随算力自然扩展的递归自我进化(Recursive Self-Improvement, RSI)。香港中文大学、思谋科技等联合团队推出首个直接对齐工业数据验收标准的智能体自主数据合成评测基准 AutoDataBench。与以往必须花费高昂算力训练一个完整下游模型才能检验数据质量的间接做法不同,AutoDataBench 模拟生产流水线验收准则,直接对智能体单一样本生成结果的合法性、新颖度、挑战难度以及行为覆盖度进行样本级严苛打分。实测显示:在 45 分钟默认测试时预算下,当前顶级智能体得分均未超过 20/100;然而将时间预算增加 4 倍后,优质可用样本的产出率大幅跃升且单样本生产成本保持稳定,充分证实智能体具备完全自主生产高质量训练数据的潜力,但亟待突破推理效率瓶颈。
核心要点速览 (Key Takeaways)
- ✓首创工业生产级单样本验收评估:打破必须重新预训练或微调模型才能反向评测合成数据好坏的昂贵陈规,建立直接评估单条任务合法性、新颖度与行为覆盖率的自动化流水线。
- ✓大模型自主数据合成实测现状:在 45 分钟默认预算下,当前主流顶级 Coding Agent 得分普遍低于 20 分(满分 100),揭示自主构建自进化数据与单纯解题之间存在巨大的认知落差。
- ✓算力扩展验证 RSI 可行性:将智能体测试时思考与验证时间延长 4 倍后,有效可用任务产出率显著跃升,且折算到单个可用样本的算力成本近乎恒定,证实以算力替代人类标注员的数据自产范式完全走得通。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察