开发环境平台 Daytona 联合 HUD Evals 发布强化学习微调指南。展示如何从单台笔记本起步并利用 Daytona 弹性沙箱集群扩展大规模 RL 训练:在 10 步微调中创建 1272 个沙箱且零故障,使留出集 Bug 修复成功率从 35.9% 跃升至 81.2%。

核心要点速览 (Key Takeaways)

  • 将研究级强化学习工程化:提供从单机原型验证到千级生产沙箱规模化训练的完整可复现脚本;
  • 在 1272 次沙箱动态拉起与销毁中实现零失败率,验证了 Daytona 在高频 RL 训练中的稳定性;
  • 在真实的留出代码任务测试集上实现 45.3 个百分点的准确率飞跃,为编程智能体专用微调提供了标准范式。