OpenAI 公布首个“垂直 SaaS 共建”计算机操作研究:与合同平台 Ironclad 共同定义 11 个法务/采购/商务任务,在 Ironclad 托管环境里用 RL 训练 GPT-6 Astra。Astra 平均 rubric 得分 55.0%(GPT-5.6 Sol 41.6%),估算单次耗时 19.2 分钟 vs 37.0 分钟;内部模型已达 63.7%。OpenAI 同时开放软件公司申请合作。
核心要点速览

开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
通用计算机操作 Agent 会点网页、填表,但一进入垂直专业软件就容易翻车:合同平台里的审批阈值、法务条款、采购流程彼此耦合,Agent 只要中途忘掉一条业务规则,整个流程就不可交付。OpenAI 在 官方博文 中宣布与合同平台 Ironclad 共建训练与评测,这是它首次公开“与软件厂商一起把真实工作流变成 RL 训练题”的路线。
架构亮点与底层机制
- 任务来自懂业务的人:Ironclad 员工与内部用户筛出 11 个法务、商务、采购任务,例如配置 NDA 流程、按金额阈值路由财务审批、让可复用条款随管辖地自动变化。
- 细粒度 rubric:每个任务 8–50 条标准,不只看单步对错,而要求最终流程在高于/低于阈值等多种情形下都正确。
- 可练习的环境 + RL:Ironclad 提供托管产品环境;OpenAI 基于 SEC EDGAR 公开合同(已过滤个人信息)合成训练任务,用强化学习让模型在反馈中迭代。
权威 Benchmark 与实测跑分对比
| 指标 | GPT-5.6 Sol (High) | GPT-6 Astra (Max) |
|---|---|---|
| 平均 rubric 得分 | 41.6% | 55.0% |
| 估算单次耗时 | 37.0 分钟 | 19.2 分钟 |
演示任务中 Astra 约 20 分钟满足约 94% 标准,Sol 约 32 分钟满足约 85%;一个内部研发模型已达 63.7%。注意:这只是 11 个研究任务,时间为按模型速度推算的模拟值,并非客户实测,也不代表全部 Ironclad 工作流。
开发者实战落地与开箱指南
- 做企业 Agent 的团队可直接借鉴这套方法:先和领域专家定任务,再写多条件 rubric,最后搭沙箱环境让模型反复练。
- 若你的 SaaS 有“Agent 还做不好”的高价值任务,OpenAI 正邀请少量软件公司合作,需要提供失败证据、成功判据、安全测试环境与可用于研究的数据。
- 评估自家 Agent 时,优先测“端到端流程是否在所有分支下成立”,而非单步点击准确率。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察