OpenAI 公布首个“垂直 SaaS 共建”计算机操作研究:与合同平台 Ironclad 共同定义 11 个法务/采购/商务任务,在 Ironclad 托管环境里用 RL 训练 GPT-6 Astra。Astra 平均 rubric 得分 55.0%(GPT-5.6 Sol 41.6%),估算单次耗时 19.2 分钟 vs 37.0 分钟;内部模型已达 63.7%。OpenAI 同时开放软件公司申请合作。

核心要点速览

  • ✓11 个真实合同任务、每个 8–50 条评分标准;资深用户人工约需 30–40 分钟/任务(OpenAI 原文)
  • ✓GPT-6 Astra(Max 推理)平均得分 55.0%,GPT-5.6 Sol(High 推理)41.6%,相对提升约 32%
  • ✓估算单次耗时 37.0 → 19.2 分钟(约 -48%);注意这是按模型速度模拟的时间,不是客户实测节省
  • ✓演示任务中 Astra 约 20 分钟满足 ~94% 标准,Sol 约 32 分钟满足 ~85%;内部研发模型已到 63.7%
  • ✓训练数据来自 SEC EDGAR 公开合同并去除个人信息,未用 OpenAI 或 Ironclad 客户数据
OpenAI 联手 Ironclad 用强化学习训练 GPT-6 Astra 操作专业软件:合同工作流得分 55.0%(Sol 41.6%),单次耗时减半
🖼️要闻配图
点击全屏高清查看
🧭

把技术选型换算成你的开发预算

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

通用计算机操作 Agent 会点网页、填表,但一进入垂直专业软件就容易翻车:合同平台里的审批阈值、法务条款、采购流程彼此耦合,Agent 只要中途忘掉一条业务规则,整个流程就不可交付。OpenAI 在 官方博文 中宣布与合同平台 Ironclad 共建训练与评测,这是它首次公开“与软件厂商一起把真实工作流变成 RL 训练题”的路线。

架构亮点与底层机制

  • 任务来自懂业务的人:Ironclad 员工与内部用户筛出 11 个法务、商务、采购任务,例如配置 NDA 流程、按金额阈值路由财务审批、让可复用条款随管辖地自动变化。
  • 细粒度 rubric:每个任务 8–50 条标准,不只看单步对错,而要求最终流程在高于/低于阈值等多种情形下都正确。
  • 可练习的环境 + RL:Ironclad 提供托管产品环境;OpenAI 基于 SEC EDGAR 公开合同(已过滤个人信息)合成训练任务,用强化学习让模型在反馈中迭代。

权威 Benchmark 与实测跑分对比

指标GPT-5.6 Sol (High)GPT-6 Astra (Max)
平均 rubric 得分41.6%55.0%
估算单次耗时37.0 分钟19.2 分钟

演示任务中 Astra 约 20 分钟满足约 94% 标准,Sol 约 32 分钟满足约 85%;一个内部研发模型已达 63.7%。注意:这只是 11 个研究任务,时间为按模型速度推算的模拟值,并非客户实测,也不代表全部 Ironclad 工作流。

开发者实战落地与开箱指南

  1. 做企业 Agent 的团队可直接借鉴这套方法:先和领域专家定任务,再写多条件 rubric,最后搭沙箱环境让模型反复练。
  2. 若你的 SaaS 有“Agent 还做不好”的高价值任务,OpenAI 正邀请少量软件公司合作,需要提供失败证据、成功判据、安全测试环境与可用于研究的数据。
  3. 评估自家 Agent 时,优先测“端到端流程是否在所有分支下成立”,而非单步点击准确率。
实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。