OpenAI 于 2026-10-06 发布 Sharing AI progress in mathematics,把一个尚未发布的内部前沿模型产出的数学结果整体公开到 openai/math(Apache-2.0):722 篇手稿归入 372 个结果族,来自约 4,000 道开放问题的评测,平均每个结果耗费约 3 小时 ChatGPT Pro 思考算力;附 10 份推理摘要与部分 Lean 形式化证明。OpenAI 承认未形式化结果可能存在问题,且尚未经同行评审。
核心要点速览
- ✓规模:722 篇手稿 / 372 个结果族,从约 4,000 道开放问题的评测中筛出
- ✓算力:平均每个结果约等于 3 小时 ChatGPT Pro 思考算力(同一内部未发布模型、固定流程)
- ✓可核验:372 个结果族中 235 个附 Lean 链接,formalization.yaml 列出 162 篇主结果已形式化的论文,可用 Comparator 校验
- ✓透明度:公开 10 份推理摘要(π 的无理性指数、Mahler 猜想、自由群因子同构等),并按 IAS 数学与 AI 顾问组建议设修订/引用协议
- ✓风险提示:OpenAI 自承部分未形式化结果可能有误,全部尚未经同行评审;生成模型暂未开放

开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
README 坦言,OpenAI 内部数学评测已经“饱和”,于是改用开放研究问题来测模型。真正的难点在于:AI 一口气产出数百篇论文,数学界审不过来,也难判断真伪。为此 OpenAI 参考了 IAS 旗下数学与 AI 顾问组的公开建议,把全部结果放进 GitHub,配上版本修订与引用规则。
架构亮点与底层机制
绝大多数结果出自同一个未发布的内部模型、同一套固定流程。家族 003 声称 Dirichlet L 函数(含 ζ)在 Re s>7/8 无零点,即“准黎曼假设”;家族 032 声称证明了 CM 阿贝尔簇的有理 Hodge 猜想。另有 π 的无理性指数为 2、Mahler 猜想、自由群因子同构等。按 README 说明,ζ 零点区域与 Hodge 两项工作不在固定流程内,11/12 那篇的写作还经过人工润色。
权威 Benchmark 与实测跑分对比
这次没有发布常规跑分。可核查的数字如下:约 4,000 道题,筛出 722 篇手稿、372 个结果族,平均每个结果约 3 小时 Pro 算力;372 个家族中有 235 个附 Lean 链接,162 篇论文的主结果已形式化。仓库上线约 2 小时,星标就过了 1,400。
开发者实战落地与开箱指南
克隆 openai/math,先看 overview.pdf 和 CONTENTS.md。在 lean/ 目录下依次执行 lake exe cache get 和 lake env comparator ComparatorChallenges/QuasiRiemannHypothesis.json,即可用 Comparator 验证。整库编译若失败,需调大 vm.max_map_count。引用前请再次确认,因为这些结果都还没经过同行评审。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察