OpenAI 于 2026-10-06 发布 Sharing AI progress in mathematics,把一个尚未发布的内部前沿模型产出的数学结果整体公开到 openai/math(Apache-2.0):722 篇手稿归入 372 个结果族,来自约 4,000 道开放问题的评测,平均每个结果耗费约 3 小时 ChatGPT Pro 思考算力;附 10 份推理摘要与部分 Lean 形式化证明。OpenAI 承认未形式化结果可能存在问题,且尚未经同行评审。

核心要点速览

  • ✓规模:722 篇手稿 / 372 个结果族,从约 4,000 道开放问题的评测中筛出
  • ✓算力:平均每个结果约等于 3 小时 ChatGPT Pro 思考算力(同一内部未发布模型、固定流程)
  • ✓可核验:372 个结果族中 235 个附 Lean 链接,formalization.yaml 列出 162 篇主结果已形式化的论文,可用 Comparator 校验
  • ✓透明度:公开 10 份推理摘要(π 的无理性指数、Mahler 猜想、自由群因子同构等),并按 IAS 数学与 AI 顾问组建议设修订/引用协议
  • ✓风险提示:OpenAI 自承部分未形式化结果可能有误,全部尚未经同行评审;生成模型暂未开放
OpenAI 开源内部前沿模型的数学成果库:722 篇手稿、372 个结果族上架 GitHub,自称涉及准黎曼假设、CM 阿贝尔簇 Hodge 猜想等难题
🖼️要闻配图
点击全屏高清查看
🧭

把技术选型换算成你的开发预算

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

README 坦言,OpenAI 内部数学评测已经“饱和”,于是改用开放研究问题来测模型。真正的难点在于:AI 一口气产出数百篇论文,数学界审不过来,也难判断真伪。为此 OpenAI 参考了 IAS 旗下数学与 AI 顾问组的公开建议,把全部结果放进 GitHub,配上版本修订与引用规则。

架构亮点与底层机制

绝大多数结果出自同一个未发布的内部模型、同一套固定流程。家族 003 声称 Dirichlet L 函数(含 ζ)在 Re s>7/8 无零点,即“准黎曼假设”;家族 032 声称证明了 CM 阿贝尔簇的有理 Hodge 猜想。另有 π 的无理性指数为 2、Mahler 猜想、自由群因子同构等。按 README 说明,ζ 零点区域与 Hodge 两项工作不在固定流程内,11/12 那篇的写作还经过人工润色。

权威 Benchmark 与实测跑分对比

这次没有发布常规跑分。可核查的数字如下:约 4,000 道题,筛出 722 篇手稿、372 个结果族,平均每个结果约 3 小时 Pro 算力;372 个家族中有 235 个附 Lean 链接,162 篇论文的主结果已形式化。仓库上线约 2 小时,星标就过了 1,400。

开发者实战落地与开箱指南

克隆 openai/math,先看 overview.pdf 和 CONTENTS.md。在 lean/ 目录下依次执行 lake exe cache get 和 lake env comparator ComparatorChallenges/QuasiRiemannHypothesis.json,即可用 Comparator 验证。整库编译若失败,需调大 vm.max_map_count。引用前请再次确认,因为这些结果都还没经过同行评审。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。