纽约大学(NYU)联合 Google DeepMind 杰出科学家 Rémi Munos 等在 Hugging Face 与 ArXiv 正式公开了《Learning to Discover Interesting Mathematics》(arXiv: 2609.28603)。随着大语言模型在形式化数学证明(Lean 4、Mathlib)中展现出强悍的求解能力,AI 已经能够轻易生成成千上万个冷僻枯燥的平凡定理,但大模型究竟能否自主识别出“真正有学术价值且有趣的数学新知”始终未解。团队首创以“证明长度与命题表述长度之比”作为定理内在趣味性的量化指标,并训练了 27B 参数的证明难度预测模型,使系统能够在无人预设目标的情况下,自主猜想、筛选高价值定理并自我扩建形式化数学知识库。

核心要点速览 (Key Takeaways)

  • ✓首次提出大模型自主数学探索的“内在趣味性(Intrinsic Interestingness)”客观数学量化度量指标。
  • ✓实证证明定理的内在趣味性与下游数学工具箱的应用效用(Extrinsic Utility)呈现强正相关。
  • ✓训练了专用的 27B 证明难度预测模型,难度判定准确率全面超越 GPT-4o 等通用闭源旗舰基座。
  • ✓将系统生成的定理与现有庞大数学库 Mathlib 的重合率从 91.9% 骤降至 30.6%,成功拓展出 69.4% 的全新数学分布。
  • ✓论文预印本、形式化评测套件与自拓定理库生成脚本已在 ArXiv 与 Hugging Face 全面开放。
🔬

深度技术解析与实战评估

核心背景与行业痛点 近年来,大模型在国际数学奥林匹克(IMO)与形式化证明助手(Lean 4、Isabelle)上取得了令人瞩目的成就。然而,现有的大多数系统仅仅是“被动的做题机器”——必须由人类数学家给出一个明确的待证命题(Goal),模型才负责搜索证明路径。如果放任大模型在数学公理系统中自主自由推演,模型往往会大量生成数以万计的“垃圾平凡定理”(例如反复套用对换律或构造极度冗余的恒等变换),导致数学库被大量毫无学术价值的平庸命题淹没,无法实现真正的科学发现闭环。 ### 架构亮点与底层机制 NYU 与 DeepMind 团队构建了让 AI 评估“数学美感与价值”的自进化机制: 1. 内在趣味性量化算子(Intrinsic Interestingness Metric):团队给出了严格的数学形式化定义——一个命题的内在价值,正比于其最简严密证明的步骤长度与其命题简练程度的比值。简短的命题却需要深邃复杂的推导,往往意味着其触及了数学概念间的深刻本质联系; 2. 27B 条件证明难度预测器:基于形式化前提条件,训练了一个 27B 参数的专用策略模型,能够在不实际展开全量证明搜索的前提下,极低成本预判某个潜在猜想的证明复杂度; 3. 自拓定理知识库闭环(Self-Expanding Library):系统形成三步循环——“基于既有知识自发提出猜想 ➔ 评估趣味性与证明难度 ➔ 调用证明器形式化验证并吸纳进知识库”,推动数学知识在未知疆界自主扩张。 ### 权威 Benchmark 与实测跑分对比 在跨越代数、数论与拓扑学的形式化数学自探索实测中: - 经过 27B 难度模型引导的系统,生成的定理被人类数学家评定为“具备实质启发性”的比例提升了 3.8 倍; - 成功将大模型生成定理与传统 Mathlib 标准库的重复套用率从 91.9% 骤降至 30.6%,这意味着近 70% 的新定理是超越既有教科书的人类未归纳新知; - 该趣味性信号在形式化证明搜索中作为启发式启发函数,使复杂定理证明的搜索分支剪枝率提升了 54.2%。 ### 开发者实战落地与开箱指南 形式化数学、AI for Science 与逻辑推理系统研究者可按以下步骤探索: - 查阅论文获取基于 Lean 4 的形式化猜想生成 Prompt 与趣味性计算公式; - 借鉴其 27B 难度预测器的奖励建模思想,用于强化学习数学推理的自动化课程学习(Curriculum Learning); - 国内研究者可直接在 Hugging Face 论文讨论区免代理获取论文预印本与评测基准代码。