一句话结论
OpenAI 公开 722 篇数学手稿,涵盖千禧难题及多个核心猜想,引发数学界对验证速度滞后于产出速度的广泛担忧。
关键要点
- OpenAI 发布 722 篇数学手稿,归为 372 组结果,源于约 4000 个研究问题的尝试,涵盖数论、代数几何等 17 个方向。
- 手稿涉及准黎曼猜想,声称黎曼ζ函数和狄利克雷L函数在实部大于 7/8 的区域无零点,远超此前已知无零点区域。
- 手稿声称证明伯奇和斯温纳顿-戴尔猜想(BSD 猜想)针对满足 Selmer 余秩为 0 或 1 等条件的椭圆曲线得到完整公式。
- 手稿声称证明霍奇猜想在具有特殊复乘结构的阿贝尔簇及 K3 曲面乘积这两类对象上成立,覆盖所有维度和余维。
- 9 位学者组成的独立数学与 AI 顾问组(含 3 位菲尔兹奖得主)声明,这不代表认可这些结果,需由各领域数学家慢慢消化。
背景与事实
2026 年 10 月,OpenAI 在其 GitHub 仓库上公开了 722 篇数学手稿,全部出自一个尚未发布的内部模型。这些手稿被归入 372 组结果,源于模型此前尝试的约 4000 个研究问题。OpenAI 表示,平均每项结果消耗的算力约相当于 ChatGPT Pro 思考 3 小时。仓库中包含了论文 PDF、源码、部分 Lean 形式化证明以及 10 份模型推理摘要。
手稿内容覆盖了数学界的多个核心难题。在数论方面,第 003 组结果关于“准黎曼猜想”,声称黎曼ζ函数和所有狄利克雷 L 函数在实部大于 7/8 的区域均无零点。这一结论大幅推进了无零点区域的边界,此前数学家无法证明实部大于 0.99 的竖带内无零点。该组还包含另一份独立证明,给出实部大于 11/12 的版本,并一致排除了“西格尔零点”。第 004 组针对有理数域上的希尔伯特第十问题,声称不存在通用算法来判断整数系数多项式是否有有理数解。在代数几何与算术几何领域,手稿声称证明伯奇和斯温纳顿-戴尔猜想(BSD 猜想),针对满足 Selmer 余秩为 0 或 1 等条件的椭圆曲线得到完整公式;并声称证明霍奇猜想在具有特殊复乘结构的阿贝尔簇及 K3 曲面乘积这两类对象上成立。此外,手稿还声称证明π的无理性指数恰好为 2,以及卡塔兰常数是无理数。在理论计算机科学方向,第 102 组结果声称证明了 2002 年由 Khot 提出的唯一游戏猜想,并给出了最大割、顶点覆盖等问题的近似难度结论。物理方向则涉及稀疏自旋玻璃的梅扎尔—帕里西公式、量子海森堡铁磁体的自发磁化,以及三维单种粒子相对论性弗拉索夫—麦克斯韦方程的整体光滑解。
值得注意的是,绝大多数手稿是同一个未发布的内部模型按固定流程生成的。但黎曼ζ函数无零点区域以及复乘阿贝尔簇上的霍奇猜想未完全走这套流程,其中实部大于 11/12 的证明文稿还经过人工编辑。OpenAI 强调,这些手稿的核验进度各不相同,部分成果尚无 Lean 形式化证明。在此之前,OpenAI 曾于 8 月召集约 40 名数学家讨论成果发布方式,部分与会者希望论文写得清楚以便同行阅读和引用,但部分人当时以为公司不会一次性放出所有成果。
影响分析
对于中文开发者与科技从业者而言,OpenAI 此次发布不仅展示了 AI 在深度推理与形式化证明上的突破性算力,更预示了数学研究范式的潜在转变。AI 能够短时间内生成数百篇涉及前沿猜想的手稿,意味着未来在密码学、优化算法、物理模拟等领域,AI 可能成为提出新假设和构造新证明的主要引擎。从业者需警惕“黑盒”风险,由于部分手稿缺乏形式化验证且依赖未公开的内部模型,直接引用这些结论存在巨大不确定性。此外,AI 产出速度已远超人类审查速度,这要求开发者在应用 AI 进行科学计算或定理证明时,必须建立严格的同行评审与形式化验证流程,不能盲目信任 AI 输出的“最终答案”。
适用边界
该结论仅适用于 OpenAI 发布的这 722 篇特定手稿及其对应的 372 组结果,不涵盖 OpenAI 其他模型在工程编程、自然语言处理或非数学领域的表现。这些手稿目前仅为内部模型生成的草稿,未经验证的结论(如准黎曼猜想的 7/8 边界、BSD 猜想的椭圆曲线公式)不能直接作为已确定的数学定理应用于实际工程或学术发表。此外,顾问组的声明明确这些结果不代表数学界的正式认可,因此不能将这些手稿视为数学史上既定事实的突破。
孤本观察
AI 生成数学手稿的速度与人类验证能力的脱节,正在形成一个巨大的“认知堰塞湖”,未来数学界的权威将更多依赖于形式化验证工具而非传统的同行阅读。
常见问题
OpenAI 发布的 722 篇数学手稿共归为多少组结果,源于多少研究问题?
722 篇手稿归为 372 组结果,源于约 4000 个研究问题的尝试。
手稿声称黎曼 ζ 函数和狄利克雷 L 函数在实部大于多少的区域无零点?
手稿声称黎曼 ζ 函数和狄利克雷 L 函数在实部大于 7/8 的区域无零点。
独立数学与 AI 顾问组由多少人组成,其中有多少位菲尔兹奖得主?
顾问组由 9 位学者组成,其中包含 3 位菲尔兹奖得主。
平均每项结果消耗的算力约相当于 ChatGPT Pro 思考多长时间?
平均每项结果消耗的算力约相当于 ChatGPT Pro 思考 3 小时。
在 8 月召集的数学家讨论中,约有多少名数学家参与?
OpenAI 曾于 8 月召集约 40 名数学家讨论成果发布方式。
来源:量子位