孤本网
/ 0 阅读
0
0

陶哲轩批评 OpenAI 批量发布 719 份 AI 数学证明引发争议,质疑其“证明消化不良”与学术透明度缺失

一句话结论

OpenAI 发布的 719 份 AI 数学证明因透明度不足和缺乏形式化验证,遭陶哲轩批评为破坏数学共同体探索机制的不可持续行为。

关键要点

  • OpenAI 在 10 月 6 日于 GitHub 发布 722 份 AI 生成数学手稿,涉及 372 个结果族,10 月 7 日撤回 3 份后目录定为 719 份。
  • 美国普林斯顿高等研究院主持的数学与人工智能顾问小组(AGMAI)指出 OpenAI 使用专有模型测试高难度数学问题,仅 10 份手稿附有推理链。
  • OpenAI 发布的证明中约 42% 未经形式化处理,且未提供将自然语言证明与形式化产物关联的机器可读元数据。
  • 陶哲轩于 10 月 7 日在 Mathstodon 平台发帖,强烈反对将 AI 快速攻克著名难题作为主要目标,警告这会导致大量“无人能消化的证明”。
  • 陶哲轩批评 OpenAI 将纳维–斯托克斯方程等千禧年难题作为模型能力基准,认为速度和数量本身并不等于数学理解。

背景与事实

2023 年 10 月 6 日,OpenAI 在 GitHub 平台上首次公布 722 份由人工智能生成的数学手稿,这些内容涵盖 372 个不同的数学结果族,涉及数百项开放研究问题。然而,由于其中一处符号错误及其产生的连锁影响,OpenAI 在次日,即 10 月 7 日,撤回了 3 份手稿,最终确定的公开目录包含 719 份文件。OpenAI 官方表示,在发布这些成果前曾咨询由普林斯顿高等研究院主持的“数学与人工智能顾问小组”(AGMAI),并参考了其公开建议。尽管 OpenAI 声称遵循了部分建议,但根据公开信息,此次发布在透明度方面存在显著缺陷。AGMAI 此前明确建议,前沿 AI 实验室应停止在专有、外界无法访问的模型上测试高难度数学问题,并强制要求披露模型名称、提示词、推理链、耗时及计算成本等关键数据。然而,OpenAI 此次仍使用专有模型进行验证,在 719 份手稿中,仅有 10 份附带了模型推理链,远未达到顾问小组对完整披露的要求。此外,在证明的可理解性与可验证性方面,AGMAI 强调 AI 生成的证明应当便于数学家审查和学习。报道指出,OpenAI 发布的证明中约有 42% 未经过形式化处理,这意味着这些证明无法通过自动化工具进行逻辑一致性检查。更严重的是,OpenAI 未提供将自然语言证明与形式化产物关联的机器可读元数据,这导致数学家难以追溯证明的逻辑链条,增加了人工审查的难度。AGMAI 也在此事件中声明,其作为顾问的角色并不构成对 OpenAI 获取或发布这些结果的认可,最终评估仍需由数学界同行进行。这一事件再次将 AI 生成数学成果的透明度、形式化验证、同行审查以及学术研究自主性推至风口浪尖,引发学术界广泛讨论。

影响分析

对于中文开发者及数学从业者而言,这一事件深刻揭示了当前 AI 辅助数学研究在“透明度”与“可验证性”之间的巨大鸿沟。分析认为,OpenAI 的做法若被行业广泛模仿,将导致数学研究成果从“科学探索”异化为“黑箱输出”,严重阻碍技术社区的信任建立。具体而言,缺乏形式化元数据和推理链披露,使得独立研究者无法复现或验证 AI 的解题路径,这在实际研发中构成了严重的“技术黑箱”风险。对于依赖数学模型的高科技行业(如密码学、算法优化),这种不可验证的 AI 证明可能导致系统性风险。此外,陶哲轩提出的“证明消化不良”警告意味着,随着 AI 生成定理的速度远超人类消化能力,现有的同行评审和学术传播机制可能失效,迫使从业者必须重新设计研究流程,从“结果导向”转向“过程导向”,以应对大规模非形式化数学产出的挑战。

适用边界

需注意,陶哲轩的批评主要针对 OpenAI 将高难度开放问题(如千禧年难题)作为营销基准的行为,而非否定 AI 在常规数学计算或形式化验证辅助上的价值。在封闭、形式化程度高且验证成本较低的特定场景(如简单代数恒等式证明或形式化定理库构建中),AI 的批量生成能力仍具有显著效率优势,此时“消化不良”的风险相对较低。该批评结论在涉及高度原创性、需要长期领域互动与教学转化的顶级数学研究场景中最为适用,而在仅需快速数值解或已具备成熟形式化验证框架的工程应用场景中,紧迫性较弱。

孤本观察

本事件凸显了 AI 生产力与学术共同体消费能力之间的结构性错配,其核心矛盾在于“速度崇拜”与“理解深度”的对立。编辑判断认为,若未来 AI 实验室无法建立有效的“人机协同消化机制”,AI 数学成果将逐渐脱离人类知识体系,成为不可持续的数据孤岛。

陶哲轩批评 OpenAI 批量发布 719 份 AI 数学证明引发争议,质疑其“证明消化不良”与学术透明度缺失

陶哲轩批评 OpenAI 批量发布 719 份 AI 数学证明引发争议,质疑其“证明消化不良”与学术透明度缺失

陶哲轩批评 OpenAI 批量发布 719 份 AI 数学证明引发争议,质疑其“证明消化不良”与学术透明度缺失

常见问题

OpenAI 最终发布的 AI 数学手稿数量及涉及结果族数是多少?

OpenAI 最初发布 722 份手稿,撤回 3 份后定为 719 份,涉及 372 个结果族。

OpenAI 发布的证明中有多少比例未经过形式化处理?

OpenAI 发布的证明中约 42% 未经过形式化处理,无法通过自动化工具进行逻辑一致性检查。

陶哲轩批评 OpenAI 将哪些高难度问题作为模型能力基准?

陶哲轩批评 OpenAI 将纳维–斯托克斯方程等千禧年难题作为模型能力基准。

在 719 份手稿中,有多少份附带了模型推理链?

仅有 10 份手稿附带了模型推理链,未满足 AGMAI 对完整披露的要求。

陶哲轩警告 AI 快速攻克难题会导致什么后果?

陶哲轩警告这会导致大量“无人能消化的证明”,使现有同行评审机制失效。

来源:IT之家


评论