OpenAI 公开了其 AI 模型在 First Proof 数学挑战中的证明尝试,用以检验研究级推理能力。该挑战面向专家级数学问题,此次披露的内容是模型的证明作答,而非最终评测结论。
据 OpenAI 介绍,这批提交材料展示的是 AI 模型针对专家级难题所给出的证明尝试,目标是测试研究级推理水平。First Proof 数学挑战以数学证明为核心任务,其题目难度对齐专业研究场景中会遇到的问题。
就公开信息而言,OpenAI 此次分享的是模型的证明尝试本身,未在来源中给出成绩或排名等信息。
孤本观察:这次公开的看点不在于证明对错,而在于把“研究级推理”放到专家级数学证明这一高门槛场景中检验。若此类作答被持续公开,外界评估前沿模型推理能力时便有了更具体的观察样本。
来源:OpenAI News