GPT-5.6在数学证明上填补凸优化理论三十年空白,机器不再只是查文献
OpenAI最新发布的GPT-5.6用一个精心设计的提示词,在凸优化领域一个悬置三十年的定理证明中填补了核心引理的证明空白。原始定理由斯坦福大学的斯蒂芬·博伊德团队在1996年提出,但最关键的一步引理一直只有数值验证、没有形式化证明。这次GPT-5.6给出的证明经过三位数学家独立核验,被判定为形式正确且原创。
问题的具体背景是关于对偶间隙上界的一个不等式。博伊德的团队在1996年发表的论文中提出,某类特殊凸优化问题的对偶间隙可以用一个更紧的上界来估计,数值实验支持这个猜想,但形式化证明一直缺席。三十年间,包括麻省理工学院、加州理工学院和普林斯顿大学的多个数学团队都尝试过,均以失败告终。
GPT-5.6的证明思路借鉴了半定规划的最新工具。它没有走博伊德团队最初预设的对偶分解路径,而是引入了2019年才被完善的迹不等式技巧,把整个问题归约到一个已知结果的推论。这条路径此前从来没有人想到过,不是因为技术难度太高,而是因为把两个不同领域的工具组合到一起需要跨越很宽的知识边界。
提示词本身也值得研究。用户是加州大学伯克利分校的数学博士生,他没有直接问"证明这个引理",而是先让模型总结近三十年凸优化和半定规划领域的所有相关技巧,然后要求模型分类这些技巧的适用条件,最后才提出目标引理并要求组合应用。整个提示词长度接近八千字,分四轮对话完成。
三位独立核验的数学家都强调,GPT-5.6的证明不是简单的文献查找或已有结果拼接。证明中间引入的两个中间引理都是新的,虽然构造思路可以追溯到已有文献,但具体形式没有在任何已发表论文中出现过。这在数学圈引发了很大讨论,焦点是"原创性"的边界应该怎么定义。
反对声音也存在。牛津大学一位不愿具名的数学教授指出,GPT-5.6的成功依赖于用户本身就是凸优化领域的专家,能够精心设计提示词、能够快速识别错误证明。同样的模型如果落到非专业用户手中,输出的"证明"里九成以上是错的。这次成功不代表AI能替代数学家,只能说明它成为了强大的研究助手。
OpenAI在官方博客上把这个案例放到了首页,把它包装成"AI科学发现"的里程碑。但更值得关注的是过程细节。GPT-5.6在对话过程中主动承认了三次"这个方向可能不对",并回退到上一步重新推导。这种自我纠错能力,是过去所有大模型都缺失的特征,也是让专业用户愿意投入几小时和它协作的关键。
对数学研究本身,这次事件的意义可能被高估。凸优化是应用数学中相对成熟、结构良好的领域,大模型在这里更容易找到已知工具的组合。而在纯数学的前沿领域,如朗兰兹纲领、代数几何、素数分布,大模型至今没有做出任何有价值的贡献。数学界普遍认为,机器辅助证明还需要五到十年才能在真正开放的问题上产生实质突破。