← 全部文章

人工智能

OpenAI 公布了 722 篇数学手稿。它请来提意见的那个机构,一周前刚请它停手

OpenAI 于 10 月 6 日公布了 722 篇手稿、372 个结果族,出自一个它没有命名的内部模型。七天前,它自己召集的顾问小组刚请前沿实验室停止在不公开的专有模型上测试高等数学问题。这次发布满足了小组的部分建议,推迟了另一部分,而仓库、模型和选题仍留在实验室手里。

MAI
OpenAI 随其文章《Sharing AI progress in mathematics》发布的官方社交分享图,图中为该文的标题视觉。

OpenAI 于 10 月 6 日公布了 722 篇数学手稿,整理为 372 个结果族,产出者是一个它没有命名的内部模型。手稿放在这家公司自己拥有的 GitHub 仓库里。七天前,由 OpenAI 自己召集的顾问小组发布了针对正是这类发布的建议,并在开头请各实验室停手。

目前,一些前沿 AI 实验室正在用更广泛的科学共同体无法接触的专有模型测试高等数学问题。我们的建议是在这一现实背景下写成的。但理想而言,他们不应这样做。我们想一开始就讲清楚:我们不认可这种做法,并请他们停止在专有模型上测试高等数学问题。

这就是这件事的框架。OpenAI 并没有无视这些建议——它满足了其中几条,有些还做得很细。只是第一条,它用"照样发布"这个动作本身给否掉了。

这次发布了什么

项目OpenAI 给出的数字
手稿722 篇
结果族372 个
评测过程中向模型提出的问题约 4,000 道
每项结果的平均算力相当于 ChatGPT Pro 思考 3 小时
Lean 形式化"许多手稿,但并非全部"
公开的推理摘要10 个族,节略版
模型"一个尚未发布的 OpenAI 内部模型"

仓库自己写下的那条提醒值得照引,因为那是诚实的部分:"部分未形式化的结果可能存在问题。我们将努力迅速修正任何此类问题。"

对着清单打分

顾问小组 9 月 29 日的那份文件,参考了六百多份问卷回复,具体到足以逐条打分。

小组要求的这次发布做到的
把结果存入"不受任何 AI 实验室控制"的学术仓库发布在 github.com/openai/math;OpenAI 称正在"探索由社区托管的仓库"
披露模型名称、所用提示词、耗时与估算的算力成本算力以 Pro 小时均值披露;模型未具名;提示词未公开,代之以 10 篇推理摘要的节略版
尽可能对证明做形式化许多已用 Lean 形式化,并非全部
按数学论文的体例重写每个证明,并引用相关文献推迟。OpenAI 承诺在未来的发布中改进引用与行文
公布模型在同等难度问题上失败了多少,以及题目是怎么选的失败基准率实际上已披露;选题标准没有
出资支持共同体的理解,但不加以控制OpenAI 表示将为研讨会、会议与专项项目出资

满足一条,部分满足三条,未满足两条——而那条总括性的请求,被"照样发布"这个动作否掉了。考虑到这家公司此前就此事的披露只是一句带数字的话,这是真实的进展。它同时也不是小组所要求的东西,而偏差每次都落在同一个位置:产出物、模型和选题,实验室一直握在手里。

新东西是那个分母

这次发布里最有用的数字,是看起来像一次承认的那个。大约 4,000 道题进去,372 个被判定足够重要的结果族出来。此前没有任何实验室公布过自己在未解研究问题上的基准率,而正是基准率把一个头条数量换算成一个能力估计。一个从 4,000 次尝试中解决 372 个结果族的模型,和一个从 400 次里解决 372 个的模型,是完全不同的工具。

它也改变了算力数字的读法。每项结果 Pro 级思考 3 小时,放在这种规模的评测上,整场下来就进入了前沿推理一万小时以上的量级。相对一位数学家的职业生涯是便宜的,相对一笔科研经费是昂贵的。用蛮力搜索去攻未解难题,其经济性现在是看得见的;而且它并不荒谬。

被主张的究竟是什么,说准确

这里需要的是准确,不是热情,因为那些头条数字很容易被读错。

在标准流程之外得到的两项结果,是黎曼 zeta 函数的一个无零区域,以及 CM 阿贝尔簇上霍奇猜想的一个证明。两者都不是千禧年大奖难题被解决。在 Re(s) > 11/12 这个半平面上的无零区域,会是解析数论里一项相当可观的进展;但黎曼猜想要求的是所有非平凡零点都落在 Re(s) = 1/2 这条直线上,而一个区域不是一条线。CM 阿贝尔簇上的霍奇猜想是该猜想的一个特例,不是猜想本身。OpenAI 还写明,11/12 那项结果的书面稿为了可读性经过人工编辑——这是整个目录里唯一一处正文中承认有人参与的地方。

被点名的那些推理摘要,足以说明其余部分的性质:π 的无理性指数、对称与一般马勒猜想、特征 2 下卡普兰斯基的直有限性猜想、稀疏自旋玻璃的梅扎尔–帕里西公式、三维相对论性弗拉索夫–麦克斯韦方程组。都是真实的问题,都深在各自的子领域里,在领域之外大多并不有名。《科学美国人》记者 Joseph Howlett 报道称,这些结果几乎全部来自交给单一智能体的单一提示词,其中一些可能需要多次尝试。

怎么看

验证的负担被转移了,而争议点一直就在这里,不在算术。Lean 覆盖了这批材料的一部分;剩下的是 722 份 PDF,等着另有本职工作的审稿人。OpenAI 承诺出钱办研讨会,帮这个领域追上来——这是一个合理的提议,同时也是对"这个领域自己追不上"的承认。

9 月成立顾问小组时要回答的那个问题——结果会以一个数字和一个日期的形式出现,还是以数学家能用的形式出现——现在有了部分答案。它们带着证明、带着分母、带着一条提醒出现了。它们同时出现在一个挂着实验室名字的仓库里,来自一个完全没有名字的模型。就在九位数学家对这两点都提出相反要求的一周之后。

Sources: OpenAI: Sharing AI progress in mathematics · openai/math on GitHub · Advisory Group on Mathematics and AI: General recommendations, September 29 · Advisory Group on Mathematics and Artificial Intelligence · Scientific American: OpenAI unleashes hundreds more math results upon a field already in shock · Interesting Engineering: OpenAI's largest math release tackles 4,000 problems with Lean proofs

继续阅读