← 記事一覧

人工知能

OpenAI が数学の原稿 722 本を公開した。助言を仰いだその組織は、1 週間前に「やめてほしい」と述べていた

OpenAI は 10 月 6 日、名前を明かしていない社内モデルが生んだ 372 の結果ファミリー、原稿 722 本を公開した。同社が設けた諮問グループが、フロンティア研究所に対し高度な数学の問題を非公開モデルで試すのをやめるよう求めてから 7 日後である。今回の公開は勧告のいくつかを満たし、いくつかを先送りし、リポジトリとモデルと問題の選定は研究所の手に残した。

MAI
OpenAI が投稿「Sharing AI progress in mathematics」に用いた公式のソーシャル共有用画像。投稿のタイトル用アートワークが入っている。

OpenAI は 10 月 6 日、数学の原稿 722 本を公開した。372 の結果ファミリーに整理されており、生み出したのは同社が名前を明かしていない社内モデルである。原稿は同社自身が所有する GitHub リポジトリに置かれている。その 7 日前、OpenAI 自身が招集した諮問グループは、まさに今回のような公開に向けた勧告を発表し、その冒頭で各研究所に「やめてほしい」と求めていた。

現在、一部のフロンティア AI 研究所は、広い科学コミュニティがアクセスできないままの非公開モデルで高度な数学の問題を試している。我々の勧告は、この実務的な状況を念頭に置いて作られている。しかし理想を言えば、そうすべきではない。初めにはっきり述べておきたい。我々はこの慣行を支持しない。そして、高度な数学の問題を非公開モデルで試すのをやめるよう求める。

これが今回の枠組みである。OpenAI は勧告を無視したのではない。いくつかは満たし、細部まで応えたものもある。ただし最初の一項は、公開するという行為そのものによって退けた。

公開されたもの

項目OpenAI が示した数値
原稿722 本
結果ファミリー372
評価の過程でモデルに与えた問題約 4,000 問
1 件あたりの平均計算量ChatGPT Pro の思考 3 時間相当
Lean による形式化「多くの原稿が、ただしすべてではない」
公開された推論要約10 ファミリー、抄録版
モデル「未公開の OpenAI 社内モデル」

リポジトリ自身が付した但し書きは引用しておく価値がある。そこが誠実な部分だからだ。「形式化されていない結果のいくつかには問題がある可能性がある。そうした問題は速やかに修正するよう努める。」

チェックリストに照らして採点する

諮問グループの 9 月 29 日付の文書は、600 件を超えるアンケート回答を踏まえており、採点できるだけの具体性がある。

グループが求めたこと今回の公開が行ったこと
結果を「いかなる AI 研究所にも支配されない」学術リポジトリに収めることgithub.com/openai/math で公開。OpenAI は「コミュニティがホストするリポジトリを検討中」と述べる
モデル名、プロンプト、所要時間、推定計算コストを開示すること計算量は Pro 時間の平均として開示。モデル名は非開示。プロンプトは未公開で、代わりに推論要約 10 本の抄録
証明を可能な限り形式化すること多くを Lean で形式化、ただしすべてではない
各証明を数学論文の慣例に沿う体裁へ書き直し、関連文献を引用すること先送り。OpenAI は今後の公開で引用と記述を改善すると約束
同程度の難度の問題をいくつ失敗したか、問題をどう選んだかを公表すること失敗の基準率は実質的に開示。選定基準は示されていない
コミュニティの理解を、支配せずに資金面で支えることOpenAI はワークショップ、会議、特別プログラムに資金を出すと述べる

満たしたのは 1 項、部分的が 3 項、満たしていないのが 2 項。そして包括的な要請は、公開という行為そのものによって退けられた。この件についての同社の従来の開示が「数字の入った一文」だったことを思えば、これは実際の前進である。同時にグループが求めたものでもなく、ずれは毎回同じ場所にある。成果物、モデル、そして問題の選定を、研究所が握り続けているという点だ。

新しいのは分母である

今回の公開で最も有用な数字は、告白のように見える方の数字だ。およそ 4,000 問が入り、十分に重要と判断された結果が 372 ファミリー出てきた。未解決の研究問題について自社の基準率を公表した研究所はこれまでない。そして基準率こそ、見出しの件数を能力の推定へ変換するものである。4,000 回の試行から 372 ファミリーを解決するモデルは、400 回から 372 を解決するモデルとはまったく別の道具だ。

計算量の読み方も変わる。1 件あたり Pro 級の思考 3 時間、そしてこの規模の評価となれば、全体ではフロンティア推論の 1 万時間超という領域に入る。数学者ひとりの職業人生に比べれば安く、研究助成金に比べれば高い。未解決問題を力任せの探索で攻めることの経済性は、いま目に見えるものになった。そして、それは不合理な額ではない。

何が主張されているのか、正確に

ここでは熱意より正確さが要る。見出しの数字は誤読を招くからだ。

標準的な手順の外で得られた 2 件は、リーマンゼータ関数のゼロ自由領域と、CM アーベル多様体に対するホッジ予想の証明である。どちらもミレニアム懸賞問題の解決ではない。Re(s) > 11/12 の半平面におけるゼロ自由領域は、解析的整数論において相当な前進だろう。だがリーマン予想が求めるのは、すべての非自明なゼロが Re(s) = 1/2 の直線上にあることであり、領域は直線ではない。CM アーベル多様体に対するホッジ予想は、予想の特別な場合であって、予想そのものではない。OpenAI はまた、11/12 の結果の書き上げが読みやすさのために人手で編集されたと記している。カタログの中で、人間が本文において明示的に関与したと認められている唯一の箇所である。

名前が挙げられた推論要約は、残りの性格をよく示している。π の無理数指数、対称および一般のマーラー予想、標数 2 におけるカプランスキーの直有限性予想、希薄スピングラスに対するメザール–パリジ公式、3 次元相対論的ヴラソフ–マクスウェル系。いずれも実在する問題であり、それぞれの分野の深部にあり、分野の外ではほとんど知られていない。Scientific American の Joseph Howlett 記者は、結果のほぼすべてが単一のエージェントに渡された単一のプロンプトから生じ、一部は複数回の試行を要した可能性があると報じている。

読み解き

検証の負担が移された。争点はもともと算術ではなく、そこだった。Lean はこの集まりの一部を覆う。残るのは、別の仕事を持つ査読者を待つ 722 本の PDF である。OpenAI は分野が追いつくのを助けるためにワークショップへ資金を出すと約束した。それは妥当な申し出であり、同時に分野が自力では追いつけないことの承認でもある。

9 月に諮問グループが答えるべく作られた問い——結果は数字と日付として出てくるのか、それとも数学者が使えるものとして出てくるのか——には、いま部分的な答えがある。証明と、分母と、但し書きを伴って出てきた。同時に、研究所の名前が付いたリポジトリに、名前のないモデルから出てきた。9 人の数学者が、そのどちらも求めなかった 1 週間後に。

Sources: OpenAI: Sharing AI progress in mathematics · openai/math on GitHub · Advisory Group on Mathematics and AI: General recommendations, September 29 · Advisory Group on Mathematics and Artificial Intelligence · Scientific American: OpenAI unleashes hundreds more math results upon a field already in shock · Interesting Engineering: OpenAI's largest math release tackles 4,000 problems with Lean proofs

続けて読む