公式予告

OpenAIの未公開AIが数学論文722本を公開、検証はこれから

ポイント

  • OpenAIは10月6日、社内の未公開モデルが書いた数学の論文722本を、GitHubの公式リポジトリ「openai/math」で公開しました
  • 論文は約4000問の研究レベルの数学問題に取り組んだ結果です。1件あたり、ChatGPT Proの思考を平均3時間ほど使ったと説明されています
  • 論文の正しさは、まだ確かめられていません。数学者からは、モデルが公開されず再現もできない点への慎重な声が出ています

722本の論文は何を公開したのか

OpenAIが公開したのは、数学の論文722本です。ライセンスはApache-2.0で、誰でも中身を読めます。

論文は、関連するものどうしをまとめた372の「ファミリー」に分けられています。数学の16分野にわたるとも報じられています。

作ったのは、OpenAIの社内にある未公開のフロンティアモデルです。モデル名も、公開日も、価格も、公式には示されていません。

公開された内容を数字で並べると、次のようになります。

項目 内容
論文の数 722本(372ファミリー)
与えた問題の数 約4000問
1件あたりの計算 ChatGPT Proの思考で平均3時間ほど
公開先 GitHub「openai/math」(Apache-2.0)
作ったモデル 社内の未公開モデル(名前なし)

1件ごとの作り方

OpenAIによると、ほとんどの結果は1つの指示をAIに渡し、論文の形まで仕上げたものです。

ただし、指示の内容がすべて公開されているわけではありません。推論の要約も、10件ほどの問題に限られています。その中には、円周率πの無理数度に関する問題も含まれています。

無理数度は、πを分数でどこまで近づけられるかを表す値です。円周率は誰でも知っている数ですが、その近似の性質を調べる問題は専門家の研究テーマになっています。

どこまで正しいのか

ここが一番大事なポイントです。論文の多くは、Leanという言語で形式化されています。

Leanとは、証明を機械が読める記号に書き直し、コンピュータで一つずつ確かめられるようにした言語です。機械が通した証明は、人の読み間違いを減らせます。

ただし、形式化されているのは「多く」であって、すべてではありません。OpenAI自身も、形式化されていない結果には問題がありうると認めています。

誤りが見つかれば、速やかに直すという方針も示されています。722本は「確定した証明」ではなく、「これから確かめていく候補」として読むのが安全です。

数学者の反応

MITのアンドリュー・サザーランド氏は、主張はモデルが公開され、結果を再現できるまで未検証として扱うべきだと述べています。

トロント大学のダニエル・リット氏は、企業が数学の答えを隠しておく理由はないと指摘しています。結果そのものを否定しているわけではありません。

ノースウェスタン大学のブライナ・クラ氏ら会合の参加者は、ブログや投稿だけでなく、数学者が評価して使える論文の形で書くよう求めたとされています。

また、フィールズ賞を受賞した25人の数学者は、著者の名前がなく報道発表の形で結果が出ることへの懸念を連名で示したと報じられています。結果が出るペースが、人の検証を上回っているという見方もあります。

過去の発表との違い

OpenAIは以前、ナビエ・ストークス方程式をめぐる成果について、1万体を超えるAIエージェントを使ったと説明していました。9月8日には、関連する証明を発表したとも報じられています。

今回の722本は、その時とは作り方が違うと説明されています。ほとんどの結果は、1つの指示から生まれたといいます。

一度に大量の論文が出ると、一本ずつを確かめる人の手が追いつかなくなります。数学者が懸念しているのは、まさにこの点です。

次に出るのはいつか

このモデルの名前も、公開日も、まだ発表されていません。数学の能力がどの製品に入るのかも、不明です。

一部の報道では、このモデルはGPT-6 Astraより高い能力を持つと書かれています。ただ、その比較を裏付ける公開データは見当たりません。

今後の注目点は、モデルが公開されて外部の研究者が結果を再現できるかどうかです。続報が出たら、この記事に追記します。

OpenAIの未公開AIに関する質問

722本の論文はすべて正しいのですか?

まだ確かめられていません。Leanで形式化された論文もありますが、すべてではありません。

形式化されていない結果には問題がありうると、OpenAI自身が認めています。

論文は誰でも読めますか?

はい。GitHubの「openai/math」で公開されています。ライセンスはApache-2.0です。

このモデルは、ChatGPTで使えるようになりますか?

現時点で、公式な発表はありません。数学の能力がどの製品に入るかも、未定です。

1件の結果を作るのに、どれくらい計算を使いましたか?

平均で、ChatGPT Proの思考を3時間ほど使った計算量に相当すると説明されています。

結果の内容が間違っていたら、どうなりますか?

OpenAIは、誤りが見つかれば修正して新しい版として出し直す方針を示しています。