OpenAI 日前公布大批由內部前沿模型產生的數學研究成果,並在 GitHub 公開 722 篇研究手稿。這是 AI 直接挑戰真正尚未解決的開放數學問題,規模前所未見的一次成果釋出。
OpenAI 尚未公開產生這批成果的前沿模型,目前正研究如何以負責任的方式釋出。
之所以把測試延伸到開放問題,是因為既有數學評測已逐漸無法拉開模型能力的差距。這次模型總計嘗試約 4,000 道問題,經過整理與重要性篩選後,最終歸納成 372 個研究家族,並形成 722 篇研究手稿。
同一家族可能包含主要結果、輔助證明、延伸推論或不同證明方式。每項研究結果平均使用的運算量,相當於約 3 小時 ChatGPT Pro thinking,顯示這並非輕量級的試算,而是投入可觀算力的深度探索。
上述研究橫跨多個數學領域。OpenAI 公開其中 10 項成果的模型推理摘要,包括 π 的無理性指數、Mahler 猜想、Kaplansky 直接有限性猜想、Mézard–Parisi 公式、自由群因子同構,以及三維相對論 Vlasov–Maxwell 系統等。
部分特殊研究並未完全依循一般評測流程,包括黎曼 ζ 函數零點自由區域,以及 CM 阿貝爾簇的 Hodge 猜想證明。其中黎曼 ζ 函數相關論文還由人類編輯改善可讀性,顯示人機協作在這批成果中扮演了一定角色。
為了提高成果的可驗證性,OpenAI 也替多項研究建立 Lean 形式化證明,讓電腦依照明確的定義、前提與邏輯規則,逐步檢查證明是否成立。
不過目前並非所有 722 篇手稿都已完成 Lean 形式化。OpenAI 也坦言,部分尚未形式化的結果仍可能存在問題,未來將持續補上更多形式化證明並修正錯誤。
除了研究成果本身,OpenAI 亦公開部分產出過程,包括模型嘗試問題的數量、運算量估算,以及 10 項研究成果的縮短版推理摘要,並為論文建立版本修訂與引用機制。
OpenAI 表示,未來還將探索由數學社群管理的成果發布平台,並資助研討會、學術會議及特別研究計畫,協助數學家理解、驗證及延伸 AI 產生的重要數學成果。
與 OpenAI 溝通 AI 數學研究發布方式的獨立數學與人工智慧諮詢小組(AGMAI),將這次發布形容為「數學領域的一項重要事件」,但同時強調,其諮詢角色不代表認可這批成果的影響,也不代表支持 OpenAI 取得這些結果的方式。
AGMAI 先前即曾指出,AI 如今可能產生連提示者都無法理解、驗證或負責的數學論證。因此數學研究不能只追求產出更多正確結果,也必須重視人類理解、發展及延伸這些成果的過程。
該組織同時反對 AI 實驗室使用外界無法取得的專有模型測試前沿數學問題,擔心這會形成少數 AI 實驗室遠遠領先其他研究者的「兩級制度」,使數學社群逐漸與自身研究領域疏離,並削弱數學家自行提出問題、發展方法及探索研究方向的空間。
這次發布無疑把「AI 能否做真正的數學研究」從理論辯論推向實證檢驗。722 篇手稿的品質究竟如何,將由全球數學社群在接下來的驗證過程中給出答案。