الرياضيات家初步評估:OpenAI 的數學手稿「有真東西」,但驗證尚需時日
在 OpenAI 公開 722 篇由其 AI 生成的數學手稿僅四天後,多家媒體採訪了三十多位數學家,他們的初步結論是:這些手稿中確實包含有價值的內容,但要準確分辨哪些成果是可靠的,可能需要數年時間。
OpenAI 於 10 月 7 日將這批由 AI 產出的數學手稿發布至 GitHub,但隔天就在更新記錄中撤回了三篇。
《The Verge》在採訪了三十多位數學家後得知,他們對這批成果的初步評價包括「令人驚訝」、「前所未有」和「超現實」。大多數受訪者認為,僅僅理解 OpenAI 所發布內容的深度和廣度就需要數年時間,同時也擔心在數學界尚未完全消化這些成果之前,OpenAI 就會推出下一批。
目前,尚無確切的數字能夠說明這些手稿的準確性。OpenAI 在其說明文件中提到,在評估過程中,模型被給予了約 4,000 道題目,經過 OpenAI 的歸組和篩選,最終形成了現有的目錄,包含 719 篇手稿,分為 372 組。然而,這些數字無法直接換算為成功率,因為歸組後,一道題目可能被併入其他組別。
手稿的驗證程度差異很大。使用 Lean 這種能夠讓電腦逐步檢查證明的程式語言進行形式化驗證的成果,在邏輯上更具說服力。OpenAI 在更新記錄中指出,約有 300 篇(佔 719 篇的 42%)的主要結果附帶了形式化驗證,不到一半。其說明文件也承認,沒有形式化驗證的結果可能存在問題。
此外,即使有形式化驗證,也並不意味著沒有問題。受訪者指出,電腦驗證的敘述不一定完全符合論文的主張,仍需要逐一核對。
倫敦帝國學院的 Kevin Buzzard 表示,在他的代數數論領域,僅有約 6 項成果一眼看上去值得關注,其中幾乎沒有經過 Lean 的驗證。他面臨的選擇是閱讀「可能不正確的垃圾內容」,或是等待他人閱讀和形式化驗證,才能確定結果的對錯。
一些研究者私下表示,部分論文似乎重複了他人已有的研究路徑,還有人提到原本需要數百頁才能闡述的結果被壓縮到了幾十頁。
同時,錯誤也已經出現。更新記錄顯示,一篇關於 Weil 類的論文中存在一個正負號錯誤,導致其論證無效,另外兩篇基於該論文並與 Hodge 猜想相關的論文也被一併撤回。另有 14 篇手稿被修改。所有這些成果都尚未經過同行評審。
撇開呈現方式不談,多位受訪者認為這些成果的整體水準很高。在 AI 出現之前,其中許多成果足以發表在頂尖期刊上,並為作者帶來教職。史丹佛大學的 Jared Duker Lichtman 甚至認為,有「數十項」成果足以讓作者成為菲爾茲獎(數學界最高榮譽之一)的有力競爭者,其中包括在黎曼猜想方面的進展、Hodge 猜想的特殊情況,以及四維 Kakeya 猜想。這是他個人的評估。
然而,OpenAI 在說明文件中註明,黎曼猜想和 Hodge 猜想這兩項成果並非通過其他成果所採用的固定流程完成,也沒有詳細說明其差異。黎曼猜想那篇論文的一個版本甚至經過了人工潤飾。
索邦大學的 Scott Armstrong 提醒,這些並非冷門問題,許多是幾代數學家嘗試數十年才未能解決的知名難題。
對部分數學家而言,OpenAI 此舉無疑讓他們的研究計畫一夜之間面臨被取代的風險。聖安德魯斯大學的 Colva Roney-Dougal 表示:「我的一群朋友和同事的研究經費申請剛剛被完全抹掉了。」Armstrong 知道有一個團隊的研究計畫幾乎被清空;紐約大學的 Tristan Buckmaster 也聽說有三個人的研究計畫被取消。
受影響最嚴重的群體是博士生、年輕研究者以及沒有終身職位的人,因為未解難題常常是博士論文、經費申請和求職的基礎。波蘭密茨凱維奇大學的 Bartosz Naskręcki 批評道:「這是一個社會問題,AI 實驗室完全無視。」
大多數受訪者並不反對 AI 從事數學研究,不少人自己也在使用 AI 工具。
他們的不安主要來自於 OpenAI 的做法:高調發布公告,初步撰寫論文,然後將剩餘的工作留給數學界去消化,同時迅速轉向下一個目標。數學家之間已在流傳下一波成果的消息,而 OpenAI 並未回應《The Verge》關於是否還有下一批的詢問。Armstrong 預計:「兩個月後會有東西把這次的影響蓋過去。」他自認為是對 AI 最樂觀的數學家之一,並且自己也在使用 AI,但他坦言「晚上有點難睡」,目前的目標是在「OpenAI 搶先之前」完成手上的研究。



