一萬個代理人 88 小時解開千禧年難題,OpenAI 把 100 萬美元獎金留在桌上
OpenAI 宣稱以未公開內部模型與一萬個 AI 代理人在 88 小時內解開納維-斯託克斯千禧年難題,本文分析難題示範效應、運算成本帳、功勞與研究資料流向爭議,以及後續可驗證訊號。
OpenAI 宣稱以一萬個 AI 代理人、88 小時解開納維-斯託克斯難題,證明尚待人類驗收,功勞與研究資料流向的爭議卻已先找上門。
一道流體老題,等來一萬個代理人的答案
上個月,Anthropic 才宣布一款未公開的 Claude 研究模型,把黎曼 ζ 函數臨界線上零點比例的長期下界,從 41.6% 推進到 67.2%。9 月 8 日,OpenAI 接棒出手:該公司宣布,一款內部未公開、在開放數學問題上性能遠超最新發布的 GPT-6 Astra 的模型,已經解開「納維-斯託克斯存在性與光滑性問題」。這是克萊數學研究所在 2000 年掛出的七道千禧年大獎難題之一,每題懸賞 100 萬美元。
這道題在問什麼?納維-斯託克斯方程描述流體運動,數學家想知道:從一個平滑的初始狀態出發,方程的解是否永遠保持平滑,還是可能在有限時間內長出流速無限增長的「奇點」。水龍頭流出的水、機翼上掠過的氣流,直觀上都該乖乖聽方程的話,但嚴格證明將近 90 年沒有人交得出來。
OpenAI 的證明走構造路線:約一萬個 AI 代理人協作,在約 88 小時內產出證明,顯示一個初始平滑的靜止流體確實可能在有限時間內發展出奇點。手法是設計一個向內旋轉並拉伸的渦流,讓能量在物理定律要求下維持有限;前提建立在外力光滑,對應官方題目敘述中的 C 與 D 情形。OpenAI 同時提供分析性證明與 Lean 語言的形式化驗證,驗證由 GPT-6 Astra 在約 17 小時內完成。OpenAI 研究者布貝克(Sébastien Bubeck)稱之為「過去十二個月所看到軌跡的一個驚人頂點」。
Lean 這一步值得多看兩眼。它的核心檢查器只認邏輯,誰寫的證明都一視同仁,形式化驗證通過,通常代表推理本身站得住。真正的檢查點在另一處:寫進 Lean 的題目敘述,是否忠實對應克萊研究所的原始問題。這一步目前沒有捷徑,仍要人類數學家逐條比對。
老難題成了新模型的預告片
把時間軸拉長看,這不是孤立事件。Google 的 AlphaProof Nexus 先前攻下兩道懸置 56 年的數學難題,OpenAI 自己也宣布推翻過一道 80 年的幾何猜想。AI 對老題目的戰績清單越拉越長,而這次的宣布又多出兩層訊號。
第一層在模型身分。解題的是「內部未公開」的模型,性能遠超 GPT-6 Astra,換句話說,這份證明同時是下一代能力的預告。AI 產業裡,能力宣告從來跟說話者的位置有關,黃仁勳與 OpenAI 執行長對 AGI 是否已到來的分歧就是現成的例子;比起口說,一道有懸賞、有形式化工具可以查核的世紀難題,是硬得多的展示品。陶哲軒曾把這類問題比作吸引科學家努力的「燈塔」,而燈塔此刻正好立在各家實驗室的航線上。
第二層是帳。依目前的公開估算,這次運算成本可能高達 1,500 萬至 2,250 萬美元,克萊研究所的獎金是 100 萬美元,OpenAI 已表明不打算申領。花十幾倍於獎金的成本去解一道題,帳面上說不通,除非要買的東西另有其處:一份能寫進下一場發表會的成績單,以及「最難的題目也交給我們」這句話的定價權。
功勞算誰的,資料去了哪
宣布的前一天,紐約大學數學教授巴克馬斯特與 Anthropic 研究員阿爾珀格,剛發布相關流體方程的研究成果。巴克馬斯特隨後質疑,OpenAI 是在聽聞兩人的進展後,才把資源轉向「外力驅動」這條路線。
更尖銳的提問在資料。巴克馬斯特指出,他與阿爾珀格的研究資料存放在 OpenAI 的 Codex 模型裡,他擔心這些內容可能被用於訓練或參考,詢問之後沒有得到明確答覆。布貝克否認相關指控,強調研究人員與 AI 代理人都沒有存取具體的使用者資料;但 OpenAI 的聲明同時承認,「不排除」兩人使用 OpenAI 產品產生的匿名化資料,對模型改進有幫助。
這段聲明值得所有把未發表工作放上 AI 工具的人逐字讀一遍。使用者無法證明自己的東西沒被學走,廠商也說不準有沒有,界線目前只存在於服務條款,沒有對應的技術保證或稽核機制。過去研究者換一套工具,風險頂多是靈感被鄰座聽走;現在草稿、程式、資料放在廠商的模型裡跑,同一個廠商又是解題成果的受益者,資訊不對稱與利益衝突同時放大。
功勞的規則也沒跟上。一份由一萬個代理人合力產出的證明,作者欄該寫誰、引用該算誰、期刊該怎麼審,都沒有現成答案。克萊研究所按規章,發獎前要求解答在具同儕審查的出版物發表並經兩年考驗;OpenAI 跳過申領,行政上省了一步,學界檢驗不會跟著省。
陶哲軒的態度剛好站在兩邊。他肯定這類難題作為「燈塔」吸引科學家投入,也提醒:若 AI 能在沒有人類深度參與的情況下解開最難的問題,人類對數學的理解可能被削弱。寫證明的是內部模型,驗證交給 GPT-6 Astra,人類在這條生產線上的位置,確實越來越偏向驗收端。
接下來值得盯的訊號
Lean 證明檔是否公開,將是第一個觀察點。Lean 社羣能否獨立重跑驗證、形式化敘述與克萊原始題目是否嚴絲合縫,決定這份證明能不能從「宣稱」變成「結果」。分析性證明進入同儕審查後的命運同樣關鍵:被接受、被找出缺口,或像許多預印本一樣長期懸置,三種結局都還開放。
巴克馬斯特與阿爾珀格的論文,和 OpenAI 證明在方法上的相似程度,會在後續引用與評論中被攤開檢視;OpenAI 是否對 Codex 的資料用途給出更清楚的承諾,例如訓練排除條款或可稽核機制,則會成為所有把工作放上雲端工具的人的參考案例。畢竟這次被質疑的兩位研究者,一位還是對手陣營 Anthropic 的人員,資料治理的標準從此有了對照組。
最後盯發表節奏。OpenCode 上那個先匿名上架、後被指向智譜新一代模型的 Alpha 已經示範過未發表先亮相的操作,OpenAI 這回把內部模型推上數學舞臺,等於把同一套儀式升級。若各家開始把「解開一道老難題」當成發表會前的固定橋段,數學難題的稀缺性會被快速消耗,屆時能分出高下的,反而是驗證與資料治理這些不起眼的環節。
88 小時的證明,有 Lean 這個不問出處的裁判可以查核;資料有沒有被模型學走,目前沒有對等的查核工具。下次再有實驗室宣布解開世紀難題,先別急著問模型多強,先問這兩件事有沒有跟上。