OpenAI新模型讓數學家集體破防?一場關於數學未來的精神危機

重點摘要
OpenAI 近日公開了其下一代主力模型 Astra 內部版本的測試成績,結果在數學界投下一枚震撼彈。這份成績單顯示,Astra 在高維幾何、編碼理論、群論、算術電路複雜性、量子複雜性、格密碼學與極值組合等領域,成功給出了十項全新的研究結果。這些問題中,有些至少十年沒有核心進展,有些則已懸而未決數十年。具體成果包括構造出非 sofic 群、推翻 Connes 剛性猜想、解決三個 Erdős 問題,以及推進與後量子密碼學密切相關的最近向量問題。
OpenAI 近日公開了其下一代主力模型 Astra 內部版本的測試成績,結果在數學界投下一枚震撼彈。這份成績單顯示,Astra 在高維幾何、編碼理論、群論、算術電路複雜性、量子複雜性、格密碼學與極值組合等領域,成功給出了十項全新的研究結果。這些問題中,有些至少十年沒有核心進展,有些則已懸而未決數十年。具體成果包括構造出非 sofic 群、推翻 Connes 剛性猜想、解決三個 Erdős 問題,以及推進與後量子密碼學密切相關的最近向量問題。 OpenAI 研究科學家 Noam Brown 在公布成果後補充了一句耐人尋味的話:「我們也沒有在每個問題上花費太大力氣,測試時計算還有很大的提升空間。」根據他後續的說法,若按 Sol API 的價格計算,模型尋找全部解法所消耗的 token 成本大約為 2000 美元,平均每個問題僅花費 200 美元。這個「沒花費太大力氣」的表現,讓許多數學家感到難以置信。 數學家 Jay Cummings 是《Proofs: A Long-Form Mathematics Textbook》一書的作者,他在社群平台上直言「不可思議」,並表示 AI 解決了他花費大量時間研究的問題。多倫多大學數學教授 Daniel Litt 則坦然承認自己此前低估了 AI 的能力,認為讓大模型發表能登上《數學年刊》的數論級成果,不過是早晚的時間問題。這兩位學者的反應,某種程度反映了數學界對 AI 能力快速躍升的震驚。 然而,更為複雜的情緒來自於一群對職業前景感到迷茫的研究者。一方面,他們為 AI 加速科學發現感到興奮;另一方面,卻也因自身角色可能被邊緣化而陷入困惑。社群中反覆出現的問題包括:數學家以後還有沒有工作?人類還能不能繼續做數學?數學專業還值不值得讀? 針對前兩個問題,有觀點認為社會需要數學家從來不是為了湊夠每年的證明數量,而是先確定人類需要多少能守住判斷權的數學家,再把證明工作交給他們來主導——這或許能為純數學保留不可替代的位置。但另一些人則不那麼樂觀,他們指出數學家所獲得的薪酬向來包含定理的證明,一旦證明工作不再稀缺,只掌握選題與判斷力的研究者,可能面臨生存空間持續收縮的現實。 至於數學專業是否值得攻讀,六屆 Kaggle 特級大師、NVIDIA 機器學習專家 Jean-François Puget 的態度相當明確。他認為繼續選擇純數學方向存在風險,並以自己的讀博方向建議點明:純符號化的腦力工作正在被大型語言模型快速吞噬,想要避開被替代的風險,就得往與物理實體綁定更深的研究方向走。 不過,真正讓整個討論層次升高的,是一篇題為《數學的暗夜》的長文。作者是青年數學研究者 Kirwin Hampshire。他在文中寫道,真正讓自己崩潰的並不是 AI 會不會搶走數學家的工作,而是數學這門學科賴以存在的意義可能正在發生改變。他認為,數學最珍貴的從來不是證明本身,而是人類第一次發現未知、創造新知識的過程。正是這種探索,讓無數數學家感受到一種近乎宗教般的神聖體驗。 Hampshire 進一步指出,如果未來任何一個問題,AI 都能瞬間給出無數種漂亮的證明,那麼人類仍然可以學習數學、講授數學、評價數學,卻可能再也沒有機會真正「發現」數學。他借用作家 Jorge Luis Borges《巴別圖書館》的比喻來說明:假如世界上所有可能寫出的偉大小說都已經存在,而且 AI 總能第一時間挑出最好的一本,作家當然仍然可以寫作,但創作本身的意義,已經不可避免地發生了變化。 Hampshire 坦言,這種變化帶來的不是職業焦慮,而是一場精神危機。他擔心人類幾千年來藉由數學探索未知、觸碰真理的獨特體驗,正在被一點點剝奪。文章最後,他沒有給出任何解決方案,只留下一個問題:「我們究竟在做什麼?」有讀者表示,這篇文章讓他第一次真切感受到 AI 短期內所帶來的恐懼。 不過,反對這種絕望情緒的聲音也不少。有人認為 AI 不是來搶走數學家的舞臺,而是把人從枯燥的形式化泥沼裡拽出來,重新把專注力放回最珍貴的直覺與方向判斷上。Noam Brown 也在回覆網友時直言,他們的 AI 並沒有解決數學難題,也沒有開創新的數學分支或提出有趣的新猜想。如果一個數學家是在這些問題上耕耘,那暫時還是有很多事情可以做的。 還有人從更宏觀的角度看待這場爭議,認為這是一場遲來的計算革命,在其他領域早就已經發生過。其根本目標並沒有改變,都是為了讀懂宇宙的根本規律。無論最終走向如何,Astra 的這十個結果已經不可逆地改變了討論的基調。它不再是「AI 能不能做數學」的問題,而是「當 AI 已經能做得相當不錯時,人類數學到底還在追求什麼?」類似的問題,或許其他學科也可以提前想想。
Related
相關文章
SK海力士與閃迪發佈HBF首個標準規範,為AI推理時代破解“內存牆”
美國閃存峰會(FMS 2026)在加利福尼亞州聖克拉拉會展中心開幕之際,SK海力士宣佈聯手閃迪(Sandisk)共同發佈下一代存儲技術:高帶寬閃存(High Bandwidth Flash,簡稱HBF)的首個標準規範。該規範由全球最大的開放式數據中心技術合作組織OCP(Open Compute Project)正式發佈,定位為行業通用開放標準。

美國政府完成先進 AI 模型自願性評估框架制定,內容未公開
美國政府已按期完成針對先進 AI 模型評估的自願性框架制定,但白宮未對外公開具體內容、審閱機構及採用時程。該框架原應涵蓋保密、網路安全、風險管理與智慧財產權等要求,不過相關基準測試與適用門檻被列為機密。白宮計劃與業界召開會議審查該框架,並與更多合作夥伴討論後續步驟。
智譜AI新一代大模型GLM-5.3意外曝光
智譜AI尚未正式發佈的新一代旗艦模型GLM-5.3,因官網頁面、搜索引擎緩存及開源代碼庫等多渠道的“意外”洩露而提前曝光。GLM-5.3的意外曝光,使得三大頭部廠商的頂級模型在短期內集中亮相,市場爭奪戰一觸即發。截至發稿,智譜AI官方並未就GLM-5.3的洩露事件及具體發佈時間做出正式回應。業內普遍預期,鑑於模型已進入公開測試或展示階段,智譜AI或將在近期擇機正式對外公佈GLM-5.3的詳細技術參數與上線計劃。
DeepSeek-V4-Flash登頂全球調用量榜首,國產大模型包攬前五
7月31日最新發布的DeepSeek-V4-Flash正式版以2.33萬億Token的調用量強勢登上榜單第八。DeepSeek-V4-Flash 0423版和DeepSeek-V4-Flash 0731版合計調用量斷層領先。僅8月3日一天,DeepSeek-V4-Flash 0731版的調用量就達到1.02萬億Token,超過此前霸榜的DeepSeek-V4-Flash 0423版。價格方面,V4-Flash的競爭力幾乎無人能敵。海外開發者集體沸騰DeepSeek V4-Flash正式版上線後,海外開發者社區的反應堪稱熱烈。研究機構Artificial Analysis更直言,DeepSeek-V4-Flash已成為全球知名模型中運行成本最低的一款。從7月31日API公測到8月3日登頂全球調用量榜首,DeepSeek-V4-Flash僅用了不到一週時間。

飛書變革的伏筆,字節早就埋好了
字節跳動將飛書產品團隊與豆包團隊整合,並將飛書GTM團隊併入火山引擎,這是字節跳動為加速AI商業化而進行的最大規模To B業務重組。此舉旨在讓飛書成為AI原生應用的載體,並整合豆包與火山引擎的能力,以搶佔桌面AI辦公入口,並應對高昂的AI基礎設施投入與商業化壓力。

阿里字節騰訊,為AI辦公拼了
字節跳動、阿里巴巴與騰訊在短短兩週內接連對AI辦公領域進行重大整合,分別將飛書、千問辦公及WorkBuddy等產品與AI能力深度綁定,意在搶佔下一代辦公入口。三家巨頭皆認為,辦公場景已成為大模型token變現效率最高的領域,且Agent技術已跨越可用性門檻,因此同步加速內部整合,以統一產品入口覆蓋全流程工作流。