OpenAI Astra用2000美元拿下10道世紀難題,數學家的定義被改寫了嗎?

2026年8月3日 18:23
OpenAI Astra用2000美元拿下10道世紀難題,數學家的定義被改寫了嗎?

重點摘要

好的,這是一篇按照您的要求重新撰寫的完整新聞稿。 --- ## OpenAI Astra用2000美元拿下10道世紀難題,數學家的定義被改寫了嗎? 2026年8月1日,OpenAI拋出了一枚足以震撼全球數學界的重磅炸彈。其下一代主力模型Astra(目前仍為內部版本)在數學與理論計算機科學領域一口氣取得了十項重大突破,涵蓋高維幾何、編碼理論、群論、算子代數、量子複雜度、格密碼學與極值組合學等多個前沿方向。

站內 AI 整理稿

好的,這是一篇按照您的要求重新撰寫的完整新聞稿。 ---

## OpenAI Astra用2000美元拿下10道世紀難題,數學家的定義被改寫了嗎? 2026年8月1日,OpenAI拋出了一枚足以震撼全球數學界的重磅炸彈。其下一代主力模型Astra(目前仍為內部版本)在數學與理論計算機科學領域一口氣取得了十項重大突破,涵蓋高維幾何、編碼理論、群論、算子代數、量子複雜度、格密碼學與極值組合學等多個前沿方向。這些難題無一例外,都是學術界公認的“硬骨頭”,每道題都沉默了超過十年,核心進展長期停滯,甚至包括多個困擾頂尖數學家數十年的世紀猜想。 消息傳出後,數學圈的第一反應不是歡呼,而是長時間的沉默與反覆的核對。因為這次,AI的角色發生了根本性的逆轉。過去,AI總被視為“算得飛快的計算器”,人類提供思路,機器負責計算;而這一次,完整的論證過程由模型自主生成,人類的角色徹底退居為整理者與驗證者。更刺痛神經的是其驚人的成本——按OpenAI自家Sol API的費率折算,找出這十個完整解法的Token總費用僅約2000美元。平均一道題200美元,這個數字還不到北美一名研究生一週的津貼,卻看起來輕而易舉地改寫了延續百年的數學研究成本賬本。 當日,Anthropic研究員半年前的調侃——“下週頒發的菲爾茲獎,可能是最後一個頒發給人類的菲爾茲獎”——被反覆提及,似乎正以一種出人意料的速度變成現實。 ### 十道硬骨頭:從非sofic群到高維堆積的歷史性突破

在Astra的這十項成果中,有幾項的重量級突破值得單獨拎出來放在聚光燈下。最為重磅的,當屬對“非sofic群”存在性的構造。早在1999年,阿貝爾獎得主Mikhail Gromov拋出了“sofic群”這一深刻概念,其核心問題簡潔而致命:任何一個無限複雜的群,是否都能用有限置換去局部逼近它的乘法表?這個看似不食人間煙火的問題,實際牽動著一整片數學疆域的神經。sofic熵理論、動力系統遍歷論、算子代數等一系列核心分支,全部懸繫於這個問號之上。然而,27年來,無數頂尖數學家前赴後繼試圖尋找反例,全都無功而返。Astra則另闢蹊徑,直接從數學工具箱中拎出了二元Leavitt代數的單位群,將Kun-Thom擴展圖理論與Thompson群V巧妙地糅合在一起,硬生生逼出了一個決定性的矛盾,一舉終結了這場長達四分之一世紀的追獵。 同一賽道上的另一顆重磅炸彈,是對1982年菲爾茲獎得主Alain Connes剛性猜想的直接證偽。Connes曾以極大的氣魄斷言,某些群可以由它們的von Neumann代數唯一決定,這被視為算子代數領域的基石性直覺。然而Astra直接推翻了這一斷言。通過構造一個可數無限的群族,AI證明了這些群彼此之間互不同構,長得完全不一樣;但詭異的是,它們各自的von Neumann代數卻完完全全相同。整個構造過程中最為關鍵的一步,在於Astra極具洞察力地區分了兩種極易混淆的共軛關係——可測共軛與代數共軛。在過去,許多數學家習慣性地將它們視為一體,而Astra通過嚴謹的邏輯將兩者徹底分離。這個區分一旦確立,後續的構造便如高屋建瓴,順理成章。 與此同時,停滯了長達46年的高維球體堆積問題也被正面擊穿。在n維空間中如何將相同大小的球體堆積得最為緊密,這個問題本身通俗易懂,但卻難如登天。2022年,烏克蘭數學家Viazovska因為解出了8維與24維的精確堆積密度而榮獲菲爾茲獎,可其他維度的密度上限卻一直如同鐵板一塊。1978年,蘇聯數學家Kabatiansky與Levenshtein給出一個著名的上界,此後整整半個世紀,再也無人能向前推進哪怕一寸。Astra這次精確計算出了Cohn–Elkies線性規劃的指數衰減率,意味著它把那個卡了全球數學家46年的Kabatiansky–Levenshtein界,首次推開了歷史性的一毫米。 此外,Astra還在組合數學領域一口氣解決了傳奇數學家埃爾德什(Erdős)留下的三道經典開放問題,包括著名的第183號多色拉姆齊數、第146號與第180號極值圖論猜想;在算術電路複雜性方面給出了n⁴/log n量級的新下界;在量子複雜度理論中證明了通用雙人量子博弈的指數並行重複定理;並在格密碼學的基礎問題上證明了最近向量問題的多項式因子近似困難性。曼徹斯特大學數學家Thomas Bloom事後評價道,這次集中發佈的十項結論,其整體學術價值遠超五個月前OpenAI證偽“埃爾德什單位距離猜想”的單次成果。 ### 數學界與AI圈的集體震動與冷靜旁觀

Astra的公佈如同在平靜的學術深潭中丟入了一塊巨石,全球學術界與科技業陷入一片震動。頂尖數學家的反應非常直接。羅格斯大學傑出教授、美國數學學會成員Alex Kontorovich在社交媒體上的評價只有兩個驚歎號。菲爾茲獎得主、劍橋大學教授Timothy Gowers則直言:“如果這些證明通過了完整的同行評議,我們將需要重新思考'做數學'意味著什麼。”牛津大學數論教授Thomas Bloom也感嘆:“25年前我們還在用紙筆推公式,現在AI竟然直接證明了非sofic群。”數學家兼AI研究者Ilya Glazer說得更為徹底:“數學家的定義被改寫了。”

AI圈內部同樣為之震動。OpenAI首席研究科學家Noam Brown表示:“測試時計算還遠未見頂——我們一直低估了推理期間投入更多算力的價值。”微軟研究院副總裁Sebastien Bubeck的感慨則帶有一絲個人化色彩:“我不敢相信我們真的做到了。非sofic群從'幾乎不可能被證明'的列表中劃掉了。”獨立評估機構Epoch AI則強調,他們採取了前所未有的隔離措施,確保這些競賽題目絕對沒有出現在任何公開的訓練數據中——Astra展現的是真正的數學創造力,而非檢索能力。 然而,在一片讚歎聲中,刺耳的質疑聲同樣無法忽視。認知科學家Gary Marcus立刻潑來一盆冷水。他在個人博客發文指出,圍繞Astra的討論正在犯一個經典的合成謬誤:把“模型在特定數學任務上的表現”誇大成“通用智能的躍遷”。Marcus的邏輯很平實:一個擅長數學的人並不能在寫作或理解人際關係上自動成為天才。Astra的確擅長某些數學問題,但這不意味著它能避免模型幻覺,更不意味著它能解決其他生成式AI系統普遍存在的可靠性問題。他甚至尖銳地補充:“它甚至不意味著它能可靠地讀取PDF。”

### 狂歡背後的四道冷靜關卡

熱鬧歸熱鬧,在為AI歌功頌德之前,至少有四件事值得我們冷靜下來看一看。 第一,Astra是尚未發佈的內部模型。OpenAI對外展示的是精選後的10道成功題目,我們無從得知團隊究竟嘗試了多少道題、失敗了多少次。Noam Brown自己也坦承,他們曾試探過黎曼猜想等級的千禧年難題,目前尚未成功。那些未被展示的暗面,才是評估AI真實能力上限的關鍵。 第二,同行評議尚未完成。截至目前,Astra的數學成果尚未通過傳統學術期刊嚴格的同行評議。有數學家指出,OpenAI在國會山的演示更像一場“精心策劃的營銷事件”。“攻破難題”與“被數學界正式確認”之間,還隔著一個完整的獨立複核週期。在沒有同行評議之前,任何聲稱都只能算是技術公司的一面之詞。 第三,Lean驗證通過並不等於證明原創。OpenAI已在GitHub上公開了十項結果的Lean形式化證明文件,官方形式化清單顯示,主要證明的sorry_count為0——也就是說沒有留白、沒有跳步。但這套驗證系統能保證的,僅限於推導本身在邏輯上沒有漏洞。一個更為本質的問題是:從數學家的原始猜想到Lean能讀懂的形式化命題,這個翻譯過程究竟有沒有走樣?證明的方法夠不夠新?結果在整個學科中的真實分量如何?這些問題Lean無法回答,只能依靠人類數學家的價值判斷。形式化系統能做的,只是逐行檢查推理鏈條的合法性,它無法判斷模型是否真正“理解”了其在做什麼。 第四,2000美元僅為推理成本。這個驚人的數字只計算了Token損耗,按Sol API價格折算。而模型的訓練成本(數十億美元級)、頂級研發團隊的薪資、選題方向的研究、數學家的參與費用以及龐大的基礎設施投入,統統未納入其中。官方倉庫另註明,將這些證明整理成Lean形式化文件,前後花費了一週時間。將“2000美元拿下菲爾茲獎級難題”當作標題,多少有將毛利率當作成本價的意味。 ### 數學的經濟學正在改寫

拋開狂熱宣講與技術質疑,Astra此次事件真正的歷史坐標,或許不在這10道題目本身,而在於三件更為底層的變革。 第一,它第一次將“提出論證、整理論證、機器驗證”三件事串聯成了一條完整的流水線。過去,大模型在數學領域充其量只是個算得快的計算器,查文獻、潤色證明、寫代碼。而Astra完全改變了遊戲規則:論證由模型自己生成,人類與模型一同整理成論文,再由模型將每一道步驟轉化為Lean形式化證明證書。這意味著數學研究裡最核心的兩道關口——“把答案想出來”與“確認答案沒想錯”——第一次被同一個模型同時攻破。 第二,它將AI的能力證明從“benchmark分數”切換為“解決真正沒人解決過的問題”。這套新邏輯設計得非常聰明:未解難題沒有標準答案,沒有洩露風險,沒有過度擬合的可能。你出一道沒有前人解過的難題,我解了,這就是最好的能力證明。但它也有一個致命的軟肋:驗證權到底在誰手裡?“此前無人解決”這句話的驗證機制是什麼?由誰來獨立複現?這些問題在OpenAI的公告中沒有得到完全回答。在沒有獨立驗證之前,“解了10道數學題”只能作為一個強有力的營銷信號,而尚不能構成一個完整的科學事實。 第三,Altman優先選擇在華盛頓進行演示,這個細節透露了更多信息。Astra的這次發佈,首先是講給政策制定者聽的,其次才是講給開發者聽的。理由非常清晰:AI政策的走向,高度取決於政策制定者是否相信AI公司有能力管理好前沿技術的風險。如果OpenAI能持續向政府展示“我們的AI能解決人類未解決的難題”,那麼這個敘事在獲取政策信任、規避過度干預方面,將擁有直接且巨大的價值。Astra系列模型預計將成為首批須經特朗普政府新版AI框架審查的產品,該框架要求AI公司在向公眾發佈模型前,須事先向美國政府提交備案。 所以,Astra真正的意義,或許不是“AI即將捧起菲爾茲獎”,至少在今日,它還沒有。真正被撼動的,是數學研究的經濟學根基。過去,一個頂級團隊可能耗費五年心血才攻下一道難題;現在,幾千美元就能批量掃蕩候選答案。OpenAI同期宣佈向10萬名科學家和數學家免費開放其最強模型的使用權,這顯然不僅是慈善,更是在搶佔下一代科研入口的制高點。 陶哲軒在2026年國際數學家大會上的那句預言——“從證明稀缺到證明過剩”——如今被提早命中。當一台中端筆記本電腦的算力便能批量生產經機器驗證的數學證明,這個世界稀缺的不再是“能不能證出來”,而是“我們還想問出什麼值得被證明的問題”。2000美元在市場上或許可以買到十個定理的嚴謹證明,可是購買不回那個深夜裡,人類望向虛空並追問“為什麼是這個問題”的瞬間。而那個瞬間,或許依然屬於人類。

Related

相關文章

當AI把門檻降低,創作者拿什麼拼出“人味兒”?

AI大幅降低內容創作門檻,但大量作品陷入同質化模板,觀眾開始產生審美疲勞;真正能留住人的反而是細節真實、情感真摯、能引發共鳴的「人味兒」作品。文章以《美醜》《電話》《臨水》等AI短劇為例,指出創作者需將自身真實經歷與感受轉化為AI能執行的指令,才能跨越「人味兒」這道門檻,而這也將成為未來AI創作拉開差距的關鍵。

剛剛

微軟不賭模型

微軟不賭模型AGI-Signal2026.08.04 09:34 · 來自海外全文4416字00:00 / 13:03在AI競賽中,最大的確定性不來自模型能力的領先,而來自算力基礎設施的掌控力。過去兩年,市場習慣用“押注贏家”來理解雲廠商對模型公司的投資。誰投了OpenAI,誰投了Anthropic,誰押對了賽道。這套敘事簡潔有力,也符合科技媒體對“贏家通吃”的本能偏好。

剛剛

Salesforce們過苦日子,但飛書、釘釘們的春天來了

「歡迎來到『AI黃金時代』。」這句話勾勒出當前企業軟體市場的丕變。當全球AI浪潮席捲各產業,以Salesforce為代表的歐美SaaS巨頭反而迎來難熬的階段——市場對傳統訂閱制軟體的模式開始產生質疑,成長動能趨緩,客戶對AI投資的回報期待也愈來愈高。這些昔日風光的雲端軟體龍頭,正面臨轉型壓力與獲利考驗,過去「賣軟體就能躺著賺」的時代顯然已經告一段落。

剛剛

警惕AI通縮陷阱:效率提上來了,利潤卻被卷沒了

伴隨AI熱潮逐漸退去,全球企業管理者正面臨一場新的考驗:如何將技術真正轉化為效益。然而,一個容易被忽視的風險正悄然浮現——AI在提升生產力的同時,可能催生激烈的價格競爭,引發所謂的「技術通縮」。波士頓諮詢集團全球首席經濟學家菲利普·卡爾松-斯萊扎克與高級經濟學家保羅·斯沃茨近日聯合撰文指出,生產力大幅提升反而可能造成企業利潤下滑,這一殘酷規律值得所有管理者警惕。 文章指出,AI固然是極具顛覆性的技術,但其提升生產力的方式並無特殊之處,本質上仍是改變投入與產出的配比。當一項技術得到廣泛普及,通常通過三種路徑發揮作用。

剛剛

鎧俠官宣 GP1 XL-FLASH PCIe Gen6 固態硬盤,隨機讀取 100M IOPS

鎧俠正式發表首款支援GPU直接存取的高速固態硬碟KIOXIA GP1,採用第二代XL-FLASH儲存級記憶體與PCIe Gen6介面,隨機讀取效能達100M IOPS。該產品鎖定新興AI儲存架構,以低於HBM的成本擴充資料集並提升GPU利用率,提供E3.S與E1.S規格,耐久度達50 DWPD,預計2026年底出樣品。

剛剛