爆料,奧特曼自曝「後Astra」模型,已超越全球最強數學家

2026年9月18日 08:51
爆料,奧特曼自曝「後Astra」模型,已超越全球最強數學家
站內 AI 整理稿

爆料指奧特曼罕談「後Astra」模型 稱數學推理已越過頂尖數學家門檻 在一場非公開交流中,OpenAI 執行長奧特曼罕見地觸及一款內部代號指向「後Astra」的新模型,並直言其數學推理能力已經越過了人類頂尖數學家的門檻。這番談話並未對外正式發表,卻迅速在開發者社群與投資人之間發酵,因為它暗示 OpenAI 的下一代主線模型,可能不再只是「更會解題」,而是開始在需要長鏈條推理、形式化證明與原創猜想的領域,與最強人類智力正面對標。據轉述,奧特曼在交流中並未給出任何 benchmark 分數,也沒有透露發布時程。他強調的重點,是這一代模型的方向已經從「答對率」轉向「能自己提出並驗證猜想」。

換句話說,評價一個模型好不好的標準,正在從「它能不能解出別人出的題」,移動到「它能不能自己找到值得解的問題,並且證明自己是對的」。這樣的轉向,與過去一年產業的整體走向一致。早些時候,業界的競賽集中在解題準確率,模型在標準化題庫上你追我趕;但近來關注的焦點,已經逐步轉向 IMO 級別的完整證明、定理的自動形式化,以及作為長期研究過程中的輔助工具。這意味著評測的難度與維度都在提升,也意味著模型的價值開始被放在更接近「研究能力」的尺規上衡量。若所言屬實,受衝擊最大的恐怕不會是搜尋或客服這類場景。那些應用固然重要,但它們處理的多是既有資訊的整理與生成。

真正會被撼動的,是那些以「人類稀缺的高階推理」為護城河的專業領域——從基礎數學、理論物理,到需要長鏈條論證的工程與金融建模。這些領域過去之所以難以被自動化,正是因為它們要求的不只是計算,而是判斷與創造。不過,「超越最強數學家」是一個極容易被過度解讀的表述。數學家的價值不只在於解既有難題,還在於選題品味、定義新問題、判斷什麼值得做。這些能力目前難以用單一評測衡量,也很難被簡化成一個分數。解出一道別人已經設定好的難題,與提出一個讓整個領域願意投入十年的新問題,兩者之間的距離,可能比多數人想像的更遠。也因此,奧特曼的這番爆料,更像是一種敘事鋪墊。

在算力與資金的競賽進入白熱化之際,先替下一代模型設定一個足夠震撼的座標,本身就是一種策略。當外界還在爭論上一代模型的邊界在哪裡時,先行把話題推到「後Astra」與「超越人類頂尖智力」,等於提前定義了下一輪競賽的量級與想像空間。這種操作在產業中並不罕見。過去幾年,前沿實驗室經常在正式發布前,透過半公開的談話、技術報告的片段,或研究人員的個人發言,逐步釋放訊號。這麼做的目的,一方面是測試社群反應,另一方面也是為即將到來的發布會與資本敘事預熱。當一個領域的競爭同時發生在技術、人才與資金三個層面時,話語權本身就是一種資源。真正的驗證不在發言裡,而在兩個地方。第一,是否開放可複現的評測。

如果一個模型真的越過了頂尖數學家的門檻,那麼它應該能在公開、可被第三方重複檢驗的基準上展現出來,而不是只停留在轉述與傳聞。沒有可複現證據的宣稱,無論出自多大的人物,都只能算是尚未兌現的承諾。第二,頂尖數學家是否願意把它當作日常研究工具。這是一個比任何 benchmark 都更嚴苛的檢驗。研究者會不會在遇到瓶頸時主動求助於模型,會不會讓它參與猜想的方向選擇,會不會把它的輸出當作值得進一步追查的線索——這些行為一旦成為習慣,才代表能力真正跨過了門檻。反之,如果它只是偶爾在展示場合令人驚豔,卻進不了日常的研究流程,那麼「超越」二字就仍然言之過早。

從更長的視角看,這則爆料透露的,其實是 OpenAI 對「下一步該往哪走」的判斷。當單純的規模擴張開始顯現邊際效益遞減,前沿實驗室需要新的故事來支撐投入的正當性。「能自己提出並驗證猜想」正好是這樣一個故事:它把模型從工具推向研究者,把應用場景從輔助推向共創,也把競爭的座標從分數推向人類最後的智力高地。值得留意的是,這類敘事的風險同樣明顯。一旦外界期待被拉得過高,而實際發布的成果與「超越最強數學家」的印象存在落差,反噬也會來得很快。過去已有不少模型在發布前被賦予過高的想像,最終在評測與實際使用中被打回原形。對實驗室而言,如何在製造想像與維持可信度之間拿捏分寸,是一門持續的功課。

在這些證據出現之前,這則爆料的價值,在於它透露了 OpenAI 的判斷,而非已經交出的成績單。它告訴我們,這家公司認為下一階段的關鍵詞是「原創推理」而非「答題正確率」,也告訴我們,它準備把競爭拉進數學證明與研究輔助這類最難被量化的領域。至於這份判斷最終會不會被成果兌現,仍要等待可複現的評測與研究者的實際選擇來回答。

Related

相關文章

IT之家模型更新

美國 AI 巨頭提議開發減速,歐洲同行和政界並不認同

作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)報道,此前,阿莫迪、奧爾特曼和馬斯克先後發出警告,能力不斷增強的 AI 系統可能帶來風險,故有必要控制其發展節奏,但歐洲企業和官員對此表現出明顯懷疑。法國初創企業 Mistral 在聲明中指出,這些風險早在幾個月前就已十分明確了。

1 小時前
IT之家模型更新

北京發佈“詞元經濟十條”:高標準建設詞元工廠,推動關鍵核心技術攻關

作者:浩渺 責編:浩渺 評論: 感謝網友 蛋殼兒 的線索投遞!9 月 18 日消息,北京市經濟和信息化局今日宣佈,北京市“詞元經濟十條”正式發佈。為貫徹落實《國務院關於深入實施“人工智能+”行動的意見》(國發〔2025〕11 號),率先培育智能經濟新形態,以詞元(Token)為抓手,發展詞元經濟新增量,制定《北京市加快詞元經濟發展的行動方案(2026—2028 年)》(注:以下簡稱《行動方案》)。

2 小時前
量子位模型更新

OpenAI剛曝光循環架構,這家公司更早將其用於世界模型

鍵詞只有一個:循環。 Astra採用了一種被稱為“循環深度”(Recurrent Depth)的架構,本質是讓同一組Transformer層被反覆複用,用更少的參數實現更深的計算。 這被外界視為OpenAI對傳統“堆參數、堆算力”路線的一次重大修正——不再只是把模型做大,而是讓模型學會“反覆思考”。 消息一齣,整個AI社區迅速升溫。

6 小時前

千問辦公接入高德門店經營專家套件 提升實體店選址與經營效率

此項新功能自9月18日起正式上線,用戶只需在千問辦公添加相應套件並完成高德賬號授權,即可實現從門店選址到日常經營分析的全鏈路工作。隨著實體商業的不斷發展,傳統的人工選址和經營分析方式顯得效率低下且容易出錯。個體創業者在開新店時,往往需要花費大量時間進行實地勘察,整體耗時可達一週,而商家在監測門店熱度變化及競爭對手動態時,也面臨數據整理繁瑣、分析結果不準確的問題。

7 小時前