馬斯克宣佈:Grok學會看片了,無字幕看懂陶哲軒菲獎級難題

重點摘要
馬斯克宣布旗下AI模型Grok已具備影片理解能力,能在無字幕情況下直接看懂數學家陶哲軒提出的菲爾茲獎等級難題,顯示其視覺與推理整合能力大幅提升。這項突破展現了AI在跨模態理解與抽象推理上的進展,未來可望應用於教育與科研影像分析等領域。
馬斯克近日對外宣布,旗下人工智慧模型 Grok 在視覺理解能力上取得重大進展,正式具備「看片」能力。這項新功能最令人驚豔的示範,是 Grok 能夠在不依賴任何字幕或文字提示的情況下,直接看懂數學家陶哲軒所提出的菲爾茲獎等級難題。這項突破不僅展現了 Grok 在動態影像辨識上的實力,更凸顯其在跨模態整合與高階抽象推理上的躍進。 根據馬斯克團隊提供的測試細節,這次使用的影片內容完全沒有搭配任何文字說明、解題提示或旁白引導。換句話說,Grok 必須單憑畫面上的數學符號、算式推演過程,以及陶哲軒的書寫動作,自行判斷題目的核心命題,並進行後續的數學推演。結果顯示,Grok 不僅正確識別出題目的關鍵結構,還能針對該難題展開高階邏輯推論,彷彿真的「看懂」了影片中的學術內容。 陶哲軒被譽為當代最傑出的數學家之一,他在數論、調和分析、偏微分方程等多個領域都有極具影響力的貢獻,曾於2006年獲得菲爾茲獎。他提出的問題往往被視為頂尖智力挑戰,對人類專家而言都需要高度專注與深厚的數學素養才能應對。如今 Grok 能夠在動態影像中「一眼看穿」這類問題,意味著 AI 在視覺與語言的融合能力上,已經抵達一個全新的層次。 這並非 Grok 首次展現驚人實力。在此之前,該模型已在多輪對話、程式碼生成、數學解題等任務中證明過自己的表現。然而,這次的「看片解題」示範,特別強調了視覺資訊與語言推理之間的無縫銜接。傳統的 AI 模型往往需要透過文字轉錄或字幕輔助,才能理解影片中的內容;但 Grok 這次的表現,顯示它已經能夠直接從動態影像中提取語義與邏輯結構,並進行跨模態的推理。 馬斯克在公開場合強調,這項技術的突破並非只停留在實驗室展示的層面。他認為,未來 Grok 的影片理解能力可以廣泛應用於教育領域,例如自動分析教學影片中的數學、物理或化學問題,即時為學生提供解題思路與詳細講解。此外,在科學研究影像分析方面,也能幫助研究人員快速識別實驗過程中的關鍵步驟與異常現象,大幅提升科研效率。 從技術角度來看,Grok 要達成「無字幕看懂」影片,背後需要整合多個先進的 AI 模組。首先,模型必須具備高效的視覺編碼器,能夠從連續畫面中抓取數學符號、圖表、公式以及書寫軌跡的變化。其次,模型需要擁有強大的時序理解能力,將這些動態視覺特徵轉化為有意義的數學敘述。最後,還需要一個具備深厚數學知識的推理引擎,才能對題目本身進行高階推演,而不是僅僅停留在「辨識」的層面。 這項成果也反映出 AI 在視覺與語言融合領域的整體進展。過去幾年,多模態模型如 GPT-4V、Gemini、Claude 等已經陸續展現出圖像理解能力,但大多仍受限於靜態圖片或需要文字輔助的影片內容。Grok 這次的示範,則將門檻提高到「動態影片中無文字輔助下的高階推理」,這對於 AI 真正貼近人類的直覺理解方式,具有重要的指標意義。 值得注意的是,陶哲軒本人對於 AI 的數學能力一直抱持著開放且審慎的態度。他曾在多個場合討論過大型語言模型在數學證明與解題上的潛力與限制。如今 Grok 能夠直接解讀他提出的菲爾茲獎等級難題,勢必會引發學術界對 AI 數學推理能力的進一步討論。部分專家認為,這類突破可能為數學教育帶來革命性變化,讓學生能夠透過 AI 輔助,更直觀地理解複雜的抽象概念。 從實際應用場景來看,Grok 的這項能力也可以用於自動化內容審查、學術講座摘要生成、開放式課程的即時輔助等領域。例如,當教師在課堂上板書解題時,AI 可以同步捕捉過程並生成對應的講解文字,甚至提供不同的解題思路。這對於資源不足的偏鄉教育或遠距學習環境,將是極具價值的工具。 馬斯克也在社群平台上表示,Grok 的「看片」能力目前仍在持續優化中,未來將逐步開放給更多使用者測試。他強調,這項技術的目標是讓 AI 能夠像人類一樣,從視覺經驗中直接學習與推理,而不是僅僅依賴大量的文字標註資料。這也呼應了他一直以來對「通用人工智慧」發展方向的願景。 整體而言,Grok 成功看懂陶哲軒菲爾茲獎級難題,不僅是一次技術展示,更象徵著 AI 跨模態理解能力邁入新階段。從影片中提取高階數學推理,過去被認為是極具挑戰的任務,如今 Grok 已經證明了其可行性。隨著這項技術逐步成熟,未來我們或許將看到更多 AI 與人類專家協作解決複雜問題的場景,而教育與科研的型態,也將因此迎來深刻的變革。
Related
相關文章
SK海力士與閃迪發佈HBF首個標準規範,為AI推理時代破解“內存牆”
美國閃存峰會(FMS 2026)在加利福尼亞州聖克拉拉會展中心開幕之際,SK海力士宣佈聯手閃迪(Sandisk)共同發佈下一代存儲技術:高帶寬閃存(High Bandwidth Flash,簡稱HBF)的首個標準規範。該規範由全球最大的開放式數據中心技術合作組織OCP(Open Compute Project)正式發佈,定位為行業通用開放標準。

美國政府完成先進 AI 模型自願性評估框架制定,內容未公開
美國政府已按期完成針對先進 AI 模型評估的自願性框架制定,但白宮未對外公開具體內容、審閱機構及採用時程。該框架原應涵蓋保密、網路安全、風險管理與智慧財產權等要求,不過相關基準測試與適用門檻被列為機密。白宮計劃與業界召開會議審查該框架,並與更多合作夥伴討論後續步驟。
智譜AI新一代大模型GLM-5.3意外曝光
智譜AI尚未正式發佈的新一代旗艦模型GLM-5.3,因官網頁面、搜索引擎緩存及開源代碼庫等多渠道的“意外”洩露而提前曝光。GLM-5.3的意外曝光,使得三大頭部廠商的頂級模型在短期內集中亮相,市場爭奪戰一觸即發。截至發稿,智譜AI官方並未就GLM-5.3的洩露事件及具體發佈時間做出正式回應。業內普遍預期,鑑於模型已進入公開測試或展示階段,智譜AI或將在近期擇機正式對外公佈GLM-5.3的詳細技術參數與上線計劃。
DeepSeek-V4-Flash登頂全球調用量榜首,國產大模型包攬前五
7月31日最新發布的DeepSeek-V4-Flash正式版以2.33萬億Token的調用量強勢登上榜單第八。DeepSeek-V4-Flash 0423版和DeepSeek-V4-Flash 0731版合計調用量斷層領先。僅8月3日一天,DeepSeek-V4-Flash 0731版的調用量就達到1.02萬億Token,超過此前霸榜的DeepSeek-V4-Flash 0423版。價格方面,V4-Flash的競爭力幾乎無人能敵。海外開發者集體沸騰DeepSeek V4-Flash正式版上線後,海外開發者社區的反應堪稱熱烈。研究機構Artificial Analysis更直言,DeepSeek-V4-Flash已成為全球知名模型中運行成本最低的一款。從7月31日API公測到8月3日登頂全球調用量榜首,DeepSeek-V4-Flash僅用了不到一週時間。

飛書變革的伏筆,字節早就埋好了
字節跳動將飛書產品團隊與豆包團隊整合,並將飛書GTM團隊併入火山引擎,這是字節跳動為加速AI商業化而進行的最大規模To B業務重組。此舉旨在讓飛書成為AI原生應用的載體,並整合豆包與火山引擎的能力,以搶佔桌面AI辦公入口,並應對高昂的AI基礎設施投入與商業化壓力。

阿里字節騰訊,為AI辦公拼了
字節跳動、阿里巴巴與騰訊在短短兩週內接連對AI辦公領域進行重大整合,分別將飛書、千問辦公及WorkBuddy等產品與AI能力深度綁定,意在搶佔下一代辦公入口。三家巨頭皆認為,辦公場景已成為大模型token變現效率最高的領域,且Agent技術已跨越可用性門檻,因此同步加速內部整合,以統一產品入口覆蓋全流程工作流。