馬斯克親自下場演示:Grok 新功能能"看片"了,一段科比 AI 視頻精準識破
重點摘要
馬斯克親自示範Grok新版本,上傳一段科比AI合成影片,Grok不僅能解析畫面與台詞,還精準判定該影片為深度偽造的AI內容。這項功能讓用戶可上傳影片檔案或連結,進行總結、識別人物與物體等互動,相較於先前僅提取音訊的舊模式,實現了跨越式升級。
馬斯克親自下場演示:Grok 新功能已能「看片」,一段科比 AI 合成影片被精準識破
特斯拉與 SpaceX 執行長伊隆・馬斯克近日在自家社群平台 X 上親自為旗下 AI 平台 Grok 的新版本宣傳,並上傳了一段已故籃球傳奇巨星柯比・布萊恩(Kobe Bryant)的 AI 合成影片作為實測案例。Grok 不僅完整解析了畫面中的場景與人物動作,還精準提取出影片中的核心台詞,最終判定這段影像為深度偽造的 AI 合成內容,展現出全新的影片多模態理解能力。 從馬斯克公開的對話紀錄可以看到,Grok 在接收到影片後隨即進行逐幀解析。模型描述道:「科比身穿黑色西裝,以標誌性的『曼巴精神』發表獨白,伴隨著指點、手勢、微笑以及身體前傾靠近鏡頭的動作,燈光極具電影質感。」這段描述顯示出 Grok 已能像人類觀眾一樣辨識畫面中的視覺元素與情緒氛圍。 隨後,Grok 進一步精準提取出影片中的核心台詞,包括「SpaceX 迄今為止打造的最強智能模型」「Grok 4.5,偉大源於磨礪,曼巴,退場」等句子。這項能力意味著 Grok 不再只是單純轉錄音頻,而是能在理解影片語境的同時,從連續畫面中鎖定關鍵話語。 最關鍵的環節在於綜合判定。Grok 結合所有畫面、台詞與上下文資訊,最終判定這段影像屬於深度偽造(Deepfake)的 AI 合成影片,並指出科比已於 2020 年離世,影片內的人物畫面均為 AI 生成而非真人實拍。這項判斷不僅展現了 Grok 的「看懂」能力,更凸顯其具備辨別真偽的高階推理邏輯,對於現今充斥假影片的網路環境極具實際應用價值。 Grok 近日正式上線的影片交互功能,讓用戶可以像上傳圖片一樣,在對話視窗中直接上傳本地影片檔案或貼上影片連結,並向 AI 下達各類指令。支援的功能包括總結影片全篇內容、識別畫面中的人物與物體、拆解動作細節,或針對任一細節持續追問交流。這項升級大幅拓展了 Grok 的應用場景,從過去的靜態圖像分析邁入動態影片理解。 相較於以往僅提取音頻文字、再生成摘要的舊模式,新版 Grok 實現了跨越式升級。它能夠聯動連續幀畫面、音頻資訊與上下文邏輯,全方位深度理解整條影片內容。當 AI 從「聽影片」進化到「看影片」,從單純的內容總結升級到真偽鑑別,影片交互的技術天花板又被抬高了一截。 這項新功能對於媒體識讀、內容審查、教育訓練乃至娛樂產業都將帶來深遠影響。過去要辨別一段影片是否為 AI 合成,往往需要仰賴專業工具與人力判斷,如今 Grok 能在對話中即時給出分析結果,大幅降低門檻。尤其對於 X 平台上的大量用戶,未來可能直接利用 Grok 來驗證可疑影片的真實性。 馬斯克選擇以科比 AI 影片作為測試案例,本身也帶有話題性。科比於 2020 年因直升機事故逝世,多年來相關的 AI 合成影片層出不窮,部分甚至被誤傳為真實畫面。Grok 能夠準確識別,並主動引用已知事實(科比已離世)來輔助判斷,展現出模型在知識記憶與推理推理上的整合能力。 目前 Grok 的影片交互功能已向部分用戶開放,預計將在後續更新中逐步擴大適用範圍。隨著多模態 AI 模型持續進化,從文字、圖片到影片的全方位理解已成為主流趨勢。Grok 新版本的上線,標誌著 xAI 在這一領域的技術實力正快速追趕甚至超越競爭對手。 業界分析指出,當 AI 能夠同時處理視覺、聽覺與語義資訊時,其在自動駕駛、機器人、醫療影像分析等領域的應用潛力也將大幅提升。Grok 此次升級不僅是產品功能的更新,更代表 AI 從「感知」走向「認知」的關鍵一步。未來,用戶或許只需上傳一段影片,就能讓 AI 完成從內容摘要到真偽驗證的全自動分析流程。 在馬斯克的親自背書下,Grok 的影片分析能力已然成為市場焦點。隨著更多用戶實際體驗,這項功能能否真正解決深度偽造影片帶來的資訊安全挑戰,值得持續關注。
Related
相關文章
SK海力士與閃迪發佈HBF首個標準規範,為AI推理時代破解“內存牆”
美國閃存峰會(FMS 2026)在加利福尼亞州聖克拉拉會展中心開幕之際,SK海力士宣佈聯手閃迪(Sandisk)共同發佈下一代存儲技術:高帶寬閃存(High Bandwidth Flash,簡稱HBF)的首個標準規範。該規範由全球最大的開放式數據中心技術合作組織OCP(Open Compute Project)正式發佈,定位為行業通用開放標準。

美國政府完成先進 AI 模型自願性評估框架制定,內容未公開
美國政府已按期完成針對先進 AI 模型評估的自願性框架制定,但白宮未對外公開具體內容、審閱機構及採用時程。該框架原應涵蓋保密、網路安全、風險管理與智慧財產權等要求,不過相關基準測試與適用門檻被列為機密。白宮計劃與業界召開會議審查該框架,並與更多合作夥伴討論後續步驟。
智譜AI新一代大模型GLM-5.3意外曝光
智譜AI尚未正式發佈的新一代旗艦模型GLM-5.3,因官網頁面、搜索引擎緩存及開源代碼庫等多渠道的“意外”洩露而提前曝光。GLM-5.3的意外曝光,使得三大頭部廠商的頂級模型在短期內集中亮相,市場爭奪戰一觸即發。截至發稿,智譜AI官方並未就GLM-5.3的洩露事件及具體發佈時間做出正式回應。業內普遍預期,鑑於模型已進入公開測試或展示階段,智譜AI或將在近期擇機正式對外公佈GLM-5.3的詳細技術參數與上線計劃。
DeepSeek-V4-Flash登頂全球調用量榜首,國產大模型包攬前五
7月31日最新發布的DeepSeek-V4-Flash正式版以2.33萬億Token的調用量強勢登上榜單第八。DeepSeek-V4-Flash 0423版和DeepSeek-V4-Flash 0731版合計調用量斷層領先。僅8月3日一天,DeepSeek-V4-Flash 0731版的調用量就達到1.02萬億Token,超過此前霸榜的DeepSeek-V4-Flash 0423版。價格方面,V4-Flash的競爭力幾乎無人能敵。海外開發者集體沸騰DeepSeek V4-Flash正式版上線後,海外開發者社區的反應堪稱熱烈。研究機構Artificial Analysis更直言,DeepSeek-V4-Flash已成為全球知名模型中運行成本最低的一款。從7月31日API公測到8月3日登頂全球調用量榜首,DeepSeek-V4-Flash僅用了不到一週時間。

飛書變革的伏筆,字節早就埋好了
字節跳動將飛書產品團隊與豆包團隊整合,並將飛書GTM團隊併入火山引擎,這是字節跳動為加速AI商業化而進行的最大規模To B業務重組。此舉旨在讓飛書成為AI原生應用的載體,並整合豆包與火山引擎的能力,以搶佔桌面AI辦公入口,並應對高昂的AI基礎設施投入與商業化壓力。

阿里字節騰訊,為AI辦公拼了
字節跳動、阿里巴巴與騰訊在短短兩週內接連對AI辦公領域進行重大整合,分別將飛書、千問辦公及WorkBuddy等產品與AI能力深度綁定,意在搶佔下一代辦公入口。三家巨頭皆認為,辦公場景已成為大模型token變現效率最高的領域,且Agent技術已跨越可用性門檻,因此同步加速內部整合,以統一產品入口覆蓋全流程工作流。