近300萬人圍觀卡帕西親測Opus 5:兩小時寫完5500行代碼, 卻連自己寫的遊戲都玩不了

重點摘要
這篇消息聚焦「近300萬人圍觀卡帕西親測Opus 5:兩小時寫完5500行代碼, 卻連自己寫的遊戲都玩不了」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
AI 領域知名人物、前 OpenAI 研究員與特斯拉自動駕駛技術負責人卡帕西(Andrej Karpathy)近日在社群平台上進行了一場長達兩小時的直播實測,親自挑戰一款名為「Opus 5」的模型。這場直播不僅吸引近 300 萬人次圍觀,更因為他在短短兩小時內利用該模型生成了 5500 行程式碼,嘗試寫出一款可玩的遊戲,最後卻發現連自己都無法順利遊玩,引發熱烈討論與大量轉發。 卡帕西向來以深入淺出的技術分享著稱,這次他刻意選擇從零開始建構一款遊戲,涵蓋遊戲邏輯、畫面渲染與互動機制等完整環節。在直播過程中,他幾乎全程仰賴 Opus 5 自動產出程式碼,只見模型以驚人的速度一行一行吐出程式,短時間內就累積了超過五千行的程式碼庫。卡帕西不時驚嘆於模型的生成效率,並與觀眾互動,展示每個階段的進度。 然而當遊戲初步完成,卡帕西實際操作時,卻發現遊戲存在多處錯誤與邏輯缺陷。例如角色移動會卡住、碰撞判定異常、關卡無法觸發切換,甚至連基本操作都無法順暢執行。他試圖手動調整幾處關鍵參數,但由於程式碼數量龐大且結構複雜,除錯過程耗費不少時間,最終仍無法讓遊戲順利運作。卡帕西在直播尾聲苦笑表示,自己連這款由 AI 協助寫出的遊戲都玩不了,凸顯了當前模型在複雜邏輯驗證與除錯層面的明顯侷限。 這場親測不僅展現了 Opus 5 在程式碼生成方面的驚人速度與產量,也讓外界清楚看到「寫得多」與「寫得對」之間仍有不小的差距。卡帕西在直播中多次強調,大型語言模型在生成代碼時,往往能快速給出看似合理的結構,但實質上缺乏對整體系統一致性的掌握,尤其當程式碼彼此依賴、狀態共享時,錯誤很容易層層疊加。 業界人士分析,Opus 5 這類模型在自動化生成程式碼方面確實具備潛力,但距離真正的「AI 工程師」還有很長的路要走。卡帕西的測試結果正好提供了一個真實對照:模型可以幫你寫出大量程式碼,卻無法保證這些程式碼能正確運作,尤其當專案規模變大、邏輯鏈條變長時,模型的弱點會更加明顯。 值得注意的是,卡帕西並非首次公開測試大型語言模型的程式碼能力。過去他曾多次使用不同模型進行類似實驗,包括撰寫簡單的演算法、自動補全程式碼片段等,但這次的遊戲開發挑戰規模更大、互動性更強,也更貼近真實開發情境。他選擇將完整過程直播,讓觀眾親眼見證模型從快速生成到陷入除錯困境的完整過程,引發了許多開發者的共鳴。 不少網友在觀看直播後留言表示,自己也曾遇過類似情況:AI 幫你寫了一大堆程式碼,但實際上線時卻漏洞百出,除錯時間甚至比從頭自己寫還長。卡帕西則在直播中總結,當前的 AI 程式碼生成工具比較適合當作「加速器」或「靈感來源」,而非取代工程師的思考與驗證。他認為,未來模型的進步方向應該著重於邏輯推理與錯誤檢測,而非僅追求生成速度與字數。 這場直播也讓 Opus 5 模型在技術圈內獲得大量關注。雖然卡帕西並未公開模型的具體技術細節,但從其輸出品質與速度來看,Opus 5 在參數規模與訓練資料量上應該處於業界領先水準。然而,正如卡帕西所展示的,參數量大並不代表邏輯正確,尤其是在需要持續維護狀態與處理邊界條件的遊戲開發場景中,模型的表現仍有待提升。 從更宏觀的角度來看,卡帕西的親測經驗為 AI 輔助開發的實用性提供了真實的參考數據。開發者可以藉此評估何時適合讓 AI 介入,以及何時需要人類工程師的介入。業界普遍認為,未來 AI 與人類協作的最佳模式,可能是讓 AI 負責大量模板化、重複性的編碼工作,而由人類主導邏輯設計、架構規劃與最終驗證。 卡帕西在直播最後並未放棄這款遊戲,他預告將在後續影片中嘗試手動修正錯誤,並與 Opus 5 模型合作完成除錯。這也暗示著,即使模型當下無法完美產出可執行的遊戲,但透過人機協作的反覆迭代,仍有機會逐步縮小差距。對於廣大開發者而言,這場直播不僅是一次技術展示,更是一堂關於 AI 能力邊界與開發思維的寶貴課程。
Related
相關文章

博導稱月之暗面 Kimi 創始人楊植麟有很多機會留在美國,但他毅然拒絕蘋果、堅持回國創業
月之暗面創辦人楊植麟的博士生導師透露,楊植麟在攻讀博士期間及畢業後,曾收到蘋果等美國科技巨頭的優渥工作邀約,但他最終放棄這些機會,毅然選擇回國創業。這項決定催生了月之暗面公司及其AI產品Kimi,讓他在短時間內成為中國AI領域的重要人物。
歐盟AI透明度新規生效
歐盟AI透明度新規生效。 歐盟正式實施透明度規則���️方案。詳情可以參考歐盟透明規則執行條例細則。大模型生成的內容必須帶機讀標記。深偽視頻必須向公眾進行明確告知。
大模型抗汙染對齊評測框架
大模型抗污染对齐评测框架近日成为关注焦点。该框架旨在系统评估大语言模型在数据污染或对抗干扰下的对齐表现,为检验模型的安全性与鲁棒性提供新的评测维度。 站内已清除先前混入的模型思考或安全判断文字,保持内容纯净,并保留来源可确认的主题供读者追踪,以确保信息准确可溯。
結構化輸出庫有效解決大模型胡言亂語
結構化輸出庫有效解決大模型胡言亂語。 開發者常為語言模型輸出不穩感到頭疼。我們可以用模型結構化輸出開源項目解決此痛點。開源庫支持 (o^^o) 強制模型生成符合模式響應。項目目前在社區已經獲得了超過一萬五千星。這對開發高可靠自動化工作流具有重要意義。
頂尖數學家借對話模型推演經典未解猜想
頂尖數學家借對話模型推演經典未解猜想。 菲爾茲獎得主分享了與大模型深入對話。我們在學者關於數學推演熱議帖子中瞭解全部細節。教授嘗試令 (⊙_⊙) 模型驗證多項式反例結構。評論指出必須通過人類專家引導才能出結果。如今的語言模型依然非常需要人工持續驗證。

全球首款 AI 智能體手機努比亞 NaviX Ultra 配置曝光:6.78 英寸 144Hz 屏、7100mAh 電池
首頁 > 數碼之家>智能手機 全球首款 AI 智能體手機努比亞 NaviX Ultra 配置曝光:6.78 英寸 144Hz 屏、7100mAh 電池 2026/7/22 20:51:25 來源:IT之家 作者:歸瀧 責編:歸瀧 評論: IT之家 7 月 22 日消息,博主 @熊貓很禿然 今日曝光了全球首款 AI 智能體手機努比亞 NaviX Ultra 核心配置。