GPT-6評分口徑被質疑
GPT-6評分口徑再受質疑 ARC表格落差37分掀基準可信度爭議 GPT-6 的評分口徑再度成為外界關注焦點。在 Astra 評分爭議持續延燒之際,一名 Reddit 作者主動著手核對 ARC 相關表格,發現兩項測試之間的成績落差達到 37 分。這項發現讓討論迅速升溫,質疑的矛頭也從單一模型表現,轉向同一模型在不同評測基準下,其成績是否被以不同方式呈現。據了解,這名 Reddit 作者並非僅止於比對數字,而是進一步檢視 ARC 方面對外發布的相關資料。在交叉核對的過程中,兩項測試之間的落差成為最受矚目的焦點。
37 分的差距,在講求精確與可比較性的評測領域中並不算小,也因此被視為理解整起爭議的關鍵切入點。這位作者同時指出,ARC 方面從未將這項結果直接稱為 AGI。換言之,評測方自身的表述相對保守,並未把高分與通用人工智慧畫上等號。然而在外界傳播的過程中,高分往往被簡化為「已達 AGI」的訊號,這與評測方的原始說法並不一致。正因為存在這樣的落差,爭議的焦點也出現轉移。討論不再只是圍繞「模型到底有多強」,而是進一步追問「分數究竟代表什麼」。當同一個模型在不同基準下呈現出明顯不同的成績,分數本身的意義與可比較性,便成為無法迴避的問題。爭議的影響範圍並未侷限於單一評測方。這波討論亦波及 OpenAI。
有用戶在比對之後指稱,OpenAI 頁面上的數值曾經出現改動,使得評分的可追溯性受到進一步檢視。一旦同一組數據在不同時間、不同頁面上呈現出不一致的樣貌,外界對於評分可信度的疑慮便難以平息。可追溯性是評測公信力的重要基礎。當數值會隨時間或頁面而變動,外界便難以確認哪一版才是最終定稿,也難以還原評分的完整脈絡。對研究者與一般讀者而言,這不僅是技術細節,更牽涉到能否信任一份評測報告的核心前提。截至目前,各方尚未就表格差異與頁面數值變更給出統一說明。在缺乏一致解釋的情況下,各種推測與質疑持續累積,也讓原本單純的成績之爭,逐漸演變為對整個評測流程的信任考驗。
從更廣的角度來看,這起風波反映出評測生態的結構性難題。當模型能力快速推進,評測基準、揭露方式與對外溝通若無法同步跟上,就容易出現資訊落差。同一個模型在不同基準下的表現被以不同方式呈現,究竟是方法差異、更新時序,還是其他因素所致,目前仍缺乏清楚交代。此外,外界把高分直接等同於通用人工智慧的傾向,也在此次爭議中被放大檢視。評測方未曾如此表述,但傳播鏈上的簡化與誇大,卻可能讓公眾對模型能力產生誤解。這種「評測說一套、傳播說另一套」的現象,正是本次討論中最值得注意的一環。對 OpenAI 而言,頁面數值變動的指稱若無法獲得妥善說明,評分的可追溯性將持續受到檢視。
對 ARC 而言,表格差異與 AGI 表述的界線,也需要更清楚的溝通。當各方說法未能對齊,外界對評分可信度的疑慮便難以真正平息。可以預見的是,這場爭議恐怕不會只停留在單一模型的成績之爭。它牽動的是評測方法、資訊揭露與公眾理解之間的整體關係。若同一組數據在不同時間、不同頁面上持續呈現不一致,外界對評分可信度的疑問只會不斷累積。在各方給出一致且可檢驗的說明之前,關於 GPT-6 評分口徑的討論,以及 ARC 表格與 OpenAI 頁面數值的疑問,恐怕仍將是輿論關注的核心。分數究竟代表什麼,這個問題的答案,或許比模型本身強到什麼程度,更值得被認真對待。
Related
相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究
作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

阿里達摩院開源全球首個專家級通用醫療影像 AI 模型 DAMO RADAR:可一次性識別超 146 種病症,成果登《科學》
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 files 的線索投遞!9 月 18 日消息,阿里達摩院今日宣佈,與浙江大學醫學院附屬第一醫院等機構研發出的通用醫療影像 AI 模型 DAMO RADAR,登上國際頂級學術期刊《科學》(Science)。

零樣本幹活!Figure 機器人走進 30 個陌生家庭,整理客廳、折毛巾、鋪床
AGI...智客Z...2026.09.18 15:08 · 來自北京全文3855字00:00 / 11:06美國人形機器人公司Figure發佈Helix 2.5,將其稱為最先進的神經網絡。人形機器人真正走向家庭,難點或許從來不是“會不會做家務”,而是換一個家庭之後,它還能不能繼續做。

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線
。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線
我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”
Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。