珍本被切脊送進訓練集
亞馬遜近日被揭露一項引發爭議的作法:透過購買市面上稀缺的實體珍本書籍,直接將書脊切除後進行高速掃描,再將這些數位化內容納入人工智慧模型的訓練資料集。這些珍本因數量稀少、難以在線上取得,對大型語言模型的訓練極具價值,卻也因此面臨實體遭到物理破壞的命運。消息傳出後,出版界、文化保存團體與學術圈紛紛表達強烈不滿,擔憂此舉不僅踩踏版權紅線,更可能讓許多珍貴紙本著作在數位化過程中永久消失。科技巨頭為擴充AI訓練素材而毀損實體書,這在網路書店起家的亞馬遜身上尤其諷刺。亞馬遜最初以線上書店模式顛覆傳統出版零售,如今卻反過來將紙本書視為消耗性原料,只為了提煉其中的文字資料。
據了解,亞馬遜鎖定的是那些絕版、稀有或僅存少數實體版本的書籍,因為這些文本在網路上幾乎不存在數位版本,對訓練出更懂人類知識的AI模型來說是不可替代的「養分」。然而為了快速且高品質地數位化,亞馬遜的作業流程直接切掉書脊,使整本書變成可逐頁送入自動進紙掃描機的散頁,掃描完成後原本的裝訂結構便完全瓦解,實體書也難以恢復原狀。出版業者對這種「破壞性掃描」大感震驚。許多珍本書屬於私人收藏、大學圖書館特藏或小型出版社的最後庫存,亞馬遜透過市場或直接向賣家購買取得,但賣家往往不知道這些書最終會被拆解。業界人士指出,這不僅是技術問題,更涉及對書籍作為文化載體的尊重。
一本書的物理存在——包含紙張質感、印刷版本、裝幀設計——本身就是文化遺產的一部分,數位掃描雖能保留內容,卻無法複製實體書的歷史脈絡。當實體版本被摧毀,後人將永遠失去親手翻閱原版的機會,這對學術研究與文化傳承都是無可挽回的損失。版權爭議同樣是焦點。即使亞馬遜購買了實體書,是否就擁有將內容大規模用於商業AI訓練的權利?目前各國著作權法對於「合理使用」的界定仍多圍繞教育、研究或新聞報導,鮮少觸及以營利為目的且可能取代原創市場的AI訓練行為。部分稀有書籍的作者或版權繼承人可能根本不知道自己的作品已被掃描並餵入模型,而亞馬遜也未公開其訓練資料庫的具體書目。
法律專家警告,這種做法可能引發集體訴訟,尤其是當掃描內容涉及仍在版權保護期內的著作時。文化資產保存機構也表達高度憂慮。圖書館與檔案館在進行數位化時,通常採用不損壞原件的書本掃描機或專業翻拍設備,即便速度較慢,但能確保書籍的實體完整性。亞馬遜卻選擇了效率最高、破壞性最大的方式,凸顯科技公司在追求模型效能時,往往將文化保存視為次要考量。不少學者呼籲,應當建立科技公司使用珍稀文本的倫理規範,例如要求優先向圖書館或數位典藏機構取得授權,或是在掃描後將實體書捐贈給保存單位,而非直接丟棄。這一事件也讓外界重新審視科技巨頭在AI領域「資料饑渴」的現狀。
大型語言模型需要海量、多樣、高品質的文本才能表現良好,而實體書中蘊含的長篇論述、專業知識與文學作品,正是網路爬蟲難以取得的珍貴資源。為了填補訓練資料的缺口,亞馬遜並非唯一採取激進作法的公司。過去已有其他企業被揭露從圖書館大量借書掃描、甚至透過盜版網站下載文本。然而「買書切書」的作法格外觸動公眾神經,因為它同時觸及了消費倫理、智慧財產權與文化遺產保護等敏感議題。面對排山倒海的批評,亞馬遜目前尚未正式回應此項作法的具體細節。業界觀察人士指出,這起風波可能促使美國國會或歐盟加快對AI訓練資料來源的立法規範,要求企業揭露訓練資料的取得方式,並對稀有文化資產設定保護門檻。
與此同時,出版界與圖書館界也開始串連,呼籲書商與收藏家拒絕出售珍本給疑似用於破壞性掃描的買家,並推動建立「可數位化但不可毀損」的共識契約。科技進步與文化保存之間的矛盾並非新鮮事,但亞馬遜「切脊掃描」事件將這個衝突推向新的極點。當數位化成為無可避免的趨勢,社會必須在效率與倫理之間找到平衡:如何在確保AI發展不落後的前提下,同時守護人類文明最珍貴的紙本遺產?這不僅是亞馬遜的問題,更是整個科技時代必須共同面對的課題。
Related
相關文章

人格幾何與對齊:讓模型的內部結構與人類認知結構對齊的可能性
當我們看到模型內部的人格結構與人類高度一致時,一個自然的問題是,為什麼這種結構會在模型中出現。研究團隊給出了一個非常有說服力的解釋。語言中的人格詞彙結構高度穩定,人類在長期的社會互動中形成了共同的隱性人格結構,而語言模型從海量文本中學習語言時,自然繼承了這種結構。

微軟及 OpenAI 內部文件曝光:高管曾警告 AI 可能對新聞機構產生“毀滅性影響”
微軟與 OpenAI 的內部文件近日曝光,揭露高層曾對 AI 技術可能對新聞產業帶來的衝擊提出嚴厲警告。根據文件內容,微軟應用科學部門主管 Brent Hecht 直言,將新聞內容用於 AI 模型訓練的行為,等同於「前所未有的大規模盜竊」。這份內部記錄還顯示,微軟掌握的數據指出,部分正在對 AI 公司提起版權訴訟的新聞機構,其網站點擊率已大幅下滑超過 80%。 這些內部文件進一步凸顯了 AI 訓練過程中使用新聞素材所引發的法律與道德爭議。

開發者藉助 OpenAI GPT-6 Astra,破譯 83 年前德軍無線電密文
彭博社開發人員 Carter Leffen 藉助 GPT-6 Astra,將 1941 年德國士兵的 82 字符電報碼還原為連貫德語文本。一個已知地名和恩尼格瑪的加密弱點成為關鍵突破口。##GPT-6##恩尼格瑪##AI破解密碼#

被英偉達點名的杭州團隊,補上了AI for Science的「最後一公里」
一家來自杭州的團隊,近期獲得英偉達的公開關注,其技術被認為補齊了AI for Science(科學智慧)領域中「最後一公里」的關鍵環節。該團隊開發的系統,能讓科學研究者直接透過對話式互動,從最初的研究想法快速產出具體結果,大幅縮短了過去需要大量編碼與繁複流程的轉化路徑。 這項技術的核心在於將自然語言理解與科學運算流程深度整合。

CVPR 2026 | EmoThinker:讓 AI 學會"察言觀色"——會推理的情感分析新範式
這篇 CVPR 2026 論文EmoThinker的目標是讓模型像人類一樣"先觀察、再推理、後下結論"——先從視覺和聲學模態中分別提取情感證據,再顯式分析模態間的一致與衝突,最終給出情感判斷以及完整的推理過程,即基於大型視覺-語言模型(LVLM)的細粒度、可解釋情感推理。

為什麼基礎RAG在多跳推理中表現不佳(以及GraphRAG如何解決它)
當前的AI工程設計中,LLM(大語言模型)的構建方法過於簡單化了。按照迴音室效應的觀點,解決LLM幻覺問題很簡單:只需設計一個標準的檢索增強生成(RAG)系統,將PDF文檔拆分為1,000個token的塊,對其進行嵌入(Embedding),存入向量數據庫,然後執行餘弦相似度搜索即可。