一枚小小的蘋果 AirTag,竟然揭開了一場橫跨美國數州的「文化屠殺」。當你以為亞馬遜的倉庫只是用來堆放準備出貨的日常用品時,內華達州那座代號「LAS8」的物流中心裡,正有成千上萬本絕版藏書被切斷書脊、高速掃描,然後像廢紙一樣扔進垃圾桶。這些書的下場不是變成電子書造福讀者,而是淪為大型語言模型的「數據飼料」。
說真的,這件事聽起來像是反烏托邦小說的開頭,但它確確實實正在發生。根據外媒 404 Media 的深入調查,包含亞馬遜在內的多家科技巨頭,正透過隱密的供應鏈批量收購珍稀書籍,並將它們送入特定倉庫進行破壞性銷毀。
一個 AirTag 的跨州追蹤:揭開「LAS8」倉庫的殘酷流水線
這起調查的源頭,來自 404 Media 與一位珍稀書籍賣家的合作。他們在一筆高達 1,000 本珍貴藏書 的採購訂單中,將一枚 AirTag 巧妙地塞進其中一本書的夾層內,開始了為期數週的物流追蹤。
追蹤訊號顯示,這批文獻從加州出發,中途經過密爾瓦基、科羅拉多州的大章克申,最後抵達亞馬遜位於內華達州拉斯維加斯東北部的「LAS8」大型物流倉庫。這座倉庫表面上負責亞馬遜的按需印刷服務,但內部一個名為「VGT3」的管制區,執行的卻是完全相反的破壞性作業。
在「VGT3」裡,送達的書籍面對的是標準化的毀滅流程:
- 工作人員使用專業切紙設備切斷書脊,讓裝訂完整的書籍瞬間解體為零散紙頁
- 零散紙頁送入工業級高速進紙掃描儀,進行全自動光學掃描,迅速將文字轉為純文字數據
- 文字數據被灌入大語言模型的底層數據集,作為預訓練演算法的專屬「飼料」
- 紙張數位化後,既不上架也不製作成電子書,而是直接丟棄——物理世界的書就這樣消失了
從產業面來看,這件事最荒謬的不是「書被拆」,而是「書被拆完之後,它的知識從來沒有機會被人類讀到」。這些書的旅程終點不是讀者的書桌,而是 AI 的神經網路參數。當我們把人類文明的實體載體當成一次性耗材來使用,這種「文化資本」的消耗速度,遠比我們想像中來得驚人。話說回來,如果有一天實體藏書真的被 AI 吃光了,我們該拿什麼來校對 AI 產出的幻覺?
為什麼非拆不可?AI 資料荒背後的「模型崩潰」恐懼
你可能會問:幹嘛不直接上網抓資料就好,非得要拆實體書?問題就出在,現在的網路已經被 AI 自己污染了。
隨著 ChatGPT 這類工具普及,網路上充斥著大量 AI 生成的合成內容。當大型語言模型反覆拿這些「AI 寫的東西」來訓練自己時,會引發所謂的 「模型崩潰」效應——模型的輸出越來越同質化、平庸,甚至喪失基本的邏輯推理能力。更糟的是,合成資料還會放大 AI 的「幻覺」問題,讓錯誤資訊在遞迴訓練中被強化為虛假的「事實」。
為了逃離這種惡性循環,開發商急著尋找「從未被 AI 污染過」的人類原創內容。而尚未被數位化的古老實體書籍,就這樣成了科技公司眼中的頂級礦脈——純淨、獨特,而且沒有人工智慧插手的痕跡。
目前美國法院的司法判例傾向於認定,這類操作在「合理使用」範疇內屬於合法行為,前提是科技企業並未將這些未經授權的數位化內容公開發行或轉售,僅作為內部訓練參數使用。事實上,不只亞馬遜,包括知名 AI 獨角獸 Anthropic 在內的多家研發機構,也早已投入這場搶購實體書的軍備競賽。
根據業內專家的估算,這種「毀書取字」的模式,每處理 1,000 本實體書所能產生的訓練數據量,大概只夠一個中型模型訓練幾小時。但為了這幾小時的「純淨數據」,我們可能永久失去一批連國家圖書館都沒收藏的絕版文獻。這個交換比例,合理嗎?
當法律的許可撞上文化的焦慮
法律的許可,並未平息文化界的巨大焦慮。文史學者與圖書館界發出沉痛警告:實體書籍的存量是有限的,尤其那些存世量稀少的絕版書與地方文獻,一旦在這場「先拆書、後銷毀」的競賽中消失,就是真正的物理絕跡。
換個角度想,我們正在用一種不可逆的方式,把人類文明的備份「燒」進機器的參數裡。如果哪一天資料中心硬碟毀損、格式無法讀取,或者 AI 公司倒閉,這些知識就等於從地球上被抹去了——連一本實體複本都不剩。
對一般人來說,這件事的影響可能不會立刻顯現,但它問的是一個更深層的問題:我們是否願意將人類數千年的文字遺產,全權交給幾家科技巨頭來決定「哪些值得保存、哪些可以銷毀」?
亞馬遜的「LAS8」絕對不會是最後一座毀書基地。只要 AI 資料荒一天沒有解決,這條「珍本→飼料→廢紙」的流水線就不會停止。但我們至少可以開始思考:有沒有更好的方式來取得訓練數據,而不是用毀掉實體文明的方式,來餵養未來的數位文明?
如果你也覺得這件事值得關注,不妨從身邊做起:支持實體書店的二手書流通、鼓勵數位典藏機構將珍本進行非破壞性數位化,或是在社群上討論這個議題,讓更多人意識到「AI 的背後正在消耗什麼」。因為當所有書都被拆光之後,我們失去的不只是紙張,而是再也回不來的歷史現場。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
亞馬遜為什麼要拆毀實體書來訓練 AI?
因為網路上的文字資料已經大量被 AI 生成的內容污染,若繼續使用這些「合成資料」來訓練模型,會導致模型崩潰、輸出品質下降。實體書籍尚未被數位化,被視為純淨且原創的頂級訓練素材。
這種拆書行為在台灣合法嗎?
台灣的著作權法對於「合理使用」有明確的判斷標準,包含利用目的、作品性質、利用比例及市場影響等四項要素。此類大規模破壞性掃描在台灣是否合法,仍需個案判斷,且須符合《文化資產保存法》對珍稀文獻的保護規範。
一般讀者該如何避免珍稀書籍被這樣銷毀?
可以將家中或機構內的絕版書籍捐贈給具備數位典藏能力的圖書館或學術機構,而非賣給不明來源的收購商;同時支持推動「非破壞性數位化」的相關政策與計畫,讓知識保存與 AI 發展能夠並行不悖。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。
