跳至主要內容
科技 分析

為了餵給 AI,珍稀實體書正被成批送進碎紙機:高效能運算的資料掠奪現形

珍稀圖書遭粉碎以獲取高品質 AI 訓練資料,凸顯了人工智慧發展與知識儲存之間的利益衝突。

Techroomage 編輯部 閱讀約 8 分鐘
為了餵給 AI,珍稀實體書正被成批送進碎紙機:高效能運算的資料掠奪現形

掃描一本書最快速、最清晰的方法是什麼?答案是破壞它。

把書脊裁斃、拆解成單張書頁,送入高速文件掃描機。當所有文字被轉換為乾淨的純文字檔後,這些曾經承載知識的實體載體就會被直接打成紙漿。這套為了追求極致效率與低成本的數位化作業流程,如今成為全球人工智慧公司獲取高品質訓練資料的捷徑。近期媒體揭露,大量珍稀圖書正因此被集中粉碎,而這場風暴的矛頭,指向了全球知名的圖書數據庫網站 ISBNdb。

事件起因於多家圖書供應商近期接到數量異常龐大的庫存收購訂單。由於各級學校與圖書館近年預算普遍縮減、採購需求大幅下滑,許多供應商面臨龐大的生存壓力,這類能瞬間清空倉庫的大額訂單成了延續營運的救命稻草。然而,當供應商發現這些買家收購圖書的目的並非為了閱讀或二手流通,而是為了掃描後銷毀以餵養大語言模型時,輿論隨之引爆。

面對外界的強烈撻伐,ISBNdb 發布聲明試圖切割。該公司宣稱從未從事 AI 模型訓練業務,引發爭議的行銷頁面僅是一次市場需求測試,相關服務從未真正上線,目前該頁面已被緊急下架。但在那個已經被刪除的宣傳網頁上,清晰地寫著:「世界上最優質的 AI 訓練資料,就擺放在書架上。圖書承載著經過篩選、同行評審和專業領域沉澱的人類知識,其結構化程度是任何網路爬蟲都無法複製的。」

ISBNdb 已刪除的宣傳文字,強調實體書籍蘊含高品質且結構化的 AI 訓練資料。

從網路抓取免費文本,轉向實體圖書的實質收購與銷毀,標誌著 AI 產業在資料獲取策略上的根本性轉變。要理解這個轉變,必須從技術與商業利益的層面探究。

大語言模型的性能表現,高度取決於訓練階段餵入的資料品質。在過去幾年間,AI 公司主要仰賴網路爬蟲(Web Crawlers)從各大論壇、部落格與新聞網站大量抓取免費文本。然而這種掠奪式的抓取正面臨瓶頸。網際網路上充斥著大量低品質內容、農場文章與錯誤資訊,更嚴重的是,隨著生成式 AI 普及,網路上充斥著越來越多由 AI 自身生成的文本。如果模型持續吸收這些未經篩選的混合資料進行訓練,會產生嚴重的「負回饋循環」,導致模型幻覺增加、邏輯推理能力下降。

相較之下,實體出版品具備無可替代的優勢。一本書在出版前,歷經了作者的文字打磨、編輯的校對以及同業審查。這種高密度、高邏輯性且結構嚴謹的純文字,是訓練模型進行複雜推理與專業問答的完美養分。為了獲取這些乾淨的資料,AI 公司開始將目光轉向實體書市場。

過程中牽涉的不只是技術選擇,更是嚴峻的成本考量。圖書數位化掃描分為「非破壞性」與「破壞性」兩種。非破壞性掃描需要使用 V 型特殊書架與精密感測設備,逐頁翻拍,這種方式能保持書本完好,但設備昂貴且掃描速度極慢。對於動輒需要數百萬本書籍作為訓練資料庫的 AI 巨頭而言,這種產能完全無法滿足需求。

破壞性掃描則是直接切除書脊,將書本化為散頁,送入工業級的批次饋紙式掃描機。這種方法每分鐘可掃描數百頁,成本極低,但代價是實體書的徹底毀壞。在效率與成本的驅使下,將圖書拆解掃描後打成紙漿,便成為產業檯面下的常規操作。

回顧今年初揭露的法庭文件,這項極具爭議的做法其實早有先例。人工智慧新創公司 Anthropic 曾被揭露內部推動一項代號為「巴拿馬計畫」(Project Panama)的專案,目標是大量收購實體書籍,進行數位化掃描後將原書銷毀。

該專案曝光後引發軒然大波,Anthropic 最終與提出告訴的作者羣達成總額 15 億美元(約合新臺幣 480 億元)的和解協議。然而,法庭文件顯示了一個令人不安的事實:這種大量收購並銷毀圖書以獲取訓練資料的做法,在現行美國法規下,基於合理使用的辯護空間,某種程度上可能被認定為合法。讓 Anthropic 真正感到畏懼並願意支付天價和解金的,並非敗訴的風險,而是這種「為了發展 AI 而摧毀人類知識載體」的行為一旦在社會大眾心中留下惡劣印象,將對企業聲譽造成無法挽回的損害。

統計圖卡呈現 Anthropic 為巴拿馬計畫支付的十五億美元和解金額。

企業聲譽的隱形成本與數位文化資產的流失,在這場資料爭奪戰中形成尖銳對立。這也是為什麼當 ISBNdb 試圖在 AI 公司與圖書供應商之間扮演掮客角色時,會立刻遭到猛烈抨擊。

對於傳統圖書供應商而言,這是一場難以拒絕的交易。面對實體閱讀市場萎縮與營運壓力,出清滯銷庫存換取現金是維持生計的現實選擇。一名匿名圖書賣家在接受外媒採訪時無奈表示,這種交易確實能清理難以賣出的庫存並帶來收入,但親眼看到具有歷史與收藏價值的稀有書籍被當成廢紙打碎,內心仍感到抗拒。這種矛盾反映了文化儲存與科技資本擴張碰撞時,第一線營運者的道德困境。

知識的載體正面臨被吞噬的危機。這與我們先前探討過的谷歌地球 AI 生成功能爭議有著相似的邏輯。當科技巨頭為了推進技術,毫無節制地消耗現有的文化資產或地理真實性時,往往會對社會的集體記憶與資訊信任度造成傷害。

生成式 AI 企業在面對模型訓練的「資料飢渴」時,正在改變獲取資料的路徑。他們不再單純依賴網路的免費開源文本,而是開始透過資本向實體世界進行精準獵捕。除了掃描並銷毀實體書籍,這些公司也開始與擁有高品質多媒體資料的機構建立合作。例如電影製作公司 A24 最近就宣布與谷歌 DeepMind 合作,提供高品質的影視素材作為訓練資料,協助媒體生成模型擺脫長期以來吸收低畫質網路影片所造成的風格混亂與品質低落問題。

這些現象共同指向了一個新的產業局勢:高品質訓練資料已經成為當代 AI 軍備競賽中最稀缺的資源。擁有優質文本與影像資料的實體機構,正成為科技巨頭競相收購或合作的目標。而在這個過程中,如果缺乏適當的監管與道德規範,破壞性的資料提取將成為常態。

清單圖卡列出 AI 公司獲取高品質訓練資料的多種途徑,從網路爬取演進到實體書籍與專業影視授權。

對於廣大的內容創作者、出版業者以及使用者而言,這股趨勢帶來了深遠的影響。當實體書被掃描並銷毀,人類失去的不僅是一本具有物理價值的物件,更是紙本印刷時代特有的知識傳承鏈。未來,要判斷一個 AI 模型是否具有高度可信賴的專業能力,檢視其訓練資料的來源將變得至關重要。同時,出版社與作者也必須重新審視版權授權的合約細節,避免自身的心血在不知情的情況下,成為推動機器運算的燃料後被當成廢棄物丟棄。

面對大語言模型日益龐大的資料缺口,單純依靠企業的自律顯然已經不足夠。實體書籍的銷毀與數位化掠奪,揭露了人工智慧發展進程中最現實的商業運作。如何在科技演進與知識資產儲存之間取得平衡,將是未來幾年各國法規制定者、文化機構與科技產業必須共同面對的嚴肅課題。

#科技#分析#ai訓練資料#資料版權