AI 訓練資料供應鏈地下化,從爬蟲到拆書的隱憂
2026/08/27
AI 訓練資料的取得手段,正從網路爬蟲延伸到實體書籍的拆解掃描;這條供應鏈的透明度與合法性,成為新的爭議焦點。優質資料的稀缺,正在推高取得資料所需付出的代價。
這個轉變的成因相當清楚。公開網路上可用的高品質文本已被大量使用,繼續擴張的邊際效益持續遞減;而網站經營者對爬蟲的封鎖日益普遍,內容持有者的授權要求也逐步收緊。當最容易取得的來源枯竭,注意力便轉向尚未被數位化的素材——而實體書籍正是其中規模最大、品質最高的一塊。
書籍作為訓練素材的價值,在於其密度與結構。相較於網路文本的碎片化與品質參差,出版書籍經過編輯、校對與事實查核,論述完整且脈絡連貫;而專業書籍更涵蓋了網路上難以取得的深度領域知識。對於希望提升模型在專業任務上表現的業者,這類素材具有不可替代性。
「拆書」這個作法的爭議,在於它遊走於法律的模糊地帶。購買實體書籍取得的是該實體物的所有權,可以自由處置——包括拆解與掃描;而爭點在於掃描後的數位副本能否用於訓練。不同司法管轄區對此的認定並不一致,而相關訴訟的結果也尚未形成穩定的判準。
「地下化」則指向更深的問題:這條供應鏈的不透明。當資料的取得涉及法律風險,相關的作業便傾向低調進行——透過中介商取得、不揭露來源、也不對外說明處理流程。結果是使用該模型的下游企業,無從得知其訓練資料的合法性狀態,而潛在的法律風險便隨著模型的採用而擴散。
這也與另一個技術困境相互強化。研究已指出,模型規模越大,越難追溯特定輸出對應到哪些訓練資料;這使得事後的舉證與釐清幾乎不可能。當溯源不可行,法律責任的認定便可能轉向「訓練資料的取得方式是否合法」——也就是把焦點從輸出端移回輸入端。
對企業採用者而言,實務上的啟示是模型來源的盡職調查正變得必要。訓練資料是否有正式授權、業者能否提供相關證明,應納入採購評估;而在受監理產業中,這可能成為能否導入的前提條件。
後續觀察重點包括:相關訴訟的判決方向、正式授權市場的發展,以及立法對訓練資料揭露的規範進度。