Anthropic 隱形浮水印能否遏止「AI 廢料」,研究者持保留態度

Anthropic 隱形浮水印能否遏止「AI 廢料」,研究者持保留態度

2026/08/14

研究人員認為,Anthropic 新導入的 AI 內容標記機制對於遏止學術界日益氾濫的「AI 廢料」作用有限,主要原因是浮水印在改寫與編輯後容易失效。

針對 Anthropic 近期為 Claude 導入的 AI 生成內容標記機制,學界研究人員表達了保留看法:這項措施對於遏止學術界日益氾濫的「AI 廢料」(AI slop),實際效果可能相當有限。

該機制的技術設計包含兩部分:Claude 產生的文字會加入肉眼看不見的浮水印,而支援的圖像檔案則附上符合 C2PA 標準、經數位簽署的來源中繼資料。從技術意圖看,這是為了讓下游能夠判斷內容來源,回應各國對 AI 生成內容可辨識性的監管要求。

研究者的疑慮集中在穩健度上。文字浮水印的原理,是在模型生成時於 token 選擇的機率分布上施加特定的統計偏置,形成人類讀不出、演算法卻能檢測的模式。這種訊號的強度取決於文本長度與未經修改的程度——當文本經過改寫、翻譯、與人工內容混合,或僅擷取片段使用時,統計訊號會被稀釋到無法可靠檢出。而學術寫作中,AI 產出的內容幾乎必然經過編輯與整合,正好落在浮水印最脆弱的使用情境。

更根本的問題在於,這項機制的設計目標與「遏止 AI 廢料」並不完全一致。浮水印能幫助誠實的使用者標示來源,卻無法阻止有意隱藏的行為——移除標記的技術門檻並不高,而刻意大量產出低品質論文的行為者,本就沒有誠實揭露的動機。這是一個對合作者有效、對對抗者無效的機制。

「AI 廢料」在學術界造成的實際問題也不只是來源辨識。真正的困擾在於:投稿量因為產出成本下降而暴增,同儕審查的人力無法等比擴充;低品質但形式完整的論文佔用審查資源;以及部分內容包含看似合理卻不存在的引用。這些問題即使能標示出 AI 參與,也不會自動獲得解決——期刊仍須投入人力判斷內容品質。

因此,較可行的因應方向可能不在偵測技術,而在制度設計:調整投稿與審查的誘因結構、對投稿量設限、要求作者對內容正確性承擔更明確的責任,以及改革以論文數量為主的學術評鑑機制。這些都是社群治理問題,而非技術問題。

從更廣的角度看,這個爭論反映了內容標記機制的普遍侷限。它是建立來源可追溯性的基礎建設,具有長期價值,但把它期待為解決濫用問題的方案,則超出了它能承擔的範圍。

後續觀察重點包括:主要期刊對 AI 使用揭露的規範調整、檢測工具在真實編輯情境下的準確率,以及其他 AI 業者是否採用同等標準。