Anthropic 15億美元版權案和解獲批:AI 訓練數據合法性嘅重要分水嶺

美國聯邦法官正式批准人工智能公司 Anthropic 15億美元嘅版權集體訴訟和解案。案件源於多名作家指控 Anthropic 喺未經授權下,使用盜版書籍訓練旗下 AI 聊天機械人 Claude。呢次判決係美國史上最大規模嘅版權和解案,確立咗使用盜版數據訓練 AI 嘅法律風險。每部受影響作品預計可獲約3,000美元賠償,事件將深遠影響全球內容創作者以及 AI 產業發展。

Anthropic 15億美元版權案和解獲批:AI 訓練數據合法性嘅重要分水嶺
Anthropic 15億美元版權案和解獲批:AI 訓練數據合法性嘅重要分水嶺

美國聯邦法院批准 Anthropic 15億美元和解案,拆解 Claude 版權爭議細節

喺早前嘅 7月20日,美國加州北區聯邦地區法院(U.S. District Court for the Northern District of California)正式批准咗一宗備受全球科技界以及出版界關注嘅集體訴訟和解案。知名人工智能開發商 Anthropic,亦即係熱門 AI 聊天機械人 Claude 嘅母公司,同意支付高達15億美元(約合117億港元),以平息一班作家對佢哋侵犯版權嘅指控。呢班作家控訴 Anthropic 喺開發大型語言模型(Large Language Models)嘅過程入面,涉嫌非法下載同埋使用未經授權嘅盜版書籍作為訓練數據。

聯邦法官阿塞莉·馬丁內斯-奧爾金(Araceli Martinez-Olguin)駁回咗部分認為賠償金額太少嘅反對意見,最終拍板通過呢份被譽為美國史上最大規模嘅版權案件和解協議。呢宗案件唔單止係數十宗控告科技巨頭侵權案中,第一宗達成重大和解嘅美國案例,更加為日後 AI 產業如何合法獲取訓練數據定下咗重要嘅參考指標。背後有亞馬遜公司(Amazon,股票代號:AMZN)同埋字母表公司(Alphabet,股票代號:GOOGL)注資支持嘅 Anthropic,今次雖然需要面臨巨額賠款,但亦成功避免咗漫長訴訟可能帶來數以千億美元計嘅潛在罰款風險。

Anthropic訓練AI = 盜版書籍?

案件源於2024年,當時一班作家正式對 Anthropic 提出起訴。案情指,Anthropic 為咗令旗下嘅 AI 聊天機械人 Claude 能夠流暢回應人類嘅提問,利用咗名為 Library Genesis(LibGen)同埋 Pirate Library Mirror(PiLiMi)嘅影子圖書館(Shadow Libraries),下載並儲存咗數以百萬計嘅盜版書籍,將佢哋放喺一個「中央圖書館」(Central Library)作為機器學習嘅養分。

其實早喺去年(2025年6月),已退休嘅前主審法官威廉·阿爾蘇普(William Alsup)曾經作出過一項關鍵裁決。當時法庭認為,科技公司如果使用透過合法途徑購買嘅書籍嚟訓練 AI 模型,喺美國版權法之下可以被視為「合理使用」(Fair Use),因為呢種行為具有轉化性質(Transformative)。不過,法官同時指出,Anthropic 並無權限為咗建立一個永久嘅中央圖書館而去收集盜版副本。換言之,AI 訓練本身未必違法,但係用盜版資料嚟做訓練就絕對觸犯咗版權擁有者嘅權益。當時案件原定於去年12月開審,一旦入罪,Anthropic 將面臨難以估計嘅天價賠償,因此雙方最終喺去年9月達成咗初步和解協議。

來到今年7月,法官阿塞莉·馬丁內斯-奧爾金頒下長達23頁嘅最終命令,正式落實呢筆15億美元嘅賠償細節。針對部分作家認為賠償金過低嘅質疑,法官喺判詞中指出,呢啲反對聲音並無切實評估若果案件進入全面審訊所需要承擔嘅巨大風險。法庭同時亦大幅削減咗原告律師團嘅律師費,由原本要求佔和解金12.5%(約1.875億美元),大減至大約1.015億美元。而案中嘅首席代表作家所獲發嘅服務酬金,亦由原來要求嘅5萬美元,下調至1.5萬美元。呢啲扣減措施,客觀上令到最終可以分配畀受影響版權持有人嘅金額有所增加。

根據和解協議,名單上大約有48萬部合資格作品被確認曾經遭盜版下載。法庭估計,每部受影響嘅作品將可以獲得大約3,000美元嘅賠償。值得留意嘅係,如果作家同出版社之間依然維持住一般嘅出版合約,呢筆大約3,000美元嘅賠償金將會由作者同埋出版社各佔一半。Anthropic 方面嘅代表律師阿帕娜·斯里達爾(Aparna Sridhar)發表聲明指,目前已經有超過91%受和解案涵蓋嘅作家同出版社提出咗索償申請,公司非常期待盡快為呢場風波畫上句號。

其他附加基本資料與事實整理

為咗令讀者更加清楚呢件案件點解會對全球華人地區,包括香港、中國內地、台灣以至新加坡嘅創作者都息息相關,我哋整理咗以下幾個關鍵分析點:

一、合法購買與盜版數據嘅界線

今次案件最核心嘅法律指標,係劃清咗「合理使用」嘅界線。如果 AI 公司肯出錢買正版書,並將其數碼化作訓練用途,法庭傾向認為呢個係為咗節省儲存空間同埋屬於合理嘅技術轉化;但直接從盜版網站下載文字,就完全缺乏合法授權基礎。呢個區分將會迫使日後所有 AI 開發商,必須保留清晰嘅數據來源紀錄(Provenance),以證明佢哋嘅訓練資料庫係乾淨合法嘅。

二、對內容創作者嘅實際影響

雖然今次獲得賠償嘅主要係西方英文出版物嘅作者,但由於 AI 訓練涉及大量多國語言數據,華文作家嘅作品同樣有機會被全球大型科技公司「吸納」。香港、台灣等地嘅出版社同獨立作家,日後遇到同類情況時,可以參考今次案件大約「每部作品3,000美元」嘅賠償基準嚟評估自身損失。同時,亦提醒咗創作者喺簽訂出版合約時,必須睇清楚有關「訴訟賠償分成」以及「AI 授權條款」嘅細節。今次案件入面,出版社可以從賠償金中分走一半,正正係源於合約入面嘅分成規定。

三、同業競爭者嘅法律現況對比

除咗 Anthropic 之外,其他業界龍頭同樣面對緊大量版權訴訟。例如 Meta 亦面對緊另一宗由作家發起嘅訴訟(Kadrey v. Meta Platforms, Inc.)。喺 Meta 嗰單案件入面,法庭雖然早前初步認可咗模型訓練屬於合理使用,但目前依然容許作家針對 Meta 涉嫌透過 BitTorrent 上載受版權保護作品嘅指控繼續進行法律程序。Anthropic 選擇洗大錢「買個安心」,將有助佢哋未來專注於技術發展,唔需要將資源過度消耗喺無止境嘅法庭戰入面。

四、賠款發放時間表

根據法庭文件顯示,由於賠償金額龐大,加上涉及超過40萬部作品,管理賠款發放係一項極度繁複嘅工程。Anthropic 會分四期將資金注入和解戶口,最後一期去到2027年先到期。換言之,作家們好大機會要分批,或者一段時間後先可以實際收到支票。而且,和解條款僅限於涵蓋到2025年8月25日為止嘅「輸入端」(Inputs)侵權行為,即係獲取及複製作品嘅過程。有關 AI 模型生成內容(Outputs)係咪侵權,以及未來嘅運作方式,協議中並無包含任何免責條款。部分選擇唔參與今次集體和解嘅作家,目前亦已經對 Anthropic 提出咗獨立訴訟,戰火其實並未完全熄滅。

總結

總括而言,Anthropic 今次豪擲15億美元達成和解,無疑為整個人工智能行業敲響咗警鐘,標誌住過去 AI 公司為求發展而「先下載、後理會」嘅野蠻生長時代已經結束。呢宗歷史性判案清楚說明,科技進步唔可以建立喺剝削知識產權嘅基礎之上。對於香港以至全球嘅內容創作者嚟講,呢次事件提供咗一個重要嘅維權參考案例,確立咗未經授權使用盜版庫資料必須承擔法律後果嘅大原則。

未來,隨住各國監管機構對 AI 模型訓練數據庫嘅透明度要求越來越高,科技公司與出版業界之間必須尋求一個互惠互利嘅授權機制。創作者喺擁抱新技術嘅同時,亦需要密切留意國際上嘅版權法例發展,好好保護自己嘅心血結晶。