歐盟新規逼使AI「留痕」 Anthropic公開Claude隱形水印運作細節 寫Code改文會否受影響?
Anthropic 8月14日公佈旗下AI模型Claude嘅文字水印機制技術細節。為符合歐盟《人工智能法案》規範,系統採用 SynthID-Text 技術,喺文字生成過程嘅「低風險字詞選擇」中植入隱形規律。水印唔會影響文章質素或生成速度,但能透過 API 檢測AI參與程度。文章探討技術原理、對修改文章及寫Code嘅影響。
因應歐盟法規 Anthropic 為 Claude 文章加入「隱形標籤」
隨住人工智能(AI)生成內容普及,點樣識別文本係由人類抑或AI撰寫,成為全球科技界同法規制定者關注嘅核心議題。人工智能初創企業 Anthropic 8月14日詳細公開咗旗下人工智能助手 Claude 嘅文字水印(Text Watermark)機制運作細節。呢項技術主要係為咗符合歐洲聯盟(European Union, EU)最新實施嘅《人工智能法案》(EU AI Act)透明度守則,要求AI開發商必須提供能夠識別AI生成內容嘅機制。
根據 Anthropic 發布嘅官方文章, Claude 嘅文字水印技術唔會喺文章內加入任何肉眼可見嘅標記,亦唔會插入隱藏字元或額外嘅標點符號。對一般讀者嚟講,有水印同冇水印嘅文章喺閱讀體驗上完全冇分別。呢項技術採用咗由 Google DeepMind 開發並發表喺《自然》(Nature)期刊嘅 SynthID-Text 技術方案,透過喺AI挑選字詞嘅過程中植入特定數學規律,令特定 API 能夠檢測出文章係否出自 Claude 之手。
水印機制運作原理:利用「低風險選擇」植入隱形規律
到底文字水印係點樣喺唔改變文章意思嘅情況下嵌入?要明白呢一點,首先要了解大型語言模型(LLM)生成文字嘅基本原理。
一般而言,AI模型喺生成文章嗰陣,係逐個字詞(Token)去計算同預測下一個最合適嘅字。當系統接續「今日嘅天氣好冷同埋...」呢句說話嗰時,下一個字詞挑選「陰暗」或者「灰暗」嘅機會率,會遠遠高於「甜美」呢類完全無關嘅字詞。喺語意合理嘅前提下,揀選「陰暗」定係「灰暗」,對整篇文章嘅意思同質素影響極微,呢啲情況喺技術上被稱為「低風險選擇」(Low-stakes choices)。
喺過往嘅運作中,AI 會透過隨機數生成器喺呢啲同義詞之中隨機挑選一個。而 Anthropic 採用嘅水印機制,就係將呢個完全隨機嘅過程,替換成一套由特定「密匙」(Key)控制嘅演算法。
例如,系統可以用圓周率(Pi)嘅數字序列作為密匙。當遇到低風險選擇嘅時候,演算法會根據密匙嘅數字嚟決定挑選候選字詞清單中嘅第幾個字。一篇文章經過多次呢類低風險字詞選擇之後,就會喺整體文本結構中累積出一套獨特嘅統計學規律。呢種規律對於人類讀者嚟講係完全察覺唔到嘅,但只要擁有解密密匙嘅檢測工具,就可以計算出該段文字由 Claude 生成嘅概率。
Anthropic 強調,呢套水印系統有以下幾個主要技術特點:
- 唔影響文字質素:系統唔會逼使AI選擇不合邏輯或者唔符合語境嘅字詞,生成內容嘅流暢度同準確度維持不變。
- 唔增加算力成本:水印過程唔會產生額外嘅 Token,亦唔會拖慢 Claude 嘅回應速度或增加運算費用。
- 保障個人隱私:嵌入嘅水印只包含模型層面嘅規律,完全無法追溯至特定嘅使用者、帳戶、對話紀錄或機構組織。
檢測限制與邊界:短文、事實陳述同程式碼影響有幾大?
雖然文字水印為AI內容識別提供咗新方向,但 Anthropic 亦坦承呢套技術並非萬能嘅「靈丹妙藥」,喺實際應用上有相當多嘅邊界同限制。
1. 檢測工具只能評估「參與概率」
Anthropic 表示即將推出水印檢測 API(Watermark Detection API),畀外界驗證文本。然而,檢測結果只能回答「呢段文字有幾大機會係由 Claude 協助撰寫」,而無法百分之百肯定文章完全由人類編寫,亦無法辨識其他廠商嘅AI模型。因為每個AI開發商都會使用自己獨立嘅密匙同演算法,Google 或 OpenAI 嘅水印無法用 Anthropic 嘅密匙解讀。
2. 文本長度同內容性質影響檢測準確度
水印嘅本質係建立喺多次字詞選擇累積嘅統計規律之上。因此,文章越長,可供植入水印嘅「低風險選擇」就越多,檢測嘅準確度亦隨之提升;相反,如果只係幾十個字嘅短句,由於統計樣本不足,檢測工具好難作出準確判斷。
此外,對於高度依賴事實陳述嘅段落(Factual passages),水印嘅效果亦會大打折扣。例如當 Claude 生成「艾薩克·牛頓(Isaac Newton)最著名嘅著作係 Principia...」呢句句子嗰陣,下一個字詞唯一正確嘅選擇只有「Mathematica」,AI 根本冇任何挑選同義詞嘅空間。喺呢種缺乏低風險選擇嘅情況下,水印就無法有效嵌入。
3. 修改、重寫與潤飾文章嘅水印殘留狀況
好多用戶會使用 Claude 嚟幫自己寫嘅文章進行校對(Proofread)或者語法修正(Grammar correction)。Anthropic 指出,喺呢啲情況下,水印只會附著喺 Claude 實際修改過嘅地方(例如標點符號、文法調整或替換嘅詞語)。如果文章大部分內容依舊係由人類作者撰寫,水印嘅濃度會好低,檢測工具可能無法識別。
對於生成出嚟嘅文章,如果用戶只進行輕微修訂(Light editing),水印通常仍然會殘留喺文本之中;但如果用戶將文章進行全面重寫(Complete rewrite),將大部分字詞替換掉,原有嘅統計規律就會被完全破壞,水印亦會隨之消失。
4. 程式碼生成(Code)嘅特殊情況
喺程式編寫方面,由於程式語言(Programming languages)對語法同邏輯有極嚴格嘅精準要求,大部分程式碼都屬於「精確輸出」,缺乏同義詞替換嘅彈性。因此,Claude 生成嘅程式碼本體部分幾乎冇植入水印嘅空間。水印主要只能出現在程式碼中嘅注釋(Comments)或者少數可自由命名嘅變數名稱中,對實際運行嘅程式碼影響微乎其微。
法規推動與用戶反應:透明度守則與社群討論
Anthropic 推行文字水印嘅主要原因,係要配合歐盟《人工智能法案》中嘅透明度條款。根據該法案要求,AI 系統開發商必須採取適當措施,確保由人工智能生成或操縱嘅文本、影像、音訊及影片能夠被系統化地識別。
目前,影像同音訊嘅 AI 水印技術已經相對成熟,例如 Google 同 OpenAI 早已喺旗下繪圖工具中導入 SynthID 水印,方便網絡平台辨識合成圖片。然而,文字水印因為語言嘅靈活性同易修飾性,一直係技術上嘅難題。隨住歐盟法規生效,主要 AI 模型開發商都相繼簽署咗相關嘅行為守則(Code of Practice),預計其他大型模型平台亦會喺短期內推出類似嘅文字水印機制。
呢項新政策喺科技社群引發咗廣泛討論。喺 Reddit 同 X(前身為 Twitter)等網絡討論區上,部分用戶對水印機制表示疑慮,擔心自己利用 AI 輔助創作嘅文章會被標籤化,甚至有少數用戶聲稱要取消 Claude 嘅訂閱服務。不過,亦有唔少技術專家同法律學者支持呢項做法,認為喺假新聞同 AI 垃圾內容氾濫嘅時代,適度嘅透明度有助建立網絡內容嘅信任度,亦係負責任 AI 開發(Responsible AI Development)嘅必經之路。
總結:AI 內容可追溯化邁向新階段
整體嚟講,Anthropic 公布嘅 Claude 文字水印機制,展示咗科技界喺符合監管要求同保障使用者體驗之間尋求平衡嘅努力。呢套技術透過微妙嘅統計規律,喺唔影響閱讀品質、唔增加成本同唔侵犯用戶隱私嘅前提下,為 AI 生成文本提供咗一種可追溯嘅技術途徑。
隨住歐盟法規落地同各大 AI 廠商相繼跟進,文字水印好快會成為生成式 AI 領域嘅標準配備。對於一般讀者同內容創作者嚟講,了解呢啲技術嘅運作原理同限制,將有助喺人工智能普及嘅時代,更理性、客觀咁看待同使用 AI 輔助工具。