Anthropic Claude AI生成浮水印技術細節曝!怎麼加入?可以移除嗎?

Anthropic揭Claude文字浮水印技術(圖:Shutterstock)
Anthropic揭Claude文字浮水印技術(圖:Shutterstock)

人工智慧(AI)生成內容的辨識技術再進一步。Anthropic近日首次公開說明Claude文字浮水印的技術細節,最新一批Claude模型已內建相關機制,舊版模型也將陸續適配。這項技術的核心,是在模型生成文字時調整選詞所使用的隨機機制,讓文字表面上與一般輸出沒有明顯差異,但持有密鑰的一方可以進一步驗證其中是否存在浮水印訊號。

Anthropic表示,這項機制不會刻意改變Claude生成文字的品質。Google過去也曾以Gemini進行A/B測試,比較有無浮水印的使用者回饋,結果顯示兩組在使用者評分上的差異並不顯著。

Anthropic此次公開的技術,也凸顯AI文字浮水印與一般AI內容偵測工具的差異。傳統AI偵測器主要依靠文字風格及語言特徵判斷內容是否由AI生成,而浮水印則透過預先植入的訊號進行驗證。

Claude如何將浮水印藏進文字

Claude生成文字時,會逐步選擇下一個詞。當多個候選詞的生成機率相近時,模型原本可以透過隨機機制決定最終選項。

Anthropic的做法,是在這個選詞階段調整隨機數產生方式,利用密鑰推導出具有特定規律的數值,取代原本無法預測的隨機數。

因此,從使用者閱讀的角度來看,生成結果不會因此變得明顯不自然,也不會刻意加入特殊詞彙。

然而,掌握密鑰的一方,則可以透過分析文字中的選詞規律,確認其中是否存在浮水印訊號。

這項概念最早可追溯至Scott Aaronson在2022年任職OpenAI期間提出的構想。Google DeepMind後續將相關思路發展為產品級技術SynthID-Text,並於2024年刊登於《自然》雜誌上。

Google也曾利用Gemini進行實際測試,在部分真實使用者身上加入文字浮水印,再與未加入浮水印的使用者進行比較。

結果顯示,兩組使用者在按讚及負評等回饋方面,並未出現具有統計顯著性的差異。

翻譯、校對也可能留下Claude浮水印

不過,Claude文字浮水印並非任何情況下都能有效辨識AI參與程度。

Anthropic指出,浮水印只會作用於Claude實際「選擇」的詞彙。這意味著,模型擁有較大選詞空間時,浮水印訊號較容易形成;反之,如果文字內容受到高度限制,能夠選擇的詞彙有限,浮水印效果也會受到影響。

翻譯就是其中一個值得注意的案例。

如果使用者提供中文文章,再要求Claude翻譯成英文,由於英文內容主要由Claude重新選詞生成,最終文字可能留下較明顯的浮水印訊號。

然而,文章原本的觀點與內容仍來自使用者,浮水印本身卻無法進一步區分文字究竟是由Claude從頭創作,還是僅協助使用者完成翻譯。

程式碼也存在類似問題。由於程式碼許多部分需要精確輸出,模型可自由選擇的空間相對有限,因此浮水印難以廣泛嵌入。不過,註解及變數命名等具有較大自由度的部分,仍可能留下浮水印。

Anthropic也指出,對短篇文字而言,浮水印同樣可能難以發揮作用。例如只有一、兩百字的電子郵件,由於可選擇的詞彙與表達方式有限,能夠累積的浮水印訊號可能不足。

純粹陳述事實的內容也存在類似限制。當特定事實只能搭配固定詞彙或表述方式時,模型沒有足夠的選詞空間植入明顯訊號。

校對則是另一個更複雜的情境。

如果使用者將一篇長文交給Claude修正錯字,模型只修改其中少數部分,整篇文章的大部分內容仍由使用者原先撰寫。此時,即使修改部分帶有浮水印,也難以據此判斷整篇文章究竟有多少內容由AI產生。

更重要的是,浮水印也無法回答Claude究竟參與到什麼程度。Anthropic承認,相關機制最多只能判斷Claude「可能參與過」某段文字,無法進一步確認究竟是從零生成,還是僅協助修改。

AI改寫恐成浮水印「橡皮擦」

2026年7月一項研究發現,AI文字浮水印可能容易受到後續改寫影響。

研究人員將59篇原本能被檢測出浮水印的文章交由AI釋義工具重新改寫,結果其中58篇在改寫後便無法再檢測出浮水印,比例達98.3%。

也就是說,只要讓另一個AI重新改寫文字,就可能打亂原本藏在Claude選詞規律中的浮水印訊號。

研究顯示,按照當時的服務價格,重新處理一篇約1000字文章的成本約4美分,使移除浮水印的門檻可能相當低。

此外,若Anthropic公開浮水印檢測API,也可能產生新的攻防問題。使用者可以利用API反覆測試修改後的文字,透過「修改→檢測→再修改」的方式,逐步降低浮水印訊號,直到文字不再被辨識。

因此,Anthropic雖已表示檢測API「即將推出」,但目前仍未公布具體技術細節。

浮水印無法證明文章由Claude獨立創作

Anthropic導入文字浮水印,也與AI生成內容標記的監管要求有關。相關討論涉及歐盟AI法規對AI生成內容標記的要求,而Anthropic的技術則試圖提供一種能夠從文字本身驗證AI參與的方式。

然而,文字能夠被追溯到Claude,並不等於可以確認整篇作品都是由Claude創作。

舉例來說,如果一名作者自行完成文章,再讓Claude進行翻譯、校對或大幅修改,浮水印可能證明Claude曾經參與文字處理,卻無法界定AI究竟參與多少,也無法單憑浮水印判斷原始內容的作者。

Anthropic也強調,浮水印不會改變作品的所有權,也不會改變法律責任的歸屬。

因此,Claude文字浮水印真正能回答的問題,主要是「這段文字是否可能曾經經過Claude處理」,而不是「這段文字究竟是誰的作品」。

隨著AI生成內容大量進入寫作、翻譯及編輯流程,如何區分「AI創作」、「AI協助」與「人類創作」,也將成為文字浮水印技術除了準確率之外,仍需面對的問題。


延伸閱讀

相關貼文

prev icon
next icon