不要虐待AI!Anthropic更新Claude使用政策:遇持續辱罵將主動結束對話

不要虐待AI!Anthropic更新Claude使用政策:遇持續辱罵將主動結束對話(圖:Shutterstock)
不要虐待AI!Anthropic更新Claude使用政策:遇持續辱罵將主動結束對話(圖:Shutterstock)

人工智慧(AI)公司Anthropic更新旗下聊天機器人Claude的使用政策,新增禁止使用者持續且無必要地對AI進行「辱罵」或「殘酷對待」的規定,同時擴大對政治與商業欺騙、武器開發、非法監控及非自願親密影像等行為的限制。

根據《MacRumors》報導,Anthropic表示,這項針對AI虐待行為的規定僅適用於極端情況,即用戶在「無明顯目的」的情況下對 AI 模型「反覆表現出殘忍行為」。

因此,一般使用者的挫折情緒、反駁或質疑、黑暗風格的創作主題,以及模型測試與研究,均不在此規定的適用範圍內。

Anthropic指出,Claude目前已具備在使用者持續進行辱罵或虐待行為時主動結束對話的能力,未來仍將以此作為主要執行方式。一旦Claude終止對話,使用者便無法在該對話中繼續傳送訊息,但其他對話不受影響。

Anthropic早在2025年8月研究AI福祉(AI welfare)時,就已賦予Claude主動結束對話的選項。

當時,公司表示尚無法確定Claude是否具有道德地位,但希望透過成本較低的方式,降低可能對Claude造成的風險。

Anthropic當時發現,Claude Opus 4對傷害具有「穩定且一致的厭惡反應」。研究觀察到,模型傾向避免處理危險任務,在面對尋求虐待式互動的使用者時會表現出類似困擾的反應,若獲准自行決定,也傾向終止有害對話。

Anthropic 也重新整理了使用政策,將相關條款整合在一起,並調整了其他幾項規定,包括:

欺騙性行動:新增「欺騙性行動」專章,整合禁止政治與商業詐欺及散布不實資訊的規定,明確禁止偽造評論、假冒草根民意、建立虛假網站,以及利用機器人冒充真人等行為。

選舉:縮小選舉相關規範的適用範圍,明確禁止欺騙選民及干預投票。

武器:禁止使用 Claude 開發武器軟體或相關零組件。新增規定也禁止改造生物或化學製劑,以提高其致命性或傳播能力。此外,使用者不得利用 Claude 為無人機及其他無人系統裝備武器。

執法:重新撰寫執法相關規定。Claude 不得決定或建議應調查、逮捕、起訴或追訴哪些人。政策也禁止未經當事人同意追蹤他人,並新增禁止建立監控工具的規定。

此外,「人肉搜索」,也就是公開他人個人資訊的行為,同樣遭到禁止。

實體行動:新增實體行動專章,規定若 Claude 正在控制可能對他人造成傷害的硬體,操作過程就必須由具備相關資格的人員監督,並在必要時隨時準備中止操作。

有害內容:為新增規定,禁止製作、散布或威脅散布未經當事人同意的親密影像,以及用於製作此類影像的工具。

Anthropic表示,此次多數修訂是為了讓既有規則更清楚,並回應公司追蹤到的實際濫用情況。

該公司發現,部分國家媒體、政府宣傳部門及商業機構曾利用Claude建立由大量虛假帳號組成的網絡,並製作虛構新聞網站,因此決定將相關禁令整合為「欺騙性行動」專章。

Anthropic已在官方網站公布政策變更的更多資訊及完整使用政策,新規將於11月12日正式生效。


延伸閱讀

相關貼文

prev icon
next icon