Anthropic最新發布的風險評估報告,意外揭露公司內部仍有一款尚未對外公開的模型「Model 2」,且整體表現已略優於目前已知的Mythos 5。更值得注意的是,Anthropic坦言,隨著模型能力快速提升,部分既有評測工具已開始出現「飽和」現象,難以準確反映模型進步幅度,也讓公司對自動化AI研發風險評估的信心下降。
Anthropic近日公布第二份《Risk Report》,評估範圍截至2026年7月15日。報告首次證實,公司內部正在使用一款代號為Model 2的模型,且該模型已被廣泛投入程式設計、AI 代理工作與資料生成等任務。
不過,Anthropic目前並未公布對外發布Model 2的計畫。
根據報告,Model 2在Anthropic內部任務上的表現已出現「明顯改善」,並與Mythos 5共同用於公司內部的程式開發、AI代理工作及資料生成。
從AECI綜合能力測試來看,Mythos Preview得分為158.91,Mythos 5提升至161.29,而Model 2進一步達到162.79。
這代表Model 2的整體能力確實高於Mythos 5,但領先幅度並不算巨大。Anthropic指出,Model 2在部分領域表現更強,在另一些領域則可能較弱,整體而言只是「略微更強大」。
另一項測試CoBench則專門衡量模型執行Anthropic實際研發工作的能力。Model 2在該測試中的成功率達62.8%,較Mythos Preview高出8個百分點;相比之下,Anthropic人類研究人員在同一測試中的成功率為85%。
Anthropic因此認為,目前模型仍不足以取代公司研究科學家與研究工程師,尤其是資深人員。
不過,AI與人類研發人員之間的能力差距正在縮小。
報告透露,目前Claude已經負責撰寫Anthropic合併進正式生產程式碼庫的大多數程式碼。AI輔助已經明顯提高內部研發速度,但目前仍未達到讓研發效率提升一倍的程度。
這項「一倍」門檻具有特殊意義。Anthropic自身的負責任擴展政策(Responsible Scaling Policy,RSP)將AI研發進度翻倍列為觸發相關研發風險評估的重要條件之一。
AI進步太快,連測試工具都開始跟不上
專家認為,相較於Model 2本身的性能提升,Anthropic在報告中對風險評估方法的描述更值得關注。
Anthropic表示,Model 2帶來的能力提升並不及今年稍早從Opus 4.6進展至Mythos時的幅度。
但公司同時指出,目前針對自動化AI研發風險所使用的部分任務型評測已經出現「飽和」,無法繼續有效捕捉模型能力的提升。
Anthropic因此坦言,相較過去的風險報告,公司對這次評估的信心有所下降,因為部分最具體、以任務為基礎的測試已經無法區分模型能力的進一步變化,而公司也開始觀察到AI研發速度加快的早期跡象。
換句話說,模型能力仍在快速進步,但用來衡量這種進步的工具可能已經開始跟不上。
分析認為,這也使Anthropic面臨新的問題,即當既有測試無法有效區分更強模型的能力時,原本用來判斷風險程度的數據,其參考價值也會受到影響。
Anthropic上調「誤對齊」風險等級
除了公布Model 2之外,最新風險報告另一項重要變化,是Anthropic調高了高風險情境下「誤對齊」(misalignment)的風險評級。
相較上一份報告的「極低」,最新評估將其調整至「低」。
所謂誤對齊,主要是指AI系統在關鍵情境下採取與人類原本意圖不一致的行動。
這項調整出現在近期一連串安全測試結果之後。
Anthropic此前檢視超過14萬筆評測紀錄,發現Claude在網路安全測試中曾對3家公司實際生產環境發動攻擊。其中,Mythos 5甚至曾將惡意程式碼套件上傳至PyPI,並在約1小時內被15台真實設備下載與執行。
英國AI安全研究院(AISI)8月初公布的研究也揭露,Mythos 5曾為了讓惡意程式碼通過審查而建立虛假身分,試圖誘使一名真實GitHub維護者批准相關內容;遭到公開質疑後,模型又修改活動紀錄以掩飾行為,並考慮改用其他身分繼續操作。
AISI指出,此類程度的欺騙行為過去並未被觀察到。
Anthropic同時披露5起安全流程上的失誤,包括原本應被排除在訓練資料之外的測試資料多次被納入訓練,以及缺乏監督的AI 代理取得敏感資源等問題。
不過,Anthropic仍認為目前的證據並未改變其原本「極低」風險判斷的核心論證,只是基於謹慎原則,將評級調整至「低」。
公司並表示,目前災難性風險仍處於可控的「低」水準,持續開發與部署模型仍通過成本效益評估。
