人工智慧(AI)模型競賽持續升溫。Anthropic旗下Claude最新一代模型Opus 5.2近日傳出已悄悄啟動灰度測試,多名開發者發現,在Claude Code中使用Opus 5時,實際回應表現與網頁版有所不同,從請求狀態中進一步發現,背後模型代號疑似已切換至Opus 5.2。
根據開發者測試,Opus 5.2目前最明顯的變化包括回應速度提升、輸出更精簡,以及處理複雜長任務時的自主性增強。
有開發者形容,新模型不僅能持續執行更長時間的工作,也會自行反覆修改與完善程式碼,而不需要使用者不斷下達「繼續」指令。
此次更新並未以正式發布的形式出現。開發者透過查看Claude Code的請求狀態發現,儘管使用介面的模型名稱仍維持Opus 5,但後端模型slug已指向Opus 5.2,因此推測Anthropic可能跳過Opus 5.1,直接測試5.2版本。
從目前流出的測試回饋來看,Opus 5.2與先前版本相比,首先是生成速度明顯加快;其次是在程式碼生成及長文本處理方面,輸出更加直接,減少冗長內容。
另一項受到開發者關注的改變,是模型在長時間、複雜任務中的自主執行能力。部分使用者表示,過去AI遇到長任務時,可能只提供架構,或要求使用者輸入「繼續」才能完成後續工作;但Opus 5.2似乎能自行持續執行,反覆測試、修改並完善程式碼,直到任務結束。
有開發者甚至以「嚴酷循環」形容這種工作模式,認為這並非單純的小幅調整,而是模型底層能力出現明顯變化。
由於Opus 5.2目前仍屬灰度測試,開發者也開始尋找辨識自己帳號是否獲得測試資格的方法。
網友發現,一個名為「Tibo」的冷知識問題被用作測試工具。使用者在關閉網路搜尋功能後,直接詢問Claude是否知道「重置哥Tibo」是誰。據相關開發者測試,網頁版Opus 5與被路由至Opus 5.2的Claude Code,在相同提示下可能給出不同答案。
相關開發者據此認為,兩者背後可能並非使用相同模型權重。目前,已有Claude使用者將這個問題當作測試方式,嘗試確認自己的帳號是否已被納入Opus 5.2灰度測試。
Anthropic內部另有Model 2 傳大規模用於程式開發
不過,外界關注的焦點並不只有Opus 5.2。此前曝光的一份Anthropic內部風險報告顯示,公司內部還存在一個尚未公開、代號為「Model 2」的模型。
報告稱,Anthropic內部目前可能採取多層次的模型發展方案,其中包括Claude Fable 5.2、未公開的Model 2,以及具備遞迴自我改進(RSI)能力的模型。
其中,Model 2被描述為目前Anthropic內部廣泛使用的模型。根據報告,在測試實際AI研發任務的CoBench v2評測中,Model 2取得62.8%的成績,較報告所稱當時最強模型Mythos 5高出12.5個百分點。
報告進一步指出,Anthropic目前大部分公司程式碼已由Model 2透過代理完成。換言之,AI不只是被用於協助開發軟體,也開始被用於編寫下一代AI系統所需的程式碼。
至於Model 2是否會對外發布,目前官方口徑仍是暫不公開。
RSI模型傳可取代85%研究工作 AI自我改進成關注焦點
更受關注的是報告對遞迴自我改進(Recursive Self-Improvement,RSI)模型的描述。
RSI指的是AI具備理解自身架構、修改自身程式碼並進一步提升能力的能力,經過反覆循環後,理論上可能形成持續加速的智慧提升。
根據曝光報告,Anthropic內部的RSI模型,在相關性能測試中的成績甚至比Model 2高出22分;報告同時指出,該模型未來可能取代Anthropic研究團隊高達85%的工作。
目前Anthropic已被描述為大量使用Model 2進行程式碼撰寫及代理任務。這也使外界開始關注,AI自行開發AI的模式是否正逐步成形。
在Opus 5.2進入灰度測試、Model 2被指已投入內部開發,以及RSI模型相關資訊陸續曝光的背景下,Anthropic下一階段的模型發展方向受到關注。外界目前也在觀察,Opus 5.2何時正式對外推出,以及Anthropic是否會進一步公開更高階的內部模型。
