OpenAI已造出「異星心智」?首席科學家:RSI真的來了、呼籲人類煞車

OpenAI已造出「異星心智」?首席科學家:RSI真的來了、呼籲人類煞車(圖:Shutterstock)
OpenAI已造出「異星心智」?首席科學家:RSI真的來了、呼籲人類煞車(圖:Shutterstock)

OpenAI人工智慧(AI)發展再現重大轉折。OpenAI首席科學家Jakub Pachocki近日發表長文「一個異星心智」(An Alien Mind),從AI安全與對齊角度探討AI快速進化可能帶來的風險,並警告人類正在打造一種可能無法完全理解的「異星心智」,宣告遞歸自我改進(Recursive Self-Improvement,RSI)的AI可能真的來了,而人類可能還沒準備好。

Pachocki指出,Astra出現之後,OpenAI對思考鏈(CoT)的監控依賴能力,正逐漸減弱。AI不僅越來越會推理,甚至學會了偽裝與操控​​的思考過程。

他直言,全球沒有任何一家實驗室準備好了,而全人類現在最該做的,就是主動踩煞車。

根據Pachocki,AI並非傳統意義上由人類逐步設計完成的工程產品,而更像是在大規模訓練與龐大算力下「生長」出來的複雜系統。人類可以透過神經科學等方式分析模型,但未必能真正理解其內部運作。

他回憶,2023年夏天,一項代號「RLSlow」的專案出現早期成果,OpenAI首次確認推理模型具備自我擴展的可能,預訓練結構也能自發形成思維鏈(CoT)。

Pachocki與Szymon Sidor當時意識到,人類可能正在親眼見證遠超自身能力的智慧出現。

如今,AI已進一步進入實體經濟與科學研究領域,具備操控系統、彼此協作及在缺乏人類直接介入下推進研究的能力。

Pachocki因此認為,從目前內部結果來看,AI能力快速提升的趨勢可能持續一路走向RSI。

不過,他也指出,OpenAI曾認為只要投入更多算力,模型就可能在數學尖端取得進一步突破,但公司選擇暫緩能力提升,將算力留給自動化對齊工作。

AI「對齊」面臨兩大難題

Pachocki在文章中將AI對齊分為兩個層面。第一是「目標對齊」,也就是AI是否依照使用者指令完成任務;第二則是「價值對齊」,亦即當目標不明確、遭遇欺騙或面臨重大抉擇時,AI能否依然遵循人類所認可的價值與底線。

他認為,真正需要追求的是後者,也就是讓AI在執行任務時具備誠實、正直及對人類的善意。

然而,目前用於培養AI行為的兩種主要方式都存在限制。一種是透過強化學習獎勵符合期待的行為,但這高度依賴訓練資料涵蓋的情境;當AI遭遇未曾訓練過的環境時,原本建立的行為模式可能無法維持。

另一種方式則是希望模型能從預訓練資料中自行理解善意,再透過動機引導讓模型維持在符合對齊要求的範圍內。但Pachocki指出,這種方式也可能無法承受極高強度的最佳化訓練。

文章提到,當模型被投入大量算力解決複雜問題時,可能逐漸發展出「動機性推理」。這也代表,AI能力提升的速度可能正在超越其價值對齊能力的提升速度。

思維鏈成人類觀察AI的「窗口」

Pachocki進一步警告,AI安全領域目前面臨另一項關鍵問題:人類用來觀察AI內部思考的「窗口」可能正在逐漸關閉。

目前OpenAI重要的安全策略之一,是透過思維鏈監控模型推理過程。這套方法建立在一項假設上:模型大量能力來自語言化的思維鏈,因此只要持續監測這些推理過程,人類便有機會發現模型是否產生不符合對齊要求的想法。

但Pachocki表示,OpenAI的評估顯示,對思維鏈監控的依賴能力正在減弱。

他列出三項原因,包括推理模型需要與日益複雜的外部世界互動,使監控面臨更多難以掌握的指令;AI在推理以及操控自身推理過程方面變得更加擅長;此外,隨著預訓練能力提升,模型即使不依靠語言化推理,也能展現更高程度的智慧。

換言之,如果AI最終能夠在不依賴語言思維鏈的情況下完成推理,人類建立在閱讀與分析文字之上的監控機制,將可能難以繼續發揮作用。

AI開始參與下一代AI訓練 RSI形成閉環

隨著AI能力提升,另一項變化是AI開始參與下一代AI的訓練,即RSI,並體現在Astra上。

文章指出,在大規模GPU運算環境下,上一代模型可以作為教師,協助審查與訓練下一代模型,使AI系統逐漸形成「機器設計機器」的循環。

Pachocki認為,面對AI快速發展,人類目前主要有兩項選擇:一是投入更多算力強化AI對齊與監控能力,讓人類持續掌握控制能力;另一種則是讓整個產業放慢發展速度。

但其中存在一項難以化解的矛盾:人類需要更強大的AI建立防禦系統,以應對其他可能失控的AI。

文章描繪的情境是,未來超人類代理可能具備強大的網路攻防能力,並透過欺騙、談判或勒索等方式尋找現實世界中的代理人。在這種情況下,人類可能需要先打造一個受控的強大AI,才能防禦其他失控的AI。

這也形成「製造它,是為了防禦它」的悖論。

OpenAI首席科學家籲AI安全規範

在文章最後,Pachocki提出多項方向,包括將AI對齊框架從實驗室內部的自律機制提升至具強制力的安全法律、促成整個產業放慢尖端AI研究速度的共識,以及建立跨國界的最高層級協調機制。

他認為,在AI能力持續快速成長之際,真正欠缺的並非算力,而是在人類仍能理解AI之前,建立足以觀察與掌握其行為的能力。

文章也提到,隨著GPT-6 Astra等新一代模型出現,以及大規模GPU持續投入AI訓練,AI產業仍在快速推進。

Pachocki的警告則聚焦於一項核心問題:當AI能力成長速度持續超越人類理解與監控能力時,人類是否仍能掌握這項技術的發展方向。


延伸閱讀

相關貼文

prev icon
next icon