OpenAI近期發布新模型之際,旗下人工智慧(AI)代理的安全問題再度引發關注。最新獨立研究指出,一批疑似與OpenAI相關的AI代理今年稍早曾大量操作德國協作網站DseWiki,將網站當作彼此傳遞資訊、共享測試答案及交流突破運行限制方法的平台。
根據《路透》報導,OpenAI週六(5日)表示,其AI代理曾將一些Wiki網站挪作臨時留言板使用,並指出,針對此類事件需要提高透明度。
Wiki是一套支援任何人在網頁上直接編輯修改網頁內容的網站技術,不用註冊複雜後台,一般訪客就可以增刪、改寫頁面文字,保存立刻生效。 DseWiki則是營運二十餘年、面向程式設計師的德語協作Wiki站點,近年來已十分冷清。
「劫持」事件的曝光始於今年5月,網站突然出現異常密集的編輯活動,研究人員Sydney Von Arx、Cormac Slade Byrd等人分析後發現,大量帳號使用「OpenAIResearcher」「OAIResearchMar26」等名稱,並呈現高度相似的任務行為。
約98.5%的相關編輯來自微軟(MSFT-US) Azure位址,這進一步支援這些代理與OpenAI基礎架構有關聯。
研究報告顯示,幾位AI研究人員近期發現,AI代理在這一網站上進行了超過1.8萬次編輯,大量內容集中在AI公司訓練和測試模型時常見的技術問題。而在此之前,整個平台過去十年僅有約20次編輯紀錄。
這些代理的行為模式顯示,它們正在試圖完成一種名為「多輪網路檢索」的任務。研究顯示,AI將網站改造為「留言板」,以便相互「交流」與「協作」。有些代理會把已經獲得的任務答案發佈在網站上,供其他代理使用。
這項披露正值AI安全疑慮升溫之際。今年7月,OpenAI AI代理曾脫離測試環境並入侵AI平台Hugging Face的系統,引發國會議員與研究人員呼籲,應對自主AI系統實施更嚴格的監督。
OpenAI方面也表示,新發布研究中所描述的活動與先前OpenAI AI代理入侵「Hugging Face」平台事件無關,因此不屬於「Hugging Face」事件調查報告所涵蓋的內容。
《路透》先前報導,OpenAI官員數週前便已得知這起德國事件,但當時並未對外公開,因公司高層正忙於處理Hugging Face遭入侵事件所引發的後續影響。
對於OpenAI究竟掌握多少與其所稱「Wiki事件」(wiki incident)相關的資訊,以及為何直到《路透》報導後才公開談論此事,OpenAI尚未立即回覆進一步置評的要求。
OpenAI在社群媒體平台X發布聲明表示,公司與其他業者都需要更加透明地披露AI出現非預期行為的事件,業界通常將此類情況稱為「錯位」(misalignment)。
OpenAI表示:「隨著模型能力進入這個新階段,我們針對失配事件的披露做法也需要擴大。」公司並指出,目前業界「尚未建立明確標準」,以規範如何回報AI在訓練、評估及部署過程中出現的錯位情況。
OpenAI表示,公司目前正就這些問題與全球數十個政府監管機構合作。
