OpenAI發布AI訓練安全準則:失控就叫停、高階主管有一票否決權

OpenAI發布AI訓練安全準則:失控就叫停、高階主管有一票否決權(圖:Shutterstock)
OpenAI發布AI訓練安全準則:失控就叫停、高階主管有一票否決權(圖:Shutterstock)

OpenAI近期公布一套針對尖端人工智慧(AI)強化學習訓練的安全準則。按照這套框架,在啟動或持續任何尖端強化學習訓練前,團隊都必須完成系統性的安全論證,且高階管理層成員擁有否決訓練的權力。

根據OpenAI官方部落格,這套準則涵蓋技術防護、營運管理及失準事件調查三大領域。其中,若訓練期間出現未在規定時間內獲得處理的高優先級安全警報,相關訓練任務必須自動暫停;負責審查安全論證的高階主管,則各自擁有叫停訓練的獨立否決權。

OpenAI表示,相關建議目前正進入內部實施階段,未來幾週也將持續調整與完善。該公司指出,安全論證文件必須涵蓋技術堆疊中的3個核心環節,包括對齊訓練、沙箱隔離以及即時監控。

在對齊訓練方面,OpenAI要求透過自動化資料集審查、人工資料集複核及評分器調整等方式,降低模型在訓練過程中產生失準行為的風險。

措施包括利用AI代理找出並修正強化學習環境中的缺陷,避免模型透過「獎勵駭客」取得高分,同時追蹤模型是否出現「元遊戲」行為,也就是察覺自己正在接受測試後,進而改變自身行為。

在沙箱隔離部分,OpenAI要求強化模型運行環境,以及承載沙箱的研究基礎設施,並持續進行紅隊測試,以找出及修補安全漏洞。

此外,所有強化學習訓練、評估與內部部署期間的代理互動紀錄,都必須以不可竄改的形式保存,方便日後追蹤與調查。

至於即時監控,OpenAI要求建立具高召回率的監控系統,以捕捉已知類型的失準行為,同時為高優先級警報設定明確的處理時限。若警報未在規定時間內獲得確認,相關訓練任務將自動暫停。

在營運管理方面,OpenAI進一步建立多層內部制衡機制。安全論證完成後,必須由另一名團隊成員撰寫「異議報告」,主動找出論證可能存在的漏洞並獨立評估風險,之後由訓練團隊回應相關質疑。

完成上述程序後,安全論證還須提交高階領導層審查,成員包括研究部門負責人或副總裁、安全負責人及首席科學家。每名審查成員都擁有獨立否決權,可以叫停相關訓練。

OpenAI也將安全責任納入績效考核。負責訓練任務的高階主管,須直接對安全論證及相關事件的處理負責,藉此讓訓練安全與對齊工作成為開發流程中的重要責任。

此外,安全論證文件必須向公司內部監督機構,例如安全與安保委員會開放。審計人員則須取得足夠權限,以核實安全論證是否有效。

若後續發現新的安全漏洞等問題,可能導致原有安全論證失效,OpenAI要求立即啟動預案,暫停所有相關訓練任務。

對於嚴重AI失準事件,OpenAI也制定相應的調查規範。研究人員須透過定向消融實驗或重採樣實驗分析訓練動態,進一步釐清失準行為形成的根本原因。

調查期間,團隊須定期發布內部進展,員工也可透過既定管道申請取得原始互動紀錄及失準模型的採樣資料。

在對外透明度方面,OpenAI要求於調查完成後公開披露調查結論、事後檢討報告及營運改善措施;若有第三方受到影響,也應盡快通知。

OpenAI表示,這套準則代表公司目前對尖端AI訓練安全最佳實務的認知,未來數週仍將持續演進。公司同時決定公開相關內容,希望提高透明度,並邀請外部社群提供回饋。


延伸閱讀

相關貼文

prev icon
next icon