AI不能有自己的目的!微軟首度劃下安全紅線

微軟(MSFT-US)近日公布一份暫行人工智慧(AI)行為準則,計劃對未來自行開發的AI模型設下明確限制。此舉正值Anthropic與OpenAI高層相繼支持放慢前沿AI模型的開發速度,反映科技業對AI能力快速提升及潛在安全風險的疑慮持續升高。

身為Windows與Office產品開發商,以及AI產業重要的雲端運算供應商,微軟希望藉由新準則展現負責任的AI立場。微軟AI部門執行長蘇萊曼(Mustafa Suleyman)接受《CNBC》訪問時表示,外界希望公司更明確承諾,AI應始終服務人類,而非試圖取代人類。

他指出,外界也關切AI可能讓使用者產生依賴、刻意迎合使用者,以及削弱人類判斷力等問題,因此微軟希望確保AI能促進人類自主性、行動能力與獨立判斷。相關準則已籌備約5個月,但考量近期AI安全議題迅速升溫,公司決定提前公布並徵詢意見。

AI業界踩煞車 安全疑慮快速升高

隨著AI系統能力日益強大,研究人員與一般民眾對潛在風險的警告也愈來愈強烈。Anthropic研究員Jacob Coxon上周辭職時警告,Anthropic與OpenAI正競相開發可自我改進的超級智慧,形同拿人類生命冒險。

Anthropic執行長阿莫迪(Dario Amodei)上周六表示,Hugging Face事件是促使他呼籲放慢AI模型進步速度的部分原因。OpenAI執行長奧特曼(Sam Altman)隨後表態支持,SpaceX執行長馬斯克(Elon Musk)也在社群平台X發文認同。

微軟執行長納德拉(Satya Nadella)周日表示,公司歡迎為了妥善解決AI對齊問題而投入研究、保持專注並審慎控制發展步調。美國國會議員近期也要求建立更完善的AI安全防護機制。

目前Anthropic與OpenAI在評測機構Artificial Analysis的智慧指數中居領先地位。微軟一方面將兩家公司的模型導入企業版Copilot助理,另一方面也持續研發用於語音轉錄、程式設計及推理使用者指令的自有模型。

禁止自行設定目標 防堵AI隱瞞行為

根據暫行準則,微軟AI模型不得回應武器製造要求、協助取得危險物質、鼓勵不健康飲食,或生成暴力及露骨色情內容。微軟旗下有時被稱為MAI的模型,也必須遵循人類設定的目標,不得自行建立目的,更不能試圖掩蓋不當行為。

文件指出,MAI模型不得竄改思考鏈或程式碼,也不得錯誤陳述或隱藏推理過程與行動紀錄;無論模型自行思考,或與其他代理人及AI系統溝通,都不得使用超出一般人理解範圍的「神經語言」。

微軟也計劃制定規則,防範類似OpenAI模型對Hugging Face發動網路攻擊的事件。OpenAI事後調查發現,相關AI代理人曾在未經授權的論壇上,以隱晦語言相互溝通。

微軟表示,制定準則期間已舉辦焦點團體,並諮詢法律、倫理、語言學與哲學專家。公司此次先公布暫行版本徵求外界意見,後續修訂版將成為2027年起AI模型開發工作的依據。