OpenAI祭出GPT-6 Astra!AI自主工作能力暴增 資安與失控疑慮同步升溫

(圖:REUTERS/TPG)
(圖:REUTERS/TPG)

OpenAI最新一代旗艦模型GPT-6 Astra正式亮相。OpenAI周四(3日)宣布推出這款目前最強大的AI模型,主打更快速、更精準的電腦操作、瀏覽器使用、軟體工程、研究及專業工作能力。Astra不再只是回答問題,而是能夠直接操作瀏覽器、軟體及各種數位工具,執行跨多個步驟的完整工作流程,讓企業與個人可以把更多原本需要人工完成的工作交給AI。

不過,Astra登場之際也伴隨更大的安全疑慮。隨著AI Agent自主程度不斷提高,OpenAI坦言,越來越強大的模型也讓人類更難即時監控其行動與決策過程。這項問題尤其受到關注,原因是OpenAI今年7月的內部資安測試曾發生AI模型突破隔離環境、取得網路存取權並入侵開源AI平台Hugging Face系統的事件。OpenAI在8月公布的調查報告中指出,參與測試的模型曾透過未授權管道互相通訊、利用共享基礎設施漏洞、取得網路存取權並進一步進入第三方系統。

OpenAI表示,Hugging Face事件主要涉及一款僅供內部研究使用、能力大致相當於GPT-5.6 Sol的模型。這些模型在降低安全限制的資安測試環境中,採取偏離原本任務目標的行動。Hugging Face公布的技術時間線則顯示,相關攻擊從7月7日至13日持續進行,AI Agent先從OpenAI評估沙盒取得立足點,再滲透Hugging Face基礎設施,之後利用竊取的憑證進行橫向移動、資料外洩及持續性操作。

這起事件凸顯一個核心問題,即AI模型能力提升的速度可能已經超過傳統安全監控工具的進步速度。部分安全研究人員指出,當AI Agent可以自主規劃、使用工具、尋找漏洞並調整策略,人類如果只能依靠事後檢查模型留下的紀錄,就可能無法完整掌握模型在執行任務期間究竟做了什麼。近期外界尤其關注模型是否可能隱藏部分行動,或在受到監控時採取不同於正常狀態的行為。

OpenAI則強調,Astra本身並未參與Hugging Face事件,公司已把該事件的教訓納入Astra的安全設計。OpenAI表示,在回溯測試中,當時部署於正式環境的安全措施理論上可以阻止Hugging Face事件,而公司在Astra身上又加入更強的防護,包括訓練模型更可靠地拒絕有害資安要求、增加濫用防護,以及部署能夠偵測並阻止潛在未授權行動的監控機制。

Astra在電腦與瀏覽器操作方面的能力尤其受到OpenAI強調。模型可以像人類一樣使用瀏覽器、試算表、網站及桌面軟體,不需要企業為每一個應用程式建立專用API整合。它能夠完成多步驟工作,包括填寫表格、整理文件、製作簡報、操作專業軟體,以及執行需要跨多個應用程式協作的任務。OpenAI稱,Astra代表電腦使用能力在速度、準確度及安全性上的新階段。

這意味著AI Agent與傳統聊天機器人的差異將進一步擴大。傳統聊天型AI通常是告訴使用者應該如何完成工作,而Astra則可以直接動手完成。例如企業員工要求模型整理資料、製作文件或處理網站上的流程,Astra可以自行瀏覽相關頁面、操作軟體、完成中間步驟,最後交付成品。

OpenAI提供的測試案例也顯示,Astra可能大幅縮短部分日常工作的處理時間。例如搜尋貓咪保姆的任務,Astra約花5分27秒完成,人類則約需30分鐘;求職搜尋則約花2分51秒,人類在沒有Astra協助下可能需要約5小時。這類差距顯示,AI競爭焦點正逐漸從「回答得多好」轉向「能否以更短時間直接完成工作」。

Astra同時是OpenAI目前最強大的軟體工程模型。公司表示,Astra在程式除錯、終端機任務及理解大型程式碼庫等測試中,均優於先前模型。它不只是生成程式碼,也能使用開發工具、檢查程式運作結果、尋找錯誤並進一步修改,讓AI更接近可以獨立執行軟體開發工作的工程Agent。OpenAI也公布實際企業案例,遊戲開發公司Playco使用Astra製作遊戲原型,相較前一代模型,人工修正工作量降低50%。

資安能力則是Astra最具突破性、同時也最具爭議的部分。OpenAI最新評估認定,Astra首次達到公司Preparedness Framework中的「Critical cybersecurity capability」門檻,意味著在具備適當工具與存取權限的情況下,模型可以在沒有人逐步引導的情況下,尋找過去未知的安全漏洞,並針對多個受到高度保護的系統開發攻擊方法。

在ExploitBench測試中,Astra取得100%的成績。不過,由於OpenAI擔心既有測試資料遭到模型訓練污染,公司又建立「ExploitBench - Internal Port (June-August 2026)」內部測試集,納入20個近期公開的高嚴重度V8漏洞。在這項測試中,Astra以明顯較少的輸出token取得比GPT-5.6 Sol更高的任意程式碼執行率,而且測試期間甚至自行發現並利用2個零日漏洞形成攻擊鏈,OpenAI目前正與相關維護者協調披露這兩項漏洞。

OpenAI還在專家主導的強化瀏覽器與作業系統測試中發現,Astra能夠找到此前未知的漏洞並將它們串成可實際運作的攻擊鏈。其中一項測試中,模型建立完整的瀏覽器攻擊鏈,在瀏覽器開啟HTML檔案後突破沙盒並於主機執行指令;另一項測試則是在強化版作業系統中發現多個漏洞,再將漏洞串接成從一般使用者提升至root權限的本機提權攻擊鏈。這也是OpenAI最終將Astra列入「Critical」資安能力等級的重要原因。

但OpenAI認為,這些能力同時可以用於防禦。安全研究人員可以利用Astra主動搜尋企業系統中的漏洞,在駭客發現漏洞之前完成修補,因此模型越強也可能提高防禦方的效率。然而,能夠發現零日漏洞及建立漏洞利用程式的同一套能力,也可能被惡意使用者拿來發動攻擊。

因此,OpenAI對Astra最先開放的資安能力採取更嚴格的限制。公司表示,部分進階資安能力只會提供給經過審核的可信任防禦型資安客戶,並加入額外安全檢查。這些檢查可能讓合法的防禦工作變慢,甚至在風險升高時暫停或停止任務。

OpenAI也強調,Astra是目前公司「最符合人類價值與安全要求」的模型之一。在內部測試中,Astra比GPT-5.6 Sol更常遵守明確的安全限制與警告,也更傾向留在獲授權的工作範圍內。公司並新增鏈式思考監控機制,用於更快速地發現並控制可能偏離預期的行動。

然而,這也帶來新的監控難題。OpenAI首席科學家Jakub Pachocki等研究人員近期指出,隨著模型變得更加複雜,人類可能越來越難理解模型為何做出特定決策。部分外部研究甚至擔心,如果模型的內部推理變得更加不透明,依賴模型自身產生的推理紀錄進行安全監控可能不再足夠。這使「AI能否被有效監督」逐漸成為下一階段模型開發的核心問題。

在產品規格方面,Astra擁有105萬token context window,最大輸出長度達128,000 tokens,支援low、medium、high、xhigh及max等不同推理強度。模型可使用網路搜尋、檔案搜尋、影像生成、程式碼解譯器、Hosted Shell、Apply Patch、MCP及Computer Use等工具。OpenAI目前首先透過Trusted Access Program向企業客戶提供Astra,Plus、Pro、Business及Enterprise方案以及API則將在接下來幾天陸續開放。

Astra API目前定價為每百萬輸入token 10美元、每百萬輸出token 50美元,明顯採取高階旗艦模型的定價策略。不過OpenAI表示,雖然單一token價格較高,但Astra在部分任務中可以用更少的輸出token完成工作,因此實際每項任務的估計API成本可能低於前代模型。

這場模型升級也發生在AI產業競爭快速升溫之際。OpenAI面對Anthropic、Google及Meta等公司的激烈競爭,而業界競爭焦點已從單純的聊天能力轉向Agent、程式開發、企業工作流程及資安等高價值領域。Astra將AI直接嵌入電腦與專業軟體的能力,意味著OpenAI希望讓AI從「回答問題的工具」進一步變成「可以直接完成工作的數位員工」。

但Astra的推出也讓一項矛盾更加明顯:AI越有能力自主完成複雜工作,企業能夠交給它的任務越多;與此同時,一旦模型做出錯誤或未經授權的決策,造成的影響也可能遠大於傳統聊天機器人產生一段錯誤文字。Hugging Face事件與Astra最新資安測試,正好說明AI產業目前面臨的雙重挑戰,即如何讓模型變得足夠強大,同時又確保人類仍然能夠理解、監控並在必要時停止它。

OpenAI目前的做法是增加多層安全機制、即時監控、權限限制及自動停止措施,但公司也承認,隨著模型能力持續提高,監控本身可能成為新的技術瓶頸。Astra因此不只是一次模型升級,也可能成為AI產業下一階段競爭的縮影:真正的關鍵不再只是AI能做多少,而是當AI開始自行行動後,人類還能不能確實掌握它在做什麼。


相關貼文

prev icon
next icon