谷歌Gemini 4 Pro疑偷跑 四大跑分全面領先Astra、Fable

谷歌Gemini 4 Pro疑偷跑 四大跑分全面領先Astra、Fable。(圖:shutterstock)
谷歌Gemini 4 Pro疑偷跑 四大跑分全面領先Astra、Fable。(圖:shutterstock)

Google(GOOGL-US)下一代旗艦模型Gemini 4 Pro疑似已「偷跑」上線。流出的基準測試顯示,該模型在程式編碼、AI代理、推理及電腦操作等多項能力上,均領先OpenAI Astra與Anthropic Fable 5.1,引發AI圈高度關注。

近日,AI模型競技場Arena出現一款名為「gemini-3.8-flash」的匿名模型,經多名開發者實測後,被認為極可能是Gemini 4 Pro的早期版本。

Google上一次大幅更新Gemini Pro系列,已是7個月前推出的Gemini 3.1 Pro。Google執行長皮查伊曾在Google I/O大會預告,Gemini 3.5 Pro將於6月上線,但最終未如期發布。

匿名模型疑為Gemini 4 Pro

本月初更有消息指出,Google已取消Gemini 3.5 Pro,原因是模型進步幅度有限,表現甚至不及Flash版本。相較之下,Gemini 4在預訓練階段的評估結果良好,後訓練工作也持續推進。

如今,Arena突然出現同樣名為「gemini-3.8-flash」的模型,因Google早在9月初就已發布Gemini 3.8 Flash,同名模型再度現身並不尋常。

多名開發者實際測試後發現,新模型的能力明顯高於既有版本,因此推測它可能是披著「gemini-3.8-flash」外衣的Gemini 4 Pro首個檢查點版本。

四大測試全面領先

從網路流傳的基準測試圖來看,Gemini 4 Pro在多個項目取得領先。於評估AI代理編碼能力的DeepSWE v1.1測試中,Gemini 4 Pro獲得約88%的成績,比Astra高出近2個百分點。

在衡量真實知識工作任務的GDPval-AA v2測試中,Gemini 4 Pro是唯一取得2,064分Elo評級的模型;Terminal-bench 2.1終端編碼測試則拿下95.3%,同樣排名第一。

至於OSWorld-2.0電腦操作能力測試,Gemini 4 Pro獲得86.8%,超越Astra與Fable 5.1。

若相關數據屬實,Gemini 4 Pro不僅在編碼、AI代理及電腦操作方面展現競爭力,價格也可能低於另外兩款模型。流傳資訊顯示,其每百萬Token輸入價格為2.25美元,輸出價格為11.25美元。

另有AI研究員進入模型後端後發現,Gemini 4 Pro可能具備1,000萬Token輸入上限、25.6萬Token輸出上限,以及跨對話永久記憶功能,並能在不使用API的情況下直接連網。

不過,上述規格目前仍未獲Google正式證實。

UI、3D與SVG能力躍進

除了跑分之外,Gemini 4 Pro的實際生成效果也引起討論。

有開發者僅花14分鐘,就利用該模型建立一個以素描、鉛筆及石墨質感為主題的創意展示網頁,並將「滾動即筆觸」轉化為互動效果,隨著頁面向下滑動,畫面線條也會逐漸加深。

另一項網頁設計測試則融合賽博龐克與復古未來主義風格,首屏加入3D網格、資料儀表板及可互動的3D模型,顯示其在介面設計與視覺呈現上的能力有所提升。

在SVG及3D生成測試中,Gemini 4 Pro同樣展現進步。以「鵜鶘騎自行車」為例,模型一次完成配色、日夜切換、車燈、解剖標註與踏頻控制等多項要求。開發者指出,新模型生成速度快,對複雜指令的理解也更準確。

Gemini 4 Pro還在10分鐘內完成空中巴士H145直升機的3D模型,並生成像素風3D寶塔。另一項3D飛行模擬測試中,其畫面效果也明顯優於既有的Gemini 3.8 Flash,進一步加深外界對兩者並非同一模型的推測。

可直接生成互動遊戲

遊戲開發也是此次實測的重點。Gemini 4 Pro被指能直接產生具完整互動邏輯的小型遊戲,包括從頁面架構到各模組設計的《Minecraft》風格作品,以及3D卡丁車競速遊戲,完成度可與先前公布的Astra測試結果相比。

這些成果顯示,Gemini 4 Pro的能力已不只侷限於文字問答與程式碼生成,而是進一步延伸至使用者介面、互動網頁、3D模型及遊戲開發等多模態應用。

Google押注遞迴式自我改進

Gemini 4 Pro能力快速提升的背後,也被外界與RSI(遞迴式自我改進)連結。Google DeepMind首席策略長Jasjeet Sekhon上月在柏克萊一場活動中表示,RSI已成為AI巨額投資邏輯的重要一環。若AI能持續參與並改善自身能力,模型進步速度可能進一步加快。

近期網路更流傳,Gemini 4之所以能提前完成預訓練,是因Google DeepMind已在訓練過程中建立RSI閉環。Google日前公開的Dream-RSI研究,也聚焦於讓AI代理在探索過程中持續改善搜尋策略,並從經驗中優化下一輪探索。

不過,Gemini 4 Pro目前的身分、測試成績、價格及技術規格,仍主要來自外流資料與開發者實測,Google尚未正式公布。

面對OpenAI Astra及Anthropic Fable 5.1,這款匿名模型是否真是Google的新一代旗艦,以及最終版本能否維持現有表現,仍有待官方揭曉。


延伸閱讀

相關貼文

prev icon
next icon