發明ChatGPT的核心科學家閉關兩年後,反手給整個大模型行業敲了一錘喪鐘。前OpenAI核心研究員,ChatGPT、GPT-4論文重要貢獻者,現TypeSafe創始人Diogo Almeida公布了一種全新模型:Jev,在開發者圈迅速走紅。
Jev這個名字取自傑文斯悖論(Jevons paradox),同時寓意它在「每美元所能換取的智慧」指標上表現爆表。
與現有的LLM模型相比,Jev在系統任務上達到了類似的智慧水平,但速度和效率提高了兩個數量級,雖然Jev不具備字符串生成功能,但它針對結構化輸出進行了優化,並且不會產生幻覺。
Diogo Almeida稱團隊歷時兩年「秘密」研發,構建了一個完全專注於自動化的新堆棧:採用新的模型架構、並行採樣器以實現最高效率,以及一種新的模型訓練方法(RLCD)。
簡單來說就是,開發者可以把Jev看作是一個前沿智慧函數調用:輸入非結構化狀態,輸出類型化的概率決策。
在所有人的慣性思維裡,大模型必須會出口成章、會長篇大論,但Jev走向了完全相反的方向——它徹底閹割了自然語言生成能力,絕不吐半句廢話,只在毫秒級內給出最精準的概率分布與結構化判定。
Diogo Almeida介紹,相比現有的LLM模型,Jev速度快20-200倍,成本低40-400倍(輸出令牌免費),聽起來好得令人難以置信。
成本方面,LLM模型輸入token約0.20-10美元/百萬token,輸出開銷約為輸入token的5倍,而Jev輸入token為0.042美元/百萬token(即每十億token42美元),輸出token不計費(成本極低,無需計量)。
訓練優化方式方面,LLM模型普遍基於人類反饋的強化學習(RLHF)/可驗證獎勵強化學習(RLVR);Jev的訓練方法為校準決策強化學習(RLCD)。
速度方面,先進模型端到端響應時間:3-329秒,對人機互動尚可,但嵌入程式碼時會成為巨大性能瓶頸;Jev模型的端到端響應為70-500毫秒,針對系統一類任務,同等智慧水平下,速度提升40-200倍。
Jev模型可用於四類場景:
1、AI驅動業務流程/智慧條件判斷。結構化輸出直接接入普通軟體,充當模糊決策規則:分類、路由、打分、資訊提取、分支判斷;替代難以維護的手寫邏輯;程式碼約束模型輸出邊界,更容易構建穩定可靠系統。
2、大數據Map-Reduce處理:PB級數據提取特徵、挖掘洞察。
3、實時應用:100ms級別延遲,可用於對互動體驗要求嚴苛的產品。
4、全鏈路校驗:打分、評判、核驗、安全防護,以及檢測大模型提示詞越獄、推理鏈路、模型輸出的安全風險。
這種性能說出來可能沒人信,該團隊在技術報告中表示歡迎質疑者自行驗證。
官方對照Demo直觀展現了Jev模型與傳統LLM模型的核心差異:Jev會並行輸出全部概率結果,而不是按token自回歸逐個生成,幾乎秒出結果;普通LLM字符串文本生成雖然能力極強、通用性高,但代價高昂。
在這個示例中,該團隊選用的對照模型是默認配置的GPT-5.6 Terra,原因是它的平均智慧水平與目前的Jev最為接近。
此外,該團隊還設計了一套新的評測方式,用來衡量AI在程式碼內部的實際運行效果。
具體而言,預先設定一套正確的計算圖(以程式碼實現的「工作流」),並把業界規模最大、能力最強、成本最高的外部大模型給出的預測結果,作為參考概率基準。
所有模型運行完全相同的工作流,測試各個模型與頂尖模型集合的平均輸出之間的差距,選用的基準模型為當下的旗艦模型GPT-6 Astra與Claude Fable 5.1。
Jev的表現遠超預期,佔據帕累托最優前沿,性能差距接近兩個數量級,而依靠生成提示詞、把全部邏輯放在思維鏈(CoT)內部完成推理的模型,表現明顯劣於直接使用工作流本身。
另一大突出優勢在於幻覺與類型安全方面。代理場景下,發生幻覺導致工具調用出錯頂多帶來使用不便,但如果這套系統有延遲保障要求,或是調用鏈路深埋在多層依賴鏈之中,幻覺問題就會直接讓整套系統徹底不可用。
現有的大模型,最讓人抓馬的死穴是它有時候會在不知道答案時依然選擇自信地「胡說八道」,無論如今能力有多強,依然會有概率產生幻覺,同時還會出現類型錯誤。
而Jev模型輸出的每一個數值和選項,都帶著嚴格校準後的真實勝率與置信度,它很清楚自己知不知道,在數學層面上把幻覺徹底焊死降為0。
