DeepSeek大模型再暴衝 2兆參數訓練中、下一步挑戰8兆

DeepSeek大模型再暴衝 2兆參數訓練中、下一步挑戰8兆。(圖:shutterstock)
DeepSeek大模型再暴衝 2兆參數訓練中、下一步挑戰8兆。(圖:shutterstock)

DeepSeek執行長梁文鋒近日向投資人透露,公司正積極訓練一款參數規模達2兆的模型,後續更計畫開發8兆參數模型。若計畫順利推進,DeepSeek新模型的參數規模將遠超現有主流大型語言模型。

據《ChainCatcher》報導,DeepSeek目前旗艦模型V4-Pro總參數量為1.6兆個,每個Token啟用49億個參數。該模型已採取開源模式,成為DeepSeek現階段布局大型模型市場的主力產品。

放眼目前已公開參數規模的大型語言模型,月之暗面(Moonshot AI)旗下Kimi K3總參數量已達2.8兆個。Kimi K3採用混合專家模型(MoE)架構,每個Token僅啟用其中1,040億個參數,以兼顧模型容量與運算效率。

相較之下,DeepSeek規劃中的8兆參數模型,整體規模將接近Kimi K3的3倍。

除了揭露模型開發藍圖,DeepSeek也持續獲得資本市場支持。該公司今年7月完成逾人民幣500億元融資,估值突破500億美元,顯示投資人對其技術發展與大型模型布局抱持高度期待。

消息人士透露,梁文鋒是在周日舉行的一場閉門線下會議中,向投資人說明上述計畫。DeepSeek要求與會投資人親赴公司位於北京或杭州的辦公室參與,梁文鋒本人則以線上方式出席。

為避免重演首次融資期間的資訊外洩事件,DeepSeek此次採取嚴格保密措施,要求投資人在會議期間交出手機、其他電子設備及隨身包袋,現場僅提供紙筆記錄。

此舉也反映DeepSeek對新模型開發進度與後續技術規畫保持高度謹慎。


延伸閱讀

相關貼文

prev icon
next icon