鉅亨網編輯林羿君 綜合報導
DeepSeek執行長梁文鋒近日向投資人透露,公司正積極訓練一款參數規模達2兆的模型,後續更計畫開發8兆參數模型。若計畫順利推進,DeepSeek新模型的參數規模將遠超現有主流大型語言模型。
據《ChainCatcher》報導,DeepSeek目前旗艦模型V4-Pro總參數量為1.6兆個,每個Token啟用49億個參數。該模型已採取開源模式,成為DeepSeek現階段布局大型模型市場的主力產品。
放眼目前已公開參數規模的大型語言模型,月之暗面(Moonshot AI)旗下Kimi K3總參數量已達2.8兆個。Kimi K3採用混合專家模型(MoE)架構,每個Token僅啟用其中1,040億個參數,以兼顧模型容量與運算效率。
相較之下,DeepSeek規劃中的8兆參數模型,整體規模將接近Kimi K3的3倍。
除了揭露模型開發藍圖,DeepSeek也持續獲得資本市場支持。該公司今年7月完成逾人民幣500億元融資,估值突破500億美元,顯示投資人對其技術發展與大型模型布局抱持高度期待。
消息人士透露,梁文鋒是在周日舉行的一場閉門線下會議中,向投資人說明上述計畫。DeepSeek要求與會投資人親赴公司位於北京或杭州的辦公室參與,梁文鋒本人則以線上方式出席。
為避免重演首次融資期間的資訊外洩事件,DeepSeek此次採取嚴格保密措施,要求投資人在會議期間交出手機、其他電子設備及隨身包袋,現場僅提供紙筆記錄。
此舉也反映DeepSeek對新模型開發進度與後續技術規畫保持高度謹慎。
上一篇
下一篇
