DeepSeek-V3.2-Exp模型發布 引入稀疏架構提升推理效率

【太平洋科技快訊】9 月 29 日消息,深度求索公司正式發布 deepseek-v3.2-exp 模型。據官方消息,這是一個實驗性(experimental)版本,旨在通過技術創新提升模型在處理長文本時的效率表現。

據了解,v3.2-exp 模型在 v3.1-terminus 的基礎上引入了稀疏 deepseek sparse attention 架構。該架構專門針對長文本的訓練和推理效率進行了探索性優化,能夠有效降低計算資源消耗並提升模型推理效率。

雖然該模型已在公開評測集上完成有效性驗證,但仍需在用戶真實使用場景中進行更廣泛、大規模的測試。為方便用戶進行對比測試,官方為 v3.1-terminus 臨時保留了額外api訪問介面,使得研究人員和開發者能夠同時訪問新舊兩個版本,便於在實際應用中比較性能差異。