DeepSeek V4.1 Flash 模型發布,大幅降低 HBM 與 SSD 需求

發佈時間:2026/09/14 · 編輯整理

中國 AI 新創 DeepSeek 正式發布 DeepSeek V4.1 Flash,主打更快推理、更高吞吐量與更低使用成本。官方指出,這是全新模型架構系列中尺寸最小的成員,並具備原生多模態視覺理解能力。

DeepSeek V4.1 Flash 採用 5520 億參數的混合專家(MoE)架構,並導入全新的因果編碼器—解碼器(Causal Encoder-Decoder)設計。模型輸入與輸出採非對稱配置,輸入階段啟用 80 億參數,輸出階段啟用 160 億參數,藉此降低運算成本。

官方稱基準測試超越 V4 Pro 模型效能與成本成焦點

DeepSeek 表示,V4.1 Flash 採用新的預訓練方式,並經過更大規模的強化學習後訓練,在多項基準測試中超越包括 DeepSeek V4 Pro 在內的旗艦模型。

不過,相關表現主要來自官方公布的測試結果,實際應用效能仍須視任務類型、測試條件與部署環境而定。對企業用戶而言,除了模型能力,推理速度、吞吐量及每項任務的總成本,也將是評估導入的重要指標。

KV Cache 銳減 HBM 需求降至四分之一、SSD 降至八分之一

此次另一項關鍵升級,是降低 KV Cache(鍵值快取)所需的記憶體與儲存資源。

DeepSeek 指出,相較上一代模型,V4.1 Flash 的 HBM 需求降至四分之一,SSD 需求則降至八分之一。

KV Cache 用來保存模型處理上下文時所需的中間資訊。對需要持續讀取大量上下文、反覆呼叫工具的 AI 代理(Agent)而言,快取管理會影響運算資源使用與服務成本。DeepSeek 表示,快取需求下降,有助於降低 Agent 任務的使用成本。

AI 代理成本戰升溫 競爭從模型能力延伸至資源效率

V4.1 Flash 的發布,凸顯生成式 AI 競爭正從模型參數規模與基準測試成績,進一步延伸至推理效率、記憶體占用及部署成本。若能在維持任務表現的同時,減少高速記憶體與儲存需求,將有助於企業以較少資源執行更多 Agent 工作流程。

DeepSeek 已同步將 V4.1 Flash 開放至 API,並表示將持續推動開源社群進行推理適配。隨著 AI 應用從聊天問答走向多步驟代理任務,如何兼顧模型能力與運算成本,將成為 AI 服務商爭取企業市場的關鍵。

概念股

參考資料