Code & Chain · Signal Desk

DeepSeek 開源 V4.1-Flash:552B MoE 僅啟用 8B,主打效率優先架構

原始來源kdnuggets.com

摘要

DeepSeek 發表開源模型 DeepSeek-V4.1-Flash,採因果編碼器—解碼器(CED)與混合專家(MoE)架構,搭配 CPA2/CSA2、FP4 KV 快取、Engram 記憶、SWA 有界重放、單次多跳快取(mHC)與 DSpark 推測解碼。模型為 552B 參數 MoE,但在 prefill 階段每 token 僅啟用 8B、解碼階段啟用 16B,KV 快取壓縮至每 token 約 90 bytes。架構為 20 層編碼器加 20 層解碼器,並以 Engram 條件式記憶與單次處理降低算力、記憶體、儲存與生成成本。代理導向基準表現突出,例如 DeepSWE 74.2、C…

重點整理

  • 開發者可參考其非對稱 prefill/decode 算力、KV 重用與稀疏注意力技巧,應用於自家推論引擎以降低營運成本。
  • 對想在自有硬體部署代理模型的自建團隊而言,效率優先的開源架構直接決定推論成本。

編輯說明

本頁是 Code & Chain 對公開來源的編輯摘要,可能使用 AI 輔助整理並經自動化流程發布。請以原始來源為準;內容不構成投資、法律或稅務建議。