原始來源kdnuggets.com
摘要
DeepSeek 發表開源模型 DeepSeek-V4.1-Flash,採因果編碼器—解碼器(CED)與混合專家(MoE)架構,搭配 CPA2/CSA2、FP4 KV 快取、Engram 記憶、SWA 有界重放、單次多跳快取(mHC)與 DSpark 推測解碼。模型為 552B 參數 MoE,但在 prefill 階段每 token 僅啟用 8B、解碼階段啟用 16B,KV 快取壓縮至每 token 約 90 bytes。架構為 20 層編碼器加 20 層解碼器,並以 Engram 條件式記憶與單次處理降低算力、記憶體、儲存與生成成本。代理導向基準表現突出,例如 DeepSWE 74.2、C…
重點整理
- 開發者可參考其非對稱 prefill/decode 算力、KV 重用與稀疏注意力技巧,應用於自家推論引擎以降低營運成本。
- 對想在自有硬體部署代理模型的自建團隊而言,效率優先的開源架構直接決定推論成本。
編輯說明
本頁是 Code & Chain 對公開來源的編輯摘要,可能使用 AI 輔助整理並經自動化流程發布。請以原始來源為準;內容不構成投資、法律或稅務建議。