原始來源kdnuggets.com
摘要
DeepSeek 发表开源模型 DeepSeek-V4.1-Flash,采因果编码器—解码器(CED)与混合专家(MoE)架构,搭配 CPA2/CSA2、FP4 KV 快取、Engram 记忆、SWA 有界重放、单次多跳快取(mHC)与 DSpark 推测解码。模型为 552B 参数 MoE,但在 prefill 阶段每 token 仅启用 8B、解码阶段启用 16B,KV 快取压缩至每 token 约 90 bytes。架构为 20 层编码器加 20 层解码器,并以 Engram 条件式记忆与单次处理降低算力、记忆体、储存与生成成本。代理导向基准表现突出,例如 DeepSWE 74.2、C…
重點整理
- 开发者可参考其非对称 prefill/decode 算力、KV 重用与稀疏注意力技巧,应用于自家推论引擎以降低营运成本。
- 对想在自有硬体部署代理模型的自建团队而言,效率优先的开源架构直接决定推论成本。
編輯說明
本頁是 Code & Chain 對公開來源的編輯摘要,可能使用 AI 輔助整理並經自動化流程發布。請以原始來源為準;內容不構成投資、法律或稅務建議。