Code & Chain · Signal Desk

DeepSeek 開源 V4-Flash-0731 模型,支援百萬上下文

原始來源DataNorth AI

摘要

DeepSeek 於 7 月 31 日發布 V4-Flash-0731,這是一個 284B 參數的混合專家(MoE)模型,每次啟用 13B 參數,支援 1,000,000 token 的上下文視窗。權重以 MIT 許可證發布於 Hugging Face,API 提供公開測試版,定價為每 1M 輸入 token 0.14 美元,每 1M 輸出 token 0.28 美元。此版本是重新訓練後的更新,重點改善編碼、代理、推理與工具使用能力,基準測試宣稱在所有已發表的代理基準上超越更大的 V4-Pro(預覽版)。自架時記憶體需求約 110 GB(vLLM 部署),支援動態 GS/UFG2/8-bit…

重點整理

  • 開發者能使用百萬上下文與低成本的模型進行大型程式碼處理與代理開發,降低 AI 應用成本。
  • 開發者可獲得一個高效、開放的編碼與代理模型,以低成本開發 AI 應用。

編輯說明

本頁是 Code & Chain 對公開來源的編輯摘要,可能使用 AI 輔助整理並經自動化流程發布。請以原始來源為準;內容不構成投資、法律或稅務建議。