Code & Chain · Signal Desk

Meta 發布 Muse Spark 1.3,代理能力強化,部分基準超越 GPT-5.6 Sol 與 Opus 5

原始來源OfficeChai補充:Let's Data Science

摘要

Meta 於 9 月 2 日發布 Muse Spark 1.3,主打代理任務與程式碼能力提升,透過 Muse Code 與 Meta Model API 提供。在 DeepSWE v1.1 得分 75.4,Terminal-Bench 2.1 達 88.8,與 GPT-5.6 Sol 持平並超越 Opus 5;OSWorld 2.0 得分 66.9 亦領先 GPT-5.6 Sol。模型強調可管理長程多步驟任務、提問澄清、確認重要動作,並提供頻繁進度更新或背景執行模式。最大推理模式因安全測試尚未公開。Meta 預告開放權重版本即將推出。

重點整理

  • 採用 Muse Spark 1.3 的開發者可受惠於其長程任務處理與工具使用能力,企業需注意最大推理模式尚未開放。
  • 開發者可比較 Muse Spark 1.3 與競爭模型在程式碼與代理任務的表現,作為工具選擇參考。

編輯說明

本頁是 Code & Chain 對公開來源的編輯摘要,可能使用 AI 輔助整理並經自動化流程發布。請以原始來源為準;內容不構成投資、法律或稅務建議。