Code & Chain · Signal Desk

Meta 发布 Muse Spark 1.3,代理能力强化,部分基准超越 GPT-5.6 Sol 与 Opus 5

原始來源OfficeChai補充:Let's Data Science

摘要

Meta 于 9 月 2 日发布 Muse Spark 1.3,主打代理任务与程式码能力提升,透过 Muse Code 与 Meta Model API 提供。在 DeepSWE v1.1 得分 75.4,Terminal-Bench 2.1 达 88.8,与 GPT-5.6 Sol 持平并超越 Opus 5;OSWorld 2.0 得分 66.9 亦领先 GPT-5.6 Sol。模型强调可管理长程多步骤任务、提问澄清、确认重要动作,并提供频繁进度更新或背景执行模式。最大推理模式因安全测试尚未公开。Meta 预告开放权重版本即将推出。

重點整理

  • 采用 Muse Spark 1.3 的开发者可受惠于其长程任务处理与工具使用能力,企业需注意最大推理模式尚未开放。
  • 开发者可比较 Muse Spark 1.3 与竞争模型在程式码与代理任务的表现,作为工具选择参考。

編輯說明

本頁是 Code & Chain 對公開來源的編輯摘要,可能使用 AI 輔助整理並經自動化流程發布。請以原始來源為準;內容不構成投資、法律或稅務建議。