Code & Chain · Signal Desk

OpenAI 的 AGI 數字來自 harness 而非模型本身,ARC-AGI-3 分數引發爭議

原始來源The Next Web

摘要

ARC Prize 測試顯示,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基準上的表現高度依賴 harness 配置。使用標準 harness 時得分僅 62.7%(成本較高),而 OpenAI 的 Provider Adapter harness 則達 99.9%(成本較低)。harness 是控制工具存取、請求間記憶與上下文管理的周邊軟體,同一模型搭配不同 harness 可產生截然不同的結果。ARC Prize 強調他們並非宣稱 AGI,並將在未來並列公佈 harness 結果。此事件引發對 OpenAI 發布指標更動的質疑,要求揭露變更內容的呼聲升高。

重點整理

  • 企業在選擇 AI 方案時應考量完整系統而非僅模型權重,並要求供應商揭露 harness 配置以比較真實效能。
  • 幫助開發者理解 AI 評測中 harness 的重要性,避免僅以單一得分評估模型能力。

編輯說明

本頁是 Code & Chain 對公開來源的編輯摘要,可能使用 AI 輔助整理並經自動化流程發布。請以原始來源為準;內容不構成投資、法律或稅務建議。