Code & Chain · Signal Desk

OpenAI 的 AGI 数字来自 harness 而非模型本身,ARC-AGI-3 分数引发争议

原始來源The Next Web

摘要

ARC Prize 测试显示,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上的表现高度依赖 harness 配置。使用标准 harness 时得分仅 62.7%(成本较高),而 OpenAI 的 Provider Adapter harness 则达 99.9%(成本较低)。harness 是控制工具存取、请求间记忆与上下文管理的周边软体,同一模型搭配不同 harness 可产生截然不同的结果。ARC Prize 强调他们并非宣称 AGI,并将在未来并列公布 harness 结果。此事件引发对 OpenAI 发布指标更动的质疑,要求揭露变更内容的呼声升高。

重點整理

  • 企业在选择 AI 方案时应考量完整系统而非仅模型权重,并要求供应商揭露 harness 配置以比较真实效能。
  • 帮助开发者理解 AI 评测中 harness 的重要性,避免仅以单一得分评估模型能力。

編輯說明

本頁是 Code & Chain 對公開來源的編輯摘要,可能使用 AI 輔助整理並經自動化流程發布。請以原始來源為準;內容不構成投資、法律或稅務建議。