GPT-6 Astra 实测:ARC-AGI-3 得分 99%
OpenAI 联合创始人 Greg Brockman 转发了一份 GPT-6 Astra 的第三方评测,称其在 ARC-AGI-3 基准上取得 SOTA,并直言该基准趋于饱和。评测里的两组数据对实际使用者很有参考价值:同一模型换个 harness,得分从 63% 跳到 99%;更高推理档位反而总成本更低。
成绩单:96% 的关卡超越人类表现
这份评测给出的关键数字是:Astra 在 ARC-AGI-3 的标准 harness 下得分 63%,而换用新的 Provider Adapter harness 后达到 99%,并在 96% 的关卡上超越人类参照。ARC 系列测试考察的是模型面对全新谜题的推理与泛化能力,一向被视为「防背题」的硬指标。SOTA 加上发布方自己承认「基准趋于饱和」,传递的信号是:通用推理这一单项,头部模型的差距已经拉开到评测工具测不动的程度。
harness 差异:63% 到 99% 之间的启示
同一模型两种 harness 36 个百分点的分差,恰好印证了本日另一篇百科里 harness 工程的概念:模型外围的编排、适配与验证层,对最终表现的影响可能不亚于模型本身。Provider Adapter 大概率是优化了任务指令格式、工具调用方式或重试策略,让模型能力被更完整地「释放」。对开发者来说,这意味着在评估模型时不能只看排行榜默认配置,自己应用的接入层质量同样是成绩变量。
反直觉发现:更高推理档位,总成本更低
排行榜数据里最实用的一点:更高的推理档位通常总成本反而更低。原因是 Astra 在高档位下用更少的动作就通过了关卡,模型调用次数和 token 消耗随之减少,抵消了单次调用单价的上涨。这打破了「强模型等于贵」的直觉,对用 Agent 跑长任务的用户特别有参考意义:与其用便宜模型反复重试,不如直接上高档位一次通过,总账可能更划算。
给使用者的三点参考
综合这份评测,给三类读者的建议:AI 应用开发者,把 harness/适配层当作一等公民来优化,同一模型不同接入方式的表现差距可能非常大;成本敏感的重度用户,在 Agent 类工具里优先测试最高推理档位的总成本而非单价;关注模型选型的团队,ARC-AGI-3 已趋饱和,后续选型应更多看真实任务集上的表现而非通用基准分数。
原文来源
本文整理自 X(Greg Brockman / OpenAI):https://x.com/gdb/status/2095629409017614390,版权归原作者所有,了解详情请查看原文。


