Schema Harness 在 ARC-AGI-3 公开集取得约 99%:不换模型,让前沿模型「像物理学家一样」解题

本站收录 2026-07-17 21:10来源:Impossible Research(Schema 官方博客)

7 月 17 日,Impossible Research(联合 UC Berkeley、CMU 研究者)发布名为 Schema 的推理 harness,公布了一组相当醒目的 ARC-AGI-3 成绩:在不修改任何模型权重的前提下,Claude Opus 4.8 与 Fable 5 搭配 Schema 在 ARC-AGI-3 公开集(Public set)取得 98.98% RHAE,GPT-5.6 Sol 取得 95.35%——已非常接近人类基线 100%。作为对照,此前经官方验证的最强成绩是 GPT-5.6 Sol 在半私有集(Semi-private)的 7.78%,其在公开集也仅 13.33%。

ARC-AGI-3 是 ARC Prize 体系的最新交互式基准:agent 面对一个 64×64 的彩色网格游戏环境,没有任何规则说明、目标描述或奖励信号,只能一边行动一边归纳游戏机制。官方指标 RHAE(Relative Human Action Efficiency)把 agent 的每关动作数与初次接触的人类基线对比,100% 意味着以不低于人类的效率通关全部关卡。今年 3 月发布时,前沿模型在半私有集只有 0.51%。

Schema 的思路被团队称为「让模型像物理学家一样工作」:把每个游戏的机制写成一个可执行程序,拿真实观测去检验它,再在这个程序内部做规划。当观测与模型冲突时,agent 可以分别修订「表征」或「规则」,再让两者重新一致——整个过程发生在模型权重之外,属于典型的 harness/scaffolding 路线。

需要客观指出的是:这两个分数是团队基于公开集、用随博客发布的运行工件自行报告的,尚未经过 ARC Prize 官方独立验证,也不是在更难、防过拟合的半私有集上取得的成绩。即便如此,这个结果的信号意义仍然清晰——ARC-AGI-3 这类考察「即时归纳新规则」的基准,可能很快会被「强模型 + 强 harness」的组合实质性攻克,基准本身或许又要换代了。

本文相关产品

已复制,可直接粘贴给你的 AI