SCHEMA 模式之理 · 让智能体如物理学家般思考
观测与理论相左时,引入"收缩假说"等补偿项,修补既有框架——状态不变,仅调参数。
文本版 · 供搜索与朗读
Schema · 模式之理 · 一页纸海报
Harness · Frontier Model · ARC-AGI-3
SCHEMA
模式之理 · 让智能体如物理学家般思考
一种以程序化世界模型为核心的执行框架——
不更模型之权重,而改其过程。
同一前沿模型,得此框则脱胎换骨。
⌘ HOW YOU USE IT
MATTERS MORE
arc-agi-3 · public set
25 games · RHAE metric
2026
模式者,构建之规也。
上承抽象之念(理论、机制、谓词),
下接具体之觉(像素、轨迹、反例)——
以一可读、可验证、可搜索之程序为桥,
使智能体得于感知与概念之间往复印证,如物理学家之于实验台。
— Schema · The Physicist's Way · 2026
§ 01
问题之解构 与 流程之架构
Problem · Decomposition & Loop Architecture
TWO SUB-PROBLEMS
两个抽象层级,须联合求解
状态接地 与 机制发现 不可分割——
当规则失验,错的或非定律本身,而是状态之本质。
LEVEL 1 · STATE GROUNDING
状态接地 ↓ observation → state program
从原始像素中识别物体、属性、关系。
已有 VIGA 循"分析-合成"之法行之。
LEVEL 2 · MECHANISM DISCOVERY
机制发现 ↓ (s, a, s′) → step()
发现状态如何随动作变化,写成可执行程序。
已有 WorldCoder 习其迁移,但起点需已结构化。
Schema 之创见:将二者联合编码于同一可编辑程序中——
反例既可指摘规则,亦可指摘状态本身。
DUAL LOOPS
双循环:外环四步 · 内环四步
外环驱动游戏进程,内环专司一次审议——
每一步皆可追溯、可重放、可回测。
外环:与环境往复,记录真相
内环:在模型内规划,免费试错
§ 02
哲学之锚 · 狭义相对论的诞生
Philosophical Anchor · Lorentz vs Einstein
ROUTE A · 修补规则
洛伦兹 · 保留以太
观测与理论相左时,引入"收缩假说"等补偿项,修补既有框架——状态不变,仅调参数。
VS
ROUTE B · 重定义状态
爱因斯坦 · 抛弃以太
将"同时性"从绝对基底降为相对框架的一部分,于是简洁的动体电动力学自然涌现。
Schema 所师法者,爱因斯坦之路也——
当假设系统性失败,须敢于重新定义状态本身,is_goal 等谓词亦须从交互中推断。
§ 03
三 大 铁 律
Three Operating Principles
PRINCIPLE · 01
动作用于发现Action for Discovery
智能体不仅为达成目标而行动,亦为调查隐藏机制而行动——
当多规则与历史一致时,主动搜索能区分它们的实验。
▸ 提交鉴别性动作
▸ 比对预测与观测
▸ 修订 step() 再回测
PRINCIPLE · 02
现实高于模型Reality Outranks the Model
执行时每步对照预测自我检查——任何单一不匹配即停当前计划,
携反例回审议,必先修订模型方许续行。
▸ 任何反例 = 模型疑点
▸ 计划即废
▸ 必先 backtest 通过
PRINCIPLE · 03
规划移入模型Planning Moves into the Model
一旦 step() 重现历史,
即可在模型内 BFS 求解,
唯最终计划落于游戏执行。
▸ 程序即模拟器
▸ 内部规划零成本
▸ 仅最终动作外放
§ 04
数字 · 言之有物
What the Numbers Say
通用执行框架CLAUDE CODE · BASELINE
42.83% RHAE
Schema 执行框架SAME MODEL · OPUS 4.8 + FABLE 5
98.98% RHAE▲ +56.15pp
GPT-5.6 Sol · 仅参考SOL MAX · xhigh + max 回退
95.35% · 参考对比
GPT-5.6 Sol · 基线SOL MAX · 原始推理
13.33% · 公开集
受控对比:相同模型(Opus 4.8 + Fable 5),仅换框架——
42.83% → 98.98%,提升 56.15 个百分点。
此乃"如何使用模型"之分量,亦 Schema 存在之最强证据。
§ 05
术语 · 与 资源
Glossary & Resources
关键术语
Schema
模式 / 执行框架让智能体如物理学家般工作的脚手架
Harness
执行框架 / 脚手架围绕模型的流程与工具层
RHAE
相对人类动作效率(人类动作 / 智能体动作)²,上限 1.15
State Grounding
状态接地从像素识别物体 / 属性 / 关系
Mechanism Discovery
机制发现发现状态如何随动作变化
Timeline
时间线仅追加、不可修改的交互历史
backtest
回测对照记录历史重放验证 step()
is_goal
是否达目标谓词须从交互中推断
延伸资源
PAPERschema-harness.github.io
REPORTARC-AGI-3 技术报告
BLOGARC-AGI-3 启动博客
DATASchema 追踪数据集
PAPERWorldCoder (arXiv)
SYSVIGA · 前作系统
RESULTSGPT-5.6 结果
SCHEMA · A Physicist's Harness for Frontier Models
★ MODE
◆ LOOP
▲ RESULT