SCHEMA 模式之理 · 让智能体如物理学家般思考

观测与理论相左时,引入"收缩假说"等补偿项,修补既有框架——状态不变,仅调参数。

文本版 · 供搜索与朗读

Schema · 模式之理 · 一页纸海报

Harness · Frontier Model · ARC-AGI-3

SCHEMA
模式之理 · 让智能体如物理学家般思考

一种以程序化世界模型为核心的执行框架——
不更模型之权重,而改其过程。
同一前沿模型,得此框则脱胎换骨。

⌘ HOW YOU USE IT

MATTERS MORE

arc-agi-3 · public set

25 games · RHAE metric

2026

模式者,构建之规也。
上承抽象之念(理论、机制、谓词),
下接具体之觉(像素、轨迹、反例)——
以一可读、可验证、可搜索之程序为桥,
使智能体得于感知与概念之间往复印证,如物理学家之于实验台。

— Schema · The Physicist's Way · 2026

§ 01
问题之解构 与 流程之架构

Problem · Decomposition & Loop Architecture

TWO SUB-PROBLEMS

两个抽象层级,须联合求解

状态接地 与 机制发现 不可分割——
当规则失验,错的或非定律本身,而是状态之本质。

LEVEL 1 · STATE GROUNDING
状态接地 ↓ observation → state program

从原始像素中识别物体、属性、关系。
已有 VIGA 循"分析-合成"之法行之。

LEVEL 2 · MECHANISM DISCOVERY
机制发现 ↓ (s, a, s′) → step()

发现状态如何随动作变化,写成可执行程序。
已有 WorldCoder 习其迁移,但起点需已结构化。

Schema 之创见:将二者联合编码于同一可编辑程序中——
反例既可指摘规则,亦可指摘状态本身。

DUAL LOOPS

双循环:外环四步 · 内环四步

外环驱动游戏进程,内环专司一次审议——
每一步皆可追溯、可重放、可回测。

外环:与环境往复,记录真相

内环:在模型内规划,免费试错

§ 02
哲学之锚 · 狭义相对论的诞生

Philosophical Anchor · Lorentz vs Einstein

ROUTE A · 修补规则

洛伦兹 · 保留以太

观测与理论相左时,引入"收缩假说"等补偿项,修补既有框架——状态不变,仅调参数。

VS

ROUTE B · 重定义状态

爱因斯坦 · 抛弃以太

将"同时性"从绝对基底降为相对框架的一部分,于是简洁的动体电动力学自然涌现。

Schema 所师法者,爱因斯坦之路也——
当假设系统性失败,须敢于重新定义状态本身,is_goal 等谓词亦须从交互中推断。

§ 03
三 大 铁 律

Three Operating Principles

PRINCIPLE · 01

动作用于发现Action for Discovery

智能体不仅为达成目标而行动,亦为调查隐藏机制而行动——
当多规则与历史一致时,主动搜索能区分它们的实验。

▸ 提交鉴别性动作
▸ 比对预测与观测
▸ 修订 step() 再回测

PRINCIPLE · 02

现实高于模型Reality Outranks the Model

执行时每步对照预测自我检查——任何单一不匹配即停当前计划,
携反例回审议,必先修订模型方许续行。

▸ 任何反例 = 模型疑点
▸ 计划即废
▸ 必先 backtest 通过

PRINCIPLE · 03

规划移入模型Planning Moves into the Model

一旦 step() 重现历史,
即可在模型内 BFS 求解,
唯最终计划落于游戏执行。

▸ 程序即模拟器
▸ 内部规划零成本
▸ 仅最终动作外放

§ 04
数字 · 言之有物

What the Numbers Say

通用执行框架CLAUDE CODE · BASELINE

42.83% RHAE

Schema 执行框架SAME MODEL · OPUS 4.8 + FABLE 5

98.98% RHAE▲ +56.15pp

GPT-5.6 Sol · 仅参考SOL MAX · xhigh + max 回退

95.35% · 参考对比

GPT-5.6 Sol · 基线SOL MAX · 原始推理

13.33% · 公开集

受控对比:相同模型(Opus 4.8 + Fable 5),仅换框架——
42.83% → 98.98%,提升 56.15 个百分点。
此乃"如何使用模型"之分量,亦 Schema 存在之最强证据。

§ 05
术语 · 与 资源

Glossary & Resources

关键术语

Schema
模式 / 执行框架让智能体如物理学家般工作的脚手架

Harness
执行框架 / 脚手架围绕模型的流程与工具层

RHAE
相对人类动作效率(人类动作 / 智能体动作)²,上限 1.15

State Grounding
状态接地从像素识别物体 / 属性 / 关系

Mechanism Discovery
机制发现发现状态如何随动作变化

Timeline
时间线仅追加、不可修改的交互历史

backtest
回测对照记录历史重放验证 step()

is_goal
是否达目标谓词须从交互中推断

延伸资源

PAPERschema-harness.github.io

REPORTARC-AGI-3 技术报告

BLOGARC-AGI-3 启动博客

DATASchema 追踪数据集

PAPERWorldCoder (arXiv)

SYSVIGA · 前作系统

RESULTSGPT-5.6 结果

SCHEMA · A Physicist's Harness for Frontier Models

★ MODE
◆ LOOP
▲ RESULT

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens