MetaClaw 核心原理速查
1. 双时间尺度适应
MetaClaw 认为 AI 代理的"学习"应该发生在两个不同的时间尺度上,而且它们应该相互强化:
| 时间尺度 | 机制 | 作用 |
|---|---|---|
| 秒级 | 技能驱动快速适应 | 从失败中提炼行为规则,立即生效 |
| 小时级 | 机会主义策略优化 | 通过 RL 微调模型权重,深度改进 |
---
2. 技能驱动快速适应(秒级)
流程: 1. AI 执行任务失败(如删除了错误文件) 2. "技能进化器"(另一个 LLM)分析失败轨迹 3. 提炼出简洁的行为指令,如:"修改任何文件前,先创建 .bak 备份" 4. 写入技能库,立即生效——下一个对话就能用
关键特性:
- 零停机、零梯度计算
- 技能以自然语言形式存在,天然跨任务可迁移
- 技能库既是"元参数"(积累知识),也是"适应基础"(推理时检索)
3. 机会主义策略优化(小时级)
问题: 权重更新需要"热交换"模型,会导致几分钟停机。生产环境不能随意停机。
解决方案:OMLS(机会主义元学习调度器)
监控三种空闲信号,只在用户不在的时候训练: 1. 睡眠窗口:用户配置的睡觉时间(如 23:00-07:00) 2. 系统不活跃:键盘/鼠标超过 30 分钟无活动 3. 日历感知:通过 Google Calendar API 检测用户正在开会
训练可以暂停/恢复,在碎片化的空闲窗口中累积梯度步骤。
---
4. 最关键的设计:技能代版本控制
问题: 如果用旧技能下的失败数据去训练已经学会新技能的模型,会发生"陈旧奖励污染"。
解决方案:版本隔离
- 每个样本打上技能版本标签 g
- 支持数据:在版本 g 下收集的失败,用于进化技能到 g+1,然后丢弃
- 查询数据:在版本 g+1 下收集的轨迹,才能进入 RL 训练缓冲区
- 技能进化时,自动清空所有旧版本样本
---
5. 整体架构
---
6. 核心公式
MetaClaw 的元模型: 𝒯 = (θ, 𝒮)
- θ:基础 LLM 参数(通过 RL 慢速优化)
- 𝒮:技能库(通过进化器快速更新)
---
7. 实验验证
| 模型 | 基线 | +MetaClaw | 提升 |
|---|---|---|---|
| Kimi-K2.5 | 21.4% | 40.6% | +90% |
| 任务完成率 | 2.0% | 16.5% | 8.25× |
---
一句话总结
MetaClaw 让 AI 代理像人一样学习——秒级记住技巧,小时级内化能力,而且永远不会用旧错误惩罚新自己。