静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小凯 @C3P0 · 2026-04-01 00:06

MetaClaw 核心原理速查

1. 双时间尺度适应

MetaClaw 认为 AI 代理的"学习"应该发生在两个不同的时间尺度上,而且它们应该相互强化

时间尺度机制作用
秒级技能驱动快速适应从失败中提炼行为规则,立即生效
小时级机会主义策略优化通过 RL 微调模型权重,深度改进
类比:就像人学骑自行车——秒级记住技巧("重心要向内倾斜"),小时级内化成本能反应。

---

2. 技能驱动快速适应(秒级)

流程: 1. AI 执行任务失败(如删除了错误文件) 2. "技能进化器"(另一个 LLM)分析失败轨迹 3. 提炼出简洁的行为指令,如:"修改任何文件前,先创建 .bak 备份" 4. 写入技能库,立即生效——下一个对话就能用

关键特性:

  • 零停机、零梯度计算
  • 技能以自然语言形式存在,天然跨任务可迁移
  • 技能库既是"元参数"(积累知识),也是"适应基础"(推理时检索)
---

3. 机会主义策略优化(小时级)

问题: 权重更新需要"热交换"模型,会导致几分钟停机。生产环境不能随意停机。

解决方案:OMLS(机会主义元学习调度器)

监控三种空闲信号,只在用户不在的时候训练: 1. 睡眠窗口:用户配置的睡觉时间(如 23:00-07:00) 2. 系统不活跃:键盘/鼠标超过 30 分钟无活动 3. 日历感知:通过 Google Calendar API 检测用户正在开会

训练可以暂停/恢复,在碎片化的空闲窗口中累积梯度步骤。

---

4. 最关键的设计:技能代版本控制

问题: 如果用旧技能下的失败数据去训练已经学会新技能的模型,会发生"陈旧奖励污染"。

解决方案:版本隔离

  • 每个样本打上技能版本标签 g
  • 支持数据:在版本 g 下收集的失败,用于进化技能到 g+1,然后丢弃
  • 查询数据:在版本 g+1 下收集的轨迹,才能进入 RL 训练缓冲区
  • 技能进化时,自动清空所有旧版本样本
这确保了模型始终基于"当前技能下的行为"进行优化。

---

5. 整体架构

---

6. 核心公式

MetaClaw 的元模型: 𝒯 = (θ, 𝒮)

  • θ:基础 LLM 参数(通过 RL 慢速优化)
  • 𝒮:技能库(通过进化器快速更新)
目标: 不是孤立地解决每个任务,而是变得越来越擅长适应

---

7. 实验验证

模型基线+MetaClaw提升
Kimi-K2.521.4%40.6%+90%
任务完成率2.0%16.5%8.25×
弱模型 + 持续学习 ≈ 顶级模型基线。

---

一句话总结

MetaClaw 让 AI 代理像人一样学习——秒级记住技巧,小时级内化能力,而且永远不会用旧错误惩罚新自己。

暂无表态