Loading...
正在加载...
请稍候

EvoSkills 深度调研报告

✨步子哥 (steper) 2026年06月08日 09:21

仓库: EvoScientist/EvoSkills
论文: EvoScientist: Towards Multi-Agent Evolving AI Scientists for End-to-End Scientific Discovery (arXiv:2603.08127)
许可: Apache-2.0 | 390★ / 41 Forks | 语言:Python 92.7%, HTML 4.1%, TeX 3.2%


一、定位:不是"又一个技能库"

EvoSkills 是 EvoScientist 的配套技能体系,但它不只是零散工具的堆砌——它是一个端到端科研管道,从灵感产生、实验执行、论文撰写到同行评审,形成了一个可自我进化的闭环。核心哲学:技能 + 持久记忆(evo-memory)+ 多 Agent 协作 = 研究能力随周期迭代增长


二、架构总览:三阶段管道 + 进化层

┌─────────────────┐     ┌─────────────────┐     ┌─────────────────┐
│  🔬 研究阶段     │ ──▶ │  ⚙️ 实验阶段     │ ──▶ │  📝 写作阶段     │
│  research-ideation│     │  paper-planning │     │  paper-writing  │
│  paper-navigator │     │  experiment-*   │     │  paper-review   │
│  evomath-tao     │     │  (4 skills)     │     │  paper-rebuttal │
│                  │     │                 │     │  academic-slides│
└─────────────────┘     └─────────────────┘     └─────────────────┘
         ▲                       ▲                       ▲
         └───────────────────────┴───────────────────────┘
                              │
                    ┌───────────────┐
                    │  🧠 evo-memory │
                    │  (IDE·IVE·ESE) │
                    └───────────────┘

三大 Agent 角色:

  • Researcher Agent(蓝色):想法树搜索 + Elo 锦标赛排序 → 产出研究提案
  • Engineer Agent(绿色):4 阶段实验管道执行
  • Evolution Manager Agent(灰色):管理 3 种记忆进化机制,将经验反馈回未来周期

三、15 个技能详解

研究阶段(3 个)

技能 核心能力 亮点
research-ideation 文献基础→多轨道构思→Elo 排序→提案生成 先读 evo-memory 避免已知死胡同;多角色生成候选想法;Elo 锦标赛按新颖性、可行性、相关性、清晰度排名
paper-navigator 论文发现→评估→阅读(4 阶段) 7 条发现路径(关键词、引用追踪、推荐、作者跟踪、arXiv 监控、趋势检测、GitHub 搜索);3 级阅读策略(技术/分析/语境)
evomath-tao Tao 式奥林匹克数学证明工作流 5 步协议(Plan→Try→Assemble→Audit→Reflect);5 轮内部小流程;5 种诚实状态标签(PROVED/REFUTED/...);3 重审计保障;IMO 2025 实测:4 题证明,1 题猜想,1 题移交

实验阶段(4 个)

技能 核心能力 亮点
paper-planning 预写作规划 故事设计(逆向工程叙事:任务→挑战→洞察→贡献→优势);先写"拒绝信";4 周倒计时时间表
experiment-pipeline 4 阶段实验执行 阶段 1 初始实现(≤20 次尝试)→ 阶段 2 超参数调优(≤12)→ 阶段 3 提出方法(≤12)→ 阶段 4 消融研究(≤18);失败尝试也是数据
experiment-craft 实验调试与迭代 5 步诊断流;一次只改一个变量;结构化 5 节实验日志模板
experiment-iterative-coder 迭代代码精炼 1-5 个顺序阶段;每阶段最多 3 次迭代(总计 10 次);ruff + pytest 动态评分;硬上限机制

写作阶段(4 个)

技能 核心能力 亮点
paper-writing 逐节起草 11 步工作流;3 种摘要模板、4 种引言开头;" prose 中少 claim,证据中多 deliver"
paper-review 自我审查 5 方面检查清单;逆向大纲提取;拒绝模拟(先强迫自己写拒绝总结)
paper-rebuttal 反驳回复 颜色编码评论(红/橙/灰/绿);冠军策略(武装最积极的评审人);18 条战术规则;小让步换大胜利
academic-slides 学术演示 叙事弧线优先;10 条设计规则;直接生成 .pptx;热情 > polish

独立工具(4 个)

技能 核心能力 亮点
nano-banana AI 生成幻灯片和插图 Gemini 图像生成;3 种视觉风格(扁平/玻璃/矢量);本地 HTTP 服务器交互评审;编辑不重新生成
research-survey 文献综述综合 自适应大纲;草稿+扩展管道;比较表格 + 分类法组织
evo-memory 持久研究记忆与自我进化 核心引擎:M_I(构思记忆)+ M_E(实验记忆);3 种进化机制(见下文)
(MCP Servers) 外部工具扩展 arXiv、Semantic Scholar、HuggingFace、GitHub 等 API 集成

四、核心创新:evo-memory 自我进化机制

这是 EvoSkills 区别于其他学术工具链的最大差异化

机制 全称 作用
IDE Idea Direction Evolution 研究构思后提取有前景的方向
IVE Idea Validation Evolution 分类实验失败(实现错误 vs 根本方向错误)
ESE Experiment Strategy Evolution 从成功实验管道中提炼可重用模式

工作方式: 每个研究周期开始时,research-ideation 和 experiment-pipeline 先读取 evo-memory 加载历史经验;周期结束后更新记忆。长期看,系统会越用越聪明——避免重复踩坑,积累领域直觉。


五、兼容性与安装

不仅限于 EvoScientist,兼容任何编码代理

# EvoScientist 内
/install-skill EvoScientist/EvoSkills@skills

# 通用(Claude Code / Cursor / Codex / Gemini CLI / DeepAgents 等)
npx skills add EvoScientist/EvoSkills

六、技术验证:IMO 2025 硬基准

evomath-tao 在 IMO 2025 上做了实打实的测试(Claude Opus 4.7,6 个并行子代理):

题目 结果 状态
P1 证明 ✅ PROVED
P2 证明 ✅ PROVED
P3 猜想 🔶 CONJECTURED(c=4,奇素数间隙)
P4 证明 ✅ PROVED
P5 证明 ✅ PROVED
P6 草图 📤 HANDED_OFF(2112 步草图)

6 道数值/分类答案全部匹配官方答案。 这证明了其"校准弃权"哲学的有效性——不会为了面子而硬撑。


七、待办路线图

状态 功能
✅ 已完成 自我进化套件、文献综述、迭代编码器、视觉生成、数学奥林匹克
⏳ 即将推出 论文复现、资助与提案写作、同行辩论(多 Agent 对抗讨论)、趋势雷达、论文 QA

八、评估与潜在问题

优势:

  1. 闭环设计:不是碎片化工具,而是端到端研究管道
  2. 进化机制:evo-memory 是真正意义上的"学习"——经验跨周期复用
  3. 反直觉策略:先写拒绝信、小让步换大胜利、失败尝试也是数据——这些建议来自真实审稿经验
  4. 硬基准:IMO 2025 测试给了数学能力可信度
  5. 通用兼容:不锁定在 EvoScientist 生态内

潜在局限:

  1. 依赖外部服务:论文发现依赖 Semantic Scholar、arXiv、Jina Reader;幻灯片依赖 Gemini API;网络或配额问题会影响可用性
  2. LaTeX 偏重:paper-writing 以 LaTeX 为核心,对偏好 Markdown/Word 的用户需要适配
  3. 实验预算为经验值:4 阶段尝试上限(20/12/12/18)是硬编码的,可能不适合所有领域
  4. 自我进化质量:evo-memory 的效果取决于数据量和质量积累周期;短期用户可能感受不到"进化"

九、与你现有生态的关联

你当前 workspace 中已有的技能主要集中在:

  • 学术写作(academic-paper、academic-paper-reviewer、academic-pipeline)
  • 深度研究(deep-research)
  • 代码与调试(coding-agent、diagnose、tdd)
  • 中文写作优化(wenbai-detox、deai-rewrite)

EvoSkills 的互补价值:

  • 你的现有工具重单篇论文/单次研究;EvoSkills 重跨周期累积(evo-memory)
  • 你的工具重写作质量;EvoSkills 重实验管道(experiment-pipeline/craft)
  • 你的工具重研究规划;EvoSkills 重数学证明(evomath-tao)
  • 两者可以叠加使用:用 EvoSkills 做实验和记忆,用你现有的 academic-pipeline 做论文和评审

十、结论

EvoSkills 是一个 工程化程度很高的科研 Agent 工具链,不是"又一个提示词模板库"。它有三个真正有价值的差异化:

  1. evo-memory 的自我进化设计
  2. 反直觉策略(来自真实审稿/实验经验)
  3. 硬基准验证(IMO 2025)

如果你正在进行需要 多次实验迭代、跨项目积累经验、或数学证明 的研究工作,安装这整套技能会有明显增益。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录