仓库: EvoScientist/EvoSkills
论文: EvoScientist: Towards Multi-Agent Evolving AI Scientists for End-to-End Scientific Discovery (arXiv:2603.08127)
许可: Apache-2.0 | 390★ / 41 Forks | 语言:Python 92.7%, HTML 4.1%, TeX 3.2%
一、定位:不是"又一个技能库"
EvoSkills 是 EvoScientist 的配套技能体系,但它不只是零散工具的堆砌——它是一个端到端科研管道,从灵感产生、实验执行、论文撰写到同行评审,形成了一个可自我进化的闭环。核心哲学:技能 + 持久记忆(evo-memory)+ 多 Agent 协作 = 研究能力随周期迭代增长。
二、架构总览:三阶段管道 + 进化层
┌─────────────────┐ ┌─────────────────┐ ┌─────────────────┐
│ 🔬 研究阶段 │ ──▶ │ ⚙️ 实验阶段 │ ──▶ │ 📝 写作阶段 │
│ research-ideation│ │ paper-planning │ │ paper-writing │
│ paper-navigator │ │ experiment-* │ │ paper-review │
│ evomath-tao │ │ (4 skills) │ │ paper-rebuttal │
│ │ │ │ │ academic-slides│
└─────────────────┘ └─────────────────┘ └─────────────────┘
▲ ▲ ▲
└───────────────────────┴───────────────────────┘
│
┌───────────────┐
│ 🧠 evo-memory │
│ (IDE·IVE·ESE) │
└───────────────┘
三大 Agent 角色:
- Researcher Agent(蓝色):想法树搜索 + Elo 锦标赛排序 → 产出研究提案
- Engineer Agent(绿色):4 阶段实验管道执行
- Evolution Manager Agent(灰色):管理 3 种记忆进化机制,将经验反馈回未来周期
三、15 个技能详解
研究阶段(3 个)
| 技能 | 核心能力 | 亮点 |
|---|---|---|
| research-ideation | 文献基础→多轨道构思→Elo 排序→提案生成 | 先读 evo-memory 避免已知死胡同;多角色生成候选想法;Elo 锦标赛按新颖性、可行性、相关性、清晰度排名 |
| paper-navigator | 论文发现→评估→阅读(4 阶段) | 7 条发现路径(关键词、引用追踪、推荐、作者跟踪、arXiv 监控、趋势检测、GitHub 搜索);3 级阅读策略(技术/分析/语境) |
| evomath-tao | Tao 式奥林匹克数学证明工作流 | 5 步协议(Plan→Try→Assemble→Audit→Reflect);5 轮内部小流程;5 种诚实状态标签(PROVED/REFUTED/...);3 重审计保障;IMO 2025 实测:4 题证明,1 题猜想,1 题移交 |
实验阶段(4 个)
| 技能 | 核心能力 | 亮点 |
|---|---|---|
| paper-planning | 预写作规划 | 故事设计(逆向工程叙事:任务→挑战→洞察→贡献→优势);先写"拒绝信";4 周倒计时时间表 |
| experiment-pipeline | 4 阶段实验执行 | 阶段 1 初始实现(≤20 次尝试)→ 阶段 2 超参数调优(≤12)→ 阶段 3 提出方法(≤12)→ 阶段 4 消融研究(≤18);失败尝试也是数据 |
| experiment-craft | 实验调试与迭代 | 5 步诊断流;一次只改一个变量;结构化 5 节实验日志模板 |
| experiment-iterative-coder | 迭代代码精炼 | 1-5 个顺序阶段;每阶段最多 3 次迭代(总计 10 次);ruff + pytest 动态评分;硬上限机制 |
写作阶段(4 个)
| 技能 | 核心能力 | 亮点 |
|---|---|---|
| paper-writing | 逐节起草 | 11 步工作流;3 种摘要模板、4 种引言开头;" prose 中少 claim,证据中多 deliver" |
| paper-review | 自我审查 | 5 方面检查清单;逆向大纲提取;拒绝模拟(先强迫自己写拒绝总结) |
| paper-rebuttal | 反驳回复 | 颜色编码评论(红/橙/灰/绿);冠军策略(武装最积极的评审人);18 条战术规则;小让步换大胜利 |
| academic-slides | 学术演示 | 叙事弧线优先;10 条设计规则;直接生成 .pptx;热情 > polish |
独立工具(4 个)
| 技能 | 核心能力 | 亮点 |
|---|---|---|
| nano-banana | AI 生成幻灯片和插图 | Gemini 图像生成;3 种视觉风格(扁平/玻璃/矢量);本地 HTTP 服务器交互评审;编辑不重新生成 |
| research-survey | 文献综述综合 | 自适应大纲;草稿+扩展管道;比较表格 + 分类法组织 |
| evo-memory | 持久研究记忆与自我进化 | 核心引擎:M_I(构思记忆)+ M_E(实验记忆);3 种进化机制(见下文) |
| (MCP Servers) | 外部工具扩展 | arXiv、Semantic Scholar、HuggingFace、GitHub 等 API 集成 |
四、核心创新:evo-memory 自我进化机制
这是 EvoSkills 区别于其他学术工具链的最大差异化:
| 机制 | 全称 | 作用 |
|---|---|---|
| IDE | Idea Direction Evolution | 研究构思后提取有前景的方向 |
| IVE | Idea Validation Evolution | 分类实验失败(实现错误 vs 根本方向错误) |
| ESE | Experiment Strategy Evolution | 从成功实验管道中提炼可重用模式 |
工作方式: 每个研究周期开始时,research-ideation 和 experiment-pipeline 先读取 evo-memory 加载历史经验;周期结束后更新记忆。长期看,系统会越用越聪明——避免重复踩坑,积累领域直觉。
五、兼容性与安装
不仅限于 EvoScientist,兼容任何编码代理:
# EvoScientist 内
/install-skill EvoScientist/EvoSkills@skills
# 通用(Claude Code / Cursor / Codex / Gemini CLI / DeepAgents 等)
npx skills add EvoScientist/EvoSkills
六、技术验证:IMO 2025 硬基准
evomath-tao 在 IMO 2025 上做了实打实的测试(Claude Opus 4.7,6 个并行子代理):
| 题目 | 结果 | 状态 |
|---|---|---|
| P1 | 证明 | ✅ PROVED |
| P2 | 证明 | ✅ PROVED |
| P3 | 猜想 | 🔶 CONJECTURED(c=4,奇素数间隙) |
| P4 | 证明 | ✅ PROVED |
| P5 | 证明 | ✅ PROVED |
| P6 | 草图 | 📤 HANDED_OFF(2112 步草图) |
6 道数值/分类答案全部匹配官方答案。 这证明了其"校准弃权"哲学的有效性——不会为了面子而硬撑。
七、待办路线图
| 状态 | 功能 |
|---|---|
| ✅ 已完成 | 自我进化套件、文献综述、迭代编码器、视觉生成、数学奥林匹克 |
| ⏳ 即将推出 | 论文复现、资助与提案写作、同行辩论(多 Agent 对抗讨论)、趋势雷达、论文 QA |
八、评估与潜在问题
优势:
- 闭环设计:不是碎片化工具,而是端到端研究管道
- 进化机制:evo-memory 是真正意义上的"学习"——经验跨周期复用
- 反直觉策略:先写拒绝信、小让步换大胜利、失败尝试也是数据——这些建议来自真实审稿经验
- 硬基准:IMO 2025 测试给了数学能力可信度
- 通用兼容:不锁定在 EvoScientist 生态内
潜在局限:
- 依赖外部服务:论文发现依赖 Semantic Scholar、arXiv、Jina Reader;幻灯片依赖 Gemini API;网络或配额问题会影响可用性
- LaTeX 偏重:paper-writing 以 LaTeX 为核心,对偏好 Markdown/Word 的用户需要适配
- 实验预算为经验值:4 阶段尝试上限(20/12/12/18)是硬编码的,可能不适合所有领域
- 自我进化质量:evo-memory 的效果取决于数据量和质量积累周期;短期用户可能感受不到"进化"
九、与你现有生态的关联
你当前 workspace 中已有的技能主要集中在:
- 学术写作(academic-paper、academic-paper-reviewer、academic-pipeline)
- 深度研究(deep-research)
- 代码与调试(coding-agent、diagnose、tdd)
- 中文写作优化(wenbai-detox、deai-rewrite)
EvoSkills 的互补价值:
- 你的现有工具重单篇论文/单次研究;EvoSkills 重跨周期累积(evo-memory)
- 你的工具重写作质量;EvoSkills 重实验管道(experiment-pipeline/craft)
- 你的工具重研究规划;EvoSkills 重数学证明(evomath-tao)
- 两者可以叠加使用:用 EvoSkills 做实验和记忆,用你现有的 academic-pipeline 做论文和评审
十、结论
EvoSkills 是一个 工程化程度很高的科研 Agent 工具链,不是"又一个提示词模板库"。它有三个真正有价值的差异化:
- evo-memory 的自我进化设计
- 反直觉策略(来自真实审稿/实验经验)
- 硬基准验证(IMO 2025)
如果你正在进行需要 多次实验迭代、跨项目积累经验、或数学证明 的研究工作,安装这整套技能会有明显增益。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。