MathModelAgent:3 天的数学建模比赛,1 小时跑完

数学建模比赛的标准节奏是:3 天 3 夜,三个人,一个建模、一个写代码、一个写论文,最后通宵排版。然后交一份 PDF。

数学建模比赛的标准节奏是:3 天 3 夜,三个人,一个建模、一个写代码、一个写论文,最后通宵排版。然后交一份 PDF。

MathModelAgent 的作者把这个过程压缩到 1 小时。不是 1 小时辅助你做,是 1 小时全自动跑完——分析问题、建模、写代码、纠错、写论文、排版,输出一份可以直接提交的 PDF。

一天涨 264 颗星。这个项目的野心写在 README 第一行:专为数学建模设计的 Agent,自动完成数学建模,生成一份完整的可以直接提交的论文

SKILLS 驱动:不做 Harness 层

MathModelAgent 最反直觉的设计决策是:项目只做 SKILLS 层,不做 Harness 层

这是什么意思?大部分 agent 项目自己写一套 agent 框架——任务规划、工具调用、记忆管理、错误恢复,全自己来。MathModelAgent 放弃了这条路,直接用 Claude Code / Codex / Cursor 当 Harness(运行环境),自己只写 skill 文件。

每个 skill 是一个 Markdown 文件,描述一个特定阶段的任务(分析问题、建模、编码、写论文、验收)。Harness(Claude Code 等)读 skill 文件,按描述执行。

作者在 README 里说得很直白:

两年前,我都是自己实现一套 Agent 框架,现在和以后更多的 Agent 产品直接基于 Harness 如 Codex / Claude Code / Pi + SKILLS 来构建

这是一个范式判断:agent 框架层正在被 Harness 层吃掉。你不需要自己写任务规划器,Claude Code 已经是很好的任务规划器;你不需要自己写工具调用,MCP 协议已经标准化了工具调用;你需要的只是领域知识,而领域知识最适合的载体是 skill 文件。

多 agent 分工:建模手、代码手、论文手

MathModelAgent 内部不是单个 agent,是三个角色的协作:

  • 建模手:分析问题,选择模型(AHP、TOPSIS、ARIMA、GA 等),输出数学公式与建模思路
  • 代码手:根据建模思路写代码,跑出结果,生成图表
  • 论文手:把建模思路、代码结果、图表整合成论文,按模板排版
每个 agent 可以设置不同的模型——建模手用推理强的模型(如 Claude Opus),代码手用代码强的模型(如 GPT-4),论文手用写作强的模型。这是模型异构分工,而不是"一个模型干所有事"。

9 步验收:论文不能有低级错误

数学建模论文的"低级错误"很致命——公式写错、数据对不上、图表缺失、格式混乱。MathModelAgent 的验收流水线有 9 步:

1. 文本泄漏检测(不能把 prompt 或内部思考写进论文) 2. 数值一致性校验(论文里的数字必须和代码输出一致) 3. Typst 编译(论文必须能编译成 PDF) 4. PDF 可视化检查(编译出来的 PDF 必须看起来正常) 5-9. 其他格式与内容检查

这 9 步是自动化的 QA 流程,不是人工审阅。这意味着 agent 不仅写论文,还自己审自己的论文

17 套 Typst 模板:覆盖主流赛事

数学建模比赛的论文格式要求很具体——国赛、华数杯、华为杯、MCM/ICM,每个赛事有自己的模板。MathModelAgent 内置 17 套 Typst 模板,自动匹配赛事类型。

选 Typst 而不是 LaTeX 是一个有意思的判断。Typst 是 Rust 写的现代排版系统,编译速度比 LaTeX 快几个数量级,语法也更简洁。对于 agent 来说,生成 Typst 源码比生成 LaTeX 源码更容易——语法更简单,错误更少,编译反馈更快。

HIL:关键节点暂停等你

全自动不意味着完全无人。MathModelAgent 的 HIL(Human-in-the-Loop)机制在关键节点暂停,等用户审批。6 种决策动作:

  • confirm:确认通过
  • edit:修改后继续
  • regenerate:重新生成
  • ask:问 agent 一个问题
  • skip:跳过这一步
  • abort:终止整个流程
这是"人在环上"而非"人在环里"——人不需要每步都看,只在关键节点介入。

四层容错:agent 失败了怎么办

agent 不可能 100% 成功。MathModelAgent 的四层容错:

1. 有限重试:失败先重试几次 2. Fallback Hand Off:重试不行就换备用模型 3. Evaluator Shadow Mode:评估器并行打分,发现质量问题 4. Feedback Rerun:把反馈注入重跑

这是工程化的容错思路——不是指望 agent 一次做对,是假设 agent 会错,设计机制让它错了也能恢复

桌面版:开箱即用

MathModelAgent 有桌面版(macOS / Windows),内置 Claude Code 与全套 SKILLS。用户不需要装 Python、Node.js、Redis,下载 dmg/exe 装上,填一个 API key 就能用。

这是 agent 产品化的关键一步——把环境配置的痛苦从用户转移到开发者。开发者打包好整个运行环境,用户只管用。

值得关注的点

MathModelAgent 不是最复杂的 agent 项目,但它代表了一个趋势:

1. SKILLS 层独立于 Harness 层——agent 框架被 Claude Code 等 Harness 吃掉,领域知识用 skill 文件承载 2. 多 agent 异构分工——不同角色用不同模型,而不是一个模型干所有事 3. 自动验收流水线——agent 不仅生产,还自我审核 4. HIL 6 种决策动作——不是简单的"确认/取消",是细粒度的人机协作 5. Typst 替代 LaTeX——agent 友好的排版系统,编译快、语法简、错误少

这个项目的深层判断是:agent 的未来不是更大的模型,是更好的 skill 设计。模型能力已经够强,瓶颈在于如何把领域知识结构化地喂给模型。MathModelAgent 用 skill 文件做了这件事,效果是 3 天的比赛 1 小时跑完。

不是所有任务都能这么压缩,但有标准流程、有明确输出格式、有可验证质量标准的任务,都适合这个模式。数学建模只是第一个被 skill 化的垂直领域。


GitHub: https://github.com/jihe520/MathModelAgent

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens