AI 会画电路板了吗:让 SPICE 当裁判的 13 道题,和一颗在裁判面前现形的电容
写代码的 AI 卷完了 SWE-bench,有人把考场搬进了电路。9 月 4 日,atopile 团队发布 EEBench V1:13 道硬件设计题,AI 用代码写电路,交卷后由 SPICE 仿真当裁判——不是让另一个大模型打印象分,是让物理定律打分。
写代码的 AI 卷完了 SWE-bench,有人把考场搬进了电路。9 月 4 日,atopile 团队发布 EEBench V1:13 道硬件设计题,AI 用代码写电路,交卷后由 SPICE 仿真当裁判——不是让另一个大模型打印象分,是让物理定律打分。
atopile 是个 YC W24 的小团队,做了个"用代码画电路板"的开源语言,GitHub 3700 多星。他们的动机写在博客开头:GPT-6 Astra 的发布演示里出现了在 KiCad 里改 PCB 的画面,那到底是真的会,还是演的?与其吵,不如考。
考场规则:物理当裁判
流程很硬核:模型提交 atopile 代码,编译成电路图和 BOM,然后进 ngspice 仿真——标称工况跑一遍,最坏容差角再跑一遍。电压超限、电容不够、成本超标,都是机器说了算。最终得分 = 技术分 × 0.65 + 成本分 × 0.35,成本按百片量的分销商价格对参考设计比。没有人类阅卷,没有 LLM 裁判。
题目是 2026 年新写的,从未公开——模型没法背题。13 道题的名字不公布,我只知道露面的两道:给电表做掉电保持电容阵列(简单档),围绕运放设计多反馈低通滤波器并把每个容差角都压在限内(难档)。
成绩单,和它过期的一天
有个活生生的时效教训。博客 9 月 4 日发文中还写着"我们还没有 GPT-6 Astra 的成绩"——同一天重新生成的活榜上,Astra 已经以 69.3% 登顶,atopile 的人自己在 HN 评论区里宣布的。一篇博文的悬念,寿命不到一天。
榜单还有两处耐人寻味。xAI 在 Grok 4.6 模型卡里自报 60.0%,atopile 自己测出 57.1%,差 2.9 个点——厂商自测和第三方之间的缝,在硬件题上也没闭上。开源模型集体趴在个位数到十几分:GLM 5.2 Max 16.7,DeepSeek V4 Pro 10.5。软件代码上逼近闭源的这批模型,到模拟世界还差着一个数量级。
那颗电容:教科书级的翻车
基准报告里最精彩的是一份失败卷。某模型给掉电保持任务选了标称 22 µF 的陶瓷电容,代码编译通过,波形一跑——4.7 V 直流偏压下实际有效电容只剩 11.4 µF,而任务要求 545 µF。电源轨在 0.85 毫秒后就跌破 3 V 红线,规格要求撑住 20 毫秒。
我算了一下。93 Ω 负载,轨电压从 4.55 V 衰减到 3.0 V,时间常数套 RC 放电公式:93 × 22µ × ln(4.55/3.0) = 0.85 毫秒。分毫不差。裁判没有冤枉它。
翻车原因值得每个写硬件的人记一辈子:高容值陶瓷电容用钛酸钡铁电介质,直流偏压把电畴提前极化,越压越"硬",电容跟着缩水。小封装 X5R 在一半额定电压下掉 40% 到 60% 是厂家曲线图上的常态。模型背得出 datasheet 第一页的 22 µF,背不下第十几页的偏压降额曲线。它缺的那门课叫经验。
圈内人怎么看
HN 上 384 分 209 条评论,从业者的冷水很有分量。有人说"这种事任何知道元件名字的爱好者都懂";有人说模型像"背熟了本科和研究生的教科书,但零实操经验,回答不了这够不够用"——它们至今热爱 741 运放。也有人指出这基准本身是 atopile 的活广告:题目用他们的语言写,裁判用他们的仿真器跑,榜单还给公司带咨询生意。atopile 的辩解也能查证:博客确实声明"我们支付公开跑分成本,不出售榜单分数"。两件事同时为真。
还有个善意的提醒藏在版本缝隙里:七月首发的榜单上 Claude Fable 5 拿过 71.7%,九月换成 V1 正式题集后同一模型只剩 54.3%。题集一换,分数不可比。看任何榜单,先看版本号。
回到标题的问题。博客自己的收尾比任何转述都好:"Some of them, yes. We still would not ask it to design a pacemaker and blindly install the result."——有些可以了。起搏器还是算了。
参考:EEBench 博客 | 评测方法页 | HN 讨论 | atopile