当 AI Agent 学会画零件图:text-to-cad 让大模型从"数字"跨入"物理"
项目: earthtojake/text-to-cad
语言: Python | 协议: MIT
今日 Star: +75
一、AI Agent 的"物理盲区"
过去两年,AI Agent 生态爆发式增长——写代码、改文档、搜网页、管日历。但几乎所有 Agent 都在一个隐含的边界内活动:它们只操作数字对象。代码、文本、图片、表格——全是比特(bits),没有原子。
如果你让一个 AI Agent 帮你"设计一个支架,打三个 M4 螺丝孔,壁厚 2mm",它会卡住。不是因为它不懂机械设计,而是因为它没有手——它没法把设计变成一个 STEP 文件发给 CNC 加工厂,也没法生成 G-code 发给 3D 打印机。
earthtojake/text-to-cad 要补的就是这一块。它不是文生图模型,不是扩散模型生成 3D 形状——它是一组 Agent Skills,让任何 AI 编码助手(Claude Code、Cursor、Copilot)都能生成、检查、采购、切片、交接 CAD 和机器人描述文件。
二、12 个 Skill 覆盖完整制造管线
text-to-cad 的 README 列出了 12 个 skill,覆盖从"想法"到"实物"的完整链路:
| Skill | 输入 | 输出 | 干什么 |
|---|---|---|---|
text-to-step |
文字描述 | STEP 文件 | 生成 ISO 10303 标准 CAD 模型 |
text-to-stl |
文字描述 | STL 文件 | 生成 3D 打印网格 |
text-to-dxf |
文字描述 | DXF 文件 | 生成 2D 激光切割/水刀图纸 |
text-to-urdf |
文字描述 | URDF 文件 | 生成机器人描述(ROS 标准) |
text-to-sdf |
文字描述 | SDF 文件 | 生成仿真描述(Gazebo 标准) |
text-to-gcode |
文字描述 | G-code | 生成 CNC/打印机指令 |
inspect-step |
STEP 文件 | 检查报告 | 验证几何体是否可制造 |
inspect-stl |
STL 文件 | 检查报告 | 检查网格质量(流形、法线) |
source-parts |
BOM 清单 | 采购链接 | 从 SendCutSend 等供应商报价 |
slice-stl |
STL 文件 | G-code | 切片(Bambu Lab / Cura) |
handoff-cad |
CAD 文件 | 交接包 | 打包给制造商或下一环节 |
dfam-check |
CAD 文件 | DfAM 报告 | 可制造性设计检查 |
最值得注意的是最后两个。
handoff-cad 解决的是"设计完了,怎么交给工厂"的问题。传统流程里,设计师出 STEP 文件,发给 CNC 厂,厂里工程师打开看一眼说"这个内角 R0.5 铣不了,最小 R1",打回来改。来回几次,一周过去了。handoff-cad 把制造商的约束内置进交接包——你在设计阶段就知道哪些地方会被打回。
dfam-check(Design for Additive Manufacturing)更前沿。它检查的不是"几何对不对",而是"能不能打印出来"——悬垂角超过 45° 需要支撑、薄壁太薄会翘曲、小孔打印后会堵。这些知识通常只在资深工程师脑子里,现在变成了 Agent 可以调用的 skill。
三、为什么是"Skill"而不是"模型"
text-to-cad 的关键设计选择是:它不是一个训练好的模型,而是一组 skill。
区别在哪?如果是模型,你需要训练数据——几百万个"文字→STEP"对。这种数据不存在。STEP 文件是工业标准格式,不是互联网上随便爬得到的。训练一个能从文字直接生成 STEP 的模型,数据瓶颈比代码生成难一个数量级。
Skill 路线绕开了这个问题。Agent 本身(Claude、GPT)已经有空间推理能力——它能理解"一个 50mm×30mm×5mm 的板,三个角各打一个 M4 孔"。text-to-cad 做的是给 Agent 提供工具——生成 STEP 格式的 API、检查几何体的库、查询供应商价格的接口。Agent 负责理解和推理,skill 负责格式转换和领域检查。
这和 addyosmani/agent-skills(通用工程 skill)的架构一样,但切入了一个完全不同的领域:物理制造。通用 skill 库覆盖代码审查、文档生成、测试编写;text-to-cad 覆盖 CNC、3D 打印、激光切割、机器人建模。两者互补,不重叠。
四、URDF 和 SDF:机器人仿真的入口
text-to-cad 不只是制造——它还覆盖机器人。text-to-urdf 和 text-to-sdf 两个 skill 让 Agent 能生成机器人描述文件。
URDF(Unified Robot Description Format)是 ROS 的标准格式,描述机器人的连杆、关节、惯性参数。SDF(Simulation Description Format)是 Gazebo 仿真器的格式,比 URDF 多了传感器和环境的描述。
这意味着你可以对 Agent 说"帮我设计一个六轴机械臂,臂展 800mm,末端负载 2kg",Agent 生成 URDF,你直接丢进 ROS 仿真。从"想法"到"仿真就绪"的链路被压缩到了一次对话。
对机器人初创团队来说,这降低了原型设计门槛。传统流程里,机械工程师出 CAD,控制工程师写 URDF,仿真工程师调 Gazebo——三个角色三种工具。text-to-cad 让 Agent 把三个角色的"格式转换"工作自动化了,人只需要做设计决策。
五、SendCutSend 集成:从设计到下单的"一键"
source-parts skill 直接对接了 SendCutSend——一个在线激光切割/水刀/CNC 加工服务平台。你给 skill 一个 BOM(物料清单),它返回每个零件的报价和下单链接。
这把"设计→报价→下单"的链路压缩到了几秒。传统流程是:设计完 → 导出 DXF → 上传到供应商网站 → 等报价邮件 → 确认下单。text-to-cad 让 Agent 在设计阶段就能实时看到成本——"这个零件如果用 3mm 铝板,SendCutSend 报价 $12;如果改成 2mm,$8 但强度不够"。
成本信息前置到设计阶段,是工程领域一直在追求但很难做到的事。text-to-cad 通过 skill 化的供应商接口,让 Agent 成了设计和制造之间的"实时成本翻译器"。
六、一个 +75 star 的项目为什么值得关注
text-to-cad 今日只涨了 75 star,和那些动辄 +1000 的项目比不起眼。但它切入的赛道——AI Agent × 物理制造——目前几乎没有竞品。
大多数 AI Agent 项目在数字领域内卷:更好的代码生成、更好的文档摘要、更好的网页抓取。text-to-cad 走向了物理世界。这意味着:
- 数据壁垒不同。代码生成有 GitHub,制造领域没有等价物。text-to-cad 用 skill 路线绕开数据问题,但 skill 的质量取决于作者对制造流程的理解深度。
- 用户画像不同。代码 Agent 的用户是程序员;CAD Agent 的用户是机械工程师、机器人团队、硬件初创。这群人目前几乎没有被 AI 工具覆盖。
- 价值链更长。一个代码 PR 的价值链是"写→测→合并";一个 CAD 文件的价值链是"设计→检查→报价→下单→制造→质检"。每一步都是 skill 的机会。
text-to-cad 的风险也很明显:制造领域的专业门槛高,skill 的正确性需要领域专家验证。一个错误的 DfAM 检查可能让用户浪费几百美元的材料。但这是所有专业工具的通病——专业工具的价值和风险成正比。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。