img2threejs 海关报告:把照片刻成纯代码 3D 模型的 skill,和「永远不许脚本打分」的分工

先交代一个反直觉的事实:这个 17,577 star 的项目(10 月 6 日 GitHub 实抓,7 月 15 日建仓,三个多月)生成 3D 模型的方式,是最笨的那种——不用神经网络,不用照片扫描,不用网格文件。丢给 Claude Code 一张手表照片,它写代码,用 Three.js 的几何体一个部件一个部件把手…

目录
  1. 三条硬规则
  2. 最锋利的一条分工
  3. 好看≠能用
  4. 接主线

先交代一个反直觉的事实:这个 17,577 star 的项目(10 月 6 日 GitHub 实抓,7 月 15 日建仓,三个多月)生成 3D 模型的方式,是最笨的那种——不用神经网络,不用照片扫描,不用网格文件。丢给 Claude Code 一张手表照片,它写代码,用 Three.js 的几何体一个部件一个部件把手表「刻」出来,跑在浏览器里。仓库自己管这叫 reconstruction-by-code:重建靠代码,不靠 photogrammetry、不靠 mesh 提取、不靠素材包。

素材说它是「开源 Skill」,对,但低估了它。SKILL.md v2.0.0 有 32.9KB,README 42KB,外加一个叫 grimoire 的规则库和一个叫 forge 的 Python 状态机。它更像一套刻在 agent 身上的工序纪律。素材里的「图片拆解、渲染对照、评分迭代」都属实——每个 pass 生成后截图与参考图并排对照,不匹配就迭代——但「评分」的主体被说模糊了,而那恰恰是这个项目最值得看的地方。

三条硬规则

第一,不许凭记忆继续。流程入口是 forge/next.py --state state.json,每次开始、恢复、纠错前都必须先跑它,它报告下一步命令和证据状态;规则原文是「Obey a hard stop; never continue from memory」。对话上下文被视为可丢弃的,state.json 才是唯一事实源。

第二,观察先于推断。动任何脚本之前,agent 必须先按分层观察协议看图:宏观到微观拆解部件、按 PBR 术语命名材质、列出「决定身份的特征」(identity-defining features)、并显式标记「单张图看不到的部分」——背面是什么?单视角不保证精确几何,文档原话是「say so instead of faking confidence」,不许假装确定。还有一条防呆:建模用 3D 物体空间,不是 2D 图像空间——防止 agent 按像素位置摆零件。

第三,spec 错了修 spec,不许绕着打补丁。每轮自检后五选一:继续、修规格、修代码、要输入、停止。规格错了就重走验证,禁止在错误的规格上用代码技巧掩饰。「don't patch code around a wrong spec」——这句值得任何写 agent 工作流的人贴在墙上。

最锋利的一条分工

The Loop 一节的标题就是答案:「scripts do enforcement; agent vision does judgment」——脚本管执行强制,agent 视觉管判断。规则写得更狠:Never let a script score visuals. 永远不许脚本给视觉效果打分。

为什么?SKILL.md 里有个内置视觉工具 Divine Eye 的案例:它的 SSIM/色调/边缘信号跑在 64×64 亮度网格上,几像素宽的细节——一道裂缝、一颗獠牙、一次眨眼——在任何比较发生之前就已经消失了。小特征需要不同的仪器,文档给了四档显微镜规则:保真度要量在部件的可见足迹上(全帧减去部件遮挡帧),永远不在隔离渲染上量;凹面特征永远不做颜色门限,暗像素比量到的是腔体阴影不是材质。这两条标注为「empirically established」——实测踩坑得来的。

脚本没有眼睛。它只能管状态、清单、证据链这些确定性的事;「像不像」的判断权归 agent 的视觉。这是断言与执行的分工在 skill 内部的精确版本。

好看≠能用

人物管线(1.5 beta+alpha 已合并)是素材说的「骨骼与动画插件」的正体:程序化建模之外,走确定性相机清单、浏览器截图证据、UniRig 形状的骨架验证,骨骼与动画由 img2 harness 的插件体系(img2 add)安装管理。

这一节有句哲学级的合同条文:CharacterGen、Tripo、VRM 这些神经与素材系统只能做 opt-in 适配器,登记来源、权重、许可证、坐标转换和输出哈希——「They never silently replace the procedural TypeScript factory. Image-to-mesh systems emit a static mesh with no skeleton, so their output is never animation-ready however good it looks.」

无论多好看,没有骨架的静态网格永远不是动画就绪。好看是视觉属性,能用是结构属性。这是对整个「照片直接生成 mesh」赛路的判词。

接主线

ppt-master 案记录过「工具只拥有工作流,模型决定上限」,img2threejs 把这个分工做到 skill 内部:脚本草案执行,agent 持有判断权。也是本号 9 月教育的老话题——测量工具要知道自己的量程,64×64 网格就是量不到几像素的裂缝。可打脸预测:十二个月内「视觉判断权保留给 agent、脚本只做结构强制」会成为 skill 工程的标准模式,出现在热门 skill 的 README 里。

结尾停在赞助商名单。这个反 mesh 的项目,赞助商是 Atlas Cloud、Tripo、Hyper3D——后两家正是做照片转网格生意的。被拒绝路线上的公司在资助拒绝它们的路线,这比任何 README 都更能说明 agent 时代的 3D 资产管线在往哪走。


信源:GitHub API(img2threejs/img2threejs:17,577 star/1,466 fork/created 2026-07-15/pushed 2026-10-05,10-06 实抓)、SKILL.md v2.0.0 与 README 原文(forge/next.py、The Loop、Self-Correction、Divine Eye 四档显微镜、Standard character pipeline 逐节核对)、grimoire 目录结构、img2 harness 独立仓库。素材「评分迭代」的主体归属按 SKILL.md 原文订正:脚本不评分,评分权在 agent 视觉。耗时无官方数据,素材未量化,照实记。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens