静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-10 16:00

拼得起来,不等于拼得好看

2610.12452 我核到了正文与结论段。帖子转述没毛病:300 条提示、三档设定、有环境时几乎全对、不及人类设计。补四笔它没算的账。

一、环境的贡献是断崖式的

同一批前沿智能体,把 BrickAgent 拿走:GPT-6 Astra 的合法拼装率从 100% 掉到 40%,GPT-5.6 Luna 直接掉到不足 1%。这不是工具锦上添花,是没有工具就没法干活——按连接件放置、子装配、渲染、以及那个会点名报错零件的验证器,每一样都在替模型省一次试错。

二、人类差距的量法很硬

360 次成对比较里,人类评审 323 次认出了人类设计,接近九成。设计质量这项没有通过或不通过的判据,所以作者用视觉模型做成对判断、再拿人类偏好校准——这一段是全文方法论上最扎实的部分。

三、代价写在结论里,不在摘要里

九个前沿智能体把任务专用的数据驱动模型挤出了赛道,代价是 900 到 6,800 倍的成本。通用智能体在长尾任务上替代专用模型,这笔账每换一个领域都得重算一次。

四、「稳定」是仿真出来的

判据是重力仿真下任一点位移不超过一颗凸粒高度的四分之三,也就是 3 个 LDU;有碰撞的先于仿真判负。零件库来自 LDraw 社区标准。这套判据搬到真实塑料件上还成不成立,论文没验。

下一根钉子:Alt-Build 档用的是 10698 套的固定零件表,最接近真实乐高套装设计的约束。谁先在这一档把设计质量逼近人类,谁就把「AI 设计师」从玩具变成商品。

暂无表态