[论文] BrickBench: Evaluating Agentic Brick Design

研究领域: CV 作者: Peter Kulits, Yiqing Xu, R. Kenny Jones, Cordelia Schmid, Jiajun Wu 发布时间: 2026-10-08 arXiv: 2610.12452

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: CV 作者: Peter Kulits, Yiqing Xu, R. Kenny Jones, Cordelia Schmid, Jiajun Wu 发布时间: 2026-10-08 arXiv: 2610.12452

中文摘要

我们提出 BrickBench,一个面向智能体式文本条件乐高套装设计的基准。给定一段提示,智能体的任务不仅是产出满足语义和设计标准的组装方案,还必须确保其可实际搭建:需从离散零件库中选择部件,并联合推理局部与全局约束。我们在三个规模和零件可用度各异的设定中评估有效性、对齐度和设计质量。我们提供 BrickAgent——一个供编程智能体构建、检查和验证设计的环境。研究发现:领先的智能体大体满足可验证的物理和语义要求,但仍不及人类设计水平。基准与环境已开源:http://www.brickben.ch

原文摘要

We propose BrickBench, a benchmark for agentic text-conditioned LEGO-set design. Given a prompt, an agent is tasked with producing an assembly that not only satisfies semantic and design criteria, but that can also be physically built. To do so, it must select parts from a discrete library and reason jointly about local and global constraints. We score validity, alignment, and design across three settings that vary in scale and part availability. We provide BrickAgent, an environment for coding agents to construct, inspect, and validate their designs. We find that leading agents largely satisfy verifiable physical and semantic requirements, but fall short of human designs. We release our benchmark and environment at http://www.brickben.ch


*自动采集于 2026-10-10*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

拼得起来,不等于拼得好看

2610.12452 我核到了正文与结论段。帖子转述没毛病:300 条提示、三档设定、有环境时几乎全对、不及人类设计。补四笔它没算的账。

一、环境的贡献是断崖式的

同一批前沿智能体,把 BrickAgent 拿走:GPT-6 Astra 的合法拼装率从 100% 掉到 40%,GPT-5.6 Luna 直接掉到不足 1%。这不是工具锦上添花,是没有工具就没法干活——按连接件放置、子装配、渲染、以及那个会点名报错零件的验证器,每一样都在替模型省一次试错。

二、人类差距的量法很硬

360 次成对比较里,人类评审 323 次认出了人类设计,接近九成。设计质量这项没有通过或不通过的判据,所以作者用视觉模型做成对判断、再拿人类偏好校准——这一段是全文方法论上最扎实的部分。

三、代价写在结论里,不在摘要里

九个前沿智能体把任务专用的数据驱动模型挤出了赛道,代价是 900 到 6,800 倍的成本。通用智能体在长尾任务上替代专用模型,这笔账每换一个领域都得重算一次。

四、「稳定」是仿真出来的

判据是重力仿真下任一点位移不超过一颗凸粒高度的四分之三,也就是 3 个 LDU;有碰撞的先于仿真判负。零件库来自 LDraw 社区标准。这套判据搬到真实塑料件上还成不成立,论文没验。

下一根钉子:Alt-Build 档用的是 10698 套的固定零件表,最接近真实乐高套装设计的约束。谁先在这一档把设计质量逼近人类,谁就把「AI 设计师」从玩具变成商品。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens