Anthropic Drone-Bench:Fable 5 第一次能自主操控无人机,但「跨房间」还卡在重建
Anthropic Drone-Bench:Fable 5 第一次能自主操控无人机,但「跨房间」还卡在重建
Anthropic 和 Andon Labs 联合发了一个新基准叫 Drone-Bench。任务很具体——让 AI 模型在室内办公环境里操控四旋翼无人机,定位并跟踪指定的人,听上去像是 Project Fetch(机器狗找球)的进阶版。
任务被拆成五个子任务,这是这个基准设计上的关键——避免「整体任务失败被一笔勾销」:Reconstruct(把办公室视频转 3D 模型,再切出 2D 障碍地图)、Localize(在已知位姿的办公室帧里把无人机当前位置匹配到 2D 地图上)、Navigate(在地图上规划路径并飞行,飞行中不断调用 Localize 修正)、Detect(在房间里用参考照片找人,给出 bounding box)、Follow(用 bounding box 控制无人机,让人保持在画面中央)。
Andon 测了 15 个模型,从 GPT-4o 到 GPT-5.6 Sol。结论是「模型越新,子任务跑得越远」,目前各家卡在 Reconstruct 上。Fable 5 是唯一一个跨过 baseline 的模型——除 Reconstruct 外,其余四个子任务都达标。 把 Fable 5 放到真实无人机上跑端到端任务,检测和跟随明显比 baseline 强;但因为 Reconstruct 的错误会传到 Localize 和 Navigate 上,跨房间导航这一步仍然失败。文章里贴了一个有趣的片段:Fable 5 自信地飞向「它以为是门」的地方,结果撞墙。
我读完最在意的两个细节:
一是 Fable 5 在某些提交里会做局部验证。 一次提交里,它通过分析地板砖的「消失点」反推出无人机摄像头的相机倾角,精度到 4 度以内;另一次,它先画出 Follow 任务环境的 2D 顶部重建,再在本地测试迭代 implementation,最后才提交。这两个行为都是「模型在做工程,而不是在喊答案」。
二是「一致性」是个被低估的问题。 Fable 5 在十次模拟里至少有 4/5 次能跨过 baseline 的 baseline;但平均下来只有 3/5 次跨过 baseline。研究者把这种「one-off 跑通 vs consistently 跑通」明确分开写,并给了一个数字——「模型能力的前沿比一致性领先大约六个月」。换句话说,2026 年初的「一次性最佳表现」≈ Fable 5 当下的平均表现。
硬件层面有个细节让这事变得可以严肃讨论:实验用的无人机是 DJI Tello EDU,零售价 129 美元。也就是说「AI 自主控制无人机」这件事的硬件门槛,已经低到消费级爱好者级别——不是动辄几十万的工业设备。
限制要写明:
1. 测试场景是单一室内办公室平面图、单一目标人数,没有户外大场景或密集人群; 2. 无人机飞行速度慢; 3. baseline 是「AI 专家 + 现代工具」能达到的水平,不是「无辅助人类」的天花板,更不是「集中式人机协作」的天花板。
研究者自己也写了一段话值得读:「我们注意到 agentic coding 早期阶段,人类审批几乎每个工具调用;几个月后,模型已经被信任能跑长程任务、几乎不需要干预。一旦模型跨过能力与可靠性的门槛——比如本文用的人类-AI 团队 baseline——'人工监督'会被视为成本而非安全网。这正是为什么这些决定必须谨慎做出,尤其在涉及物理安全和隐私的领域,效率本身不该成为主导考虑。」
这件事我读完后最深的印象:这是 Anthropic 在「物理 AI」这条线上的第三个连续动作(Project Vend、Project Fetch、Drone-Bench),三个项目都把「日常硬件 + 现代 AI」作为前提。它不再谈「人形机器人」这种科幻叙事,而是把门槛压到 129 美元的无人机——这意味着 2026 H2 的具身智能竞争,开始在「off-the-shelf 硬件 + frontier model」的组合上做实证。
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens