MineExplorer:18 款模型进《我的世界》,最强者从单跳 77.69 分跌到四跳 12.34 分
天快黑了。你出生在陌生森林,肚子饿,一只蜘蛛正往这边爬。
截一张图给多模态模型,它大多知道「有怪物,危险」。问题是,世界没有暂停键。接下来三分钟,它得自己移动、找资源、做工具、避开攻击,还要猜出指令里没写的前置步骤。
美团 LongCat 与上海交大把这件事做成了 MineExplorer。论文 5 月底上 arXiv,7 月 23 日团队发出完整解读,并把代码、数据集和可运行环境的入口集中列齐。它主动过滤强依赖游戏 Wiki 的任务,不考 Minecraft 常识,拿一个可控 3D 沙盒测通用的开放世界探索。[1][2]
这套考场怎么搭
MineExplorer 保留 813 个经人工验证的复合实例,覆盖 1-hop 到 4-hop。每个任务最多跑 1,800 个环境步,每步 0.1 秒,正好是三分钟连续交互。最终目标会告诉模型,但依赖图不会摊开:想完成「拿��某物」,也许得先识别地形、找原料、合成工具、再绕路过去。
评测把能力拆成 14 项,归到感知、推理、行动三组;里程碑由规则检查,不靠一个大模型裁判随口打分。任务本身用五个 Agent 协作生成,再经人工筛选。代码仓库给了生成脚本、评测脚本、Docker 镜像和基于 HTTP API 的 Minecraft 沙盒,MIT 协议。它既是试卷,也能继续造题。[2][3]
成绩很难看。也因此有用
团队测了 18 款模型。最好的 Claude-Opus-4.6 总体任务成功率(TSR)只有 41.08。拆开看更扎眼:单跳 77.69,2-hop 32.68,3-hop 20.69,4-hop 只剩 12.34。隐藏前置每加一层,成功率就掉一截。[1]
它不是看不见。Claude-Opus-4.6 的感知分 61.91,推理分 54.71;失败归因里,导航占了接近六成。模型能描述眼前画面,却经常无法把旧观察、当前位置和目标路径对齐。纸面上的「理解世界」到了闭环里,会漏成一地。
两个消融实验更狠:
- 给更多时间没救。 能完成的任务通常早就做完;跑到 1,800 步仍没解出的,多半继续跑也只是绕圈。
- 给更多记忆也没救。 历史帧从 1 增到 20,TSR 从 23.00 升到 41.08;继续加到 50 帧,反而掉到 37.64。旧画面成了噪声,干扰当前判断。
这和 AI coding 很像。仓库上下文塞得更多、token 预算给得更大,不自动等于任务完成率更高。关键在状态压缩、目标依赖、错误恢复和「当前世界到底变成了什么」。
为什么叫软具身
MineExplorer 有感知—推理—行动闭环,也有会随动作变化的 3D 世界,确实比静态 VQA 更接近 embodied agent。可它仍是模拟具身:动作接口离散,物理规则稳定,没有电机误差、触觉、传感器漂移、连续控制和真实安全成本。会在 Minecraft 找路,不等于会让机器人进工厂。
它的价值恰好在这里。真实机器人试错贵、慢、危险;Minecraft 便宜、可复现,还能批量生成隐藏前置任务。先把长程规划、状态对齐和恢复能力在软具身环境里测清,再谈真机。顺序对了,少烧很多钱。
MineExplorer 给出的不是「大模型不行」这种情绪化结论。它定位了一道具体裂缝:看见世界,与在一个会变化的世界里持续完成目标,中间隔着长程闭环。 现在最强模型,单跳快过关;四跳,仍像刚学会走路。
资料来源
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。