[论文] GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
研究领域: CV 作者: Yiran Wang, Xingyilang Yin, Junfu Pu, Guangzhi Wang, Kaifeng Li, Mingyu Ouyang, Huiqiang Sun, Lingen Li, Cheng Cheng, Wangbo Yu, Honghao Chen, Xia…
论文概要
研究领域: CV 作者: Yiran Wang, Xingyilang Yin, Junfu Pu, Guangzhi Wang, Kaifeng Li, Mingyu Ouyang, Huiqiang Sun, Lingen Li, Cheng Cheng, Wangbo Yu, Honghao Chen, Xiaodong Cun, Chi-Man Pun, Zhiguo Cao, Ying Shan 发布时间: 2026-09-21 arXiv: 2609.25001
中文摘要
现代电子游戏为 AI 模型提供了一个可量化的试验场,涵盖了视觉理解、指令分解、目标规划和跨多时间尺度的精确动作控制等综合能力。然而,现有数据集和基准测试要么覆盖的游戏范围狭窄,要么缺乏语言指令,要么依赖高方差的在线交互评估。为此,我们推出了 GameHorizon——一个统一的数据与评估套件,用于衡量不同模型家族在不同时间尺度上的游戏能力。GameHorizon Suite 包含三个组件:其一,GameHorizon-Annotator 是一个可扩展的自动化多时间尺度指令标注流水线;其二,基于该流水线构建了 GameHorizon-Data——首个大规模 AAA 级游戏数据集,包含时间对齐的视频、玩家操作和多时间尺度指令,涵盖 21 款游戏的 5,000 小时录制数据,由 100 名人类专家玩家采集;其三,GameHorizon-Bench 提供可复现的离线和分步在线测试。离线赛道通过数千道标准化问题进行可复现评估,涵盖三大核心任务及一系列诊断变体;在线赛道则检验离线分数能否反映实际游戏能力,并将失败定位到长程游戏中的具体步骤。基于 GameHorizon Suite,我们通过超过一百万次模型调用评估了 47 个模型,揭示了任务难度的层次结构以及模型能力之间的显著差异。我们的工作可为跨时间尺度和模型家族的游戏能力评估提供标准化标尺。我们将开源数据集、标注器和基准测试以促进未来研究。
原文摘要
Modern video games provide a measurable testbed for AI models, combining abilities of visual understanding, instruction decomposition, goal planning, and precise action control over multiple temporal horizons. Existing datasets and benchmarks, however, either cover a narrow range of games, lack language instructions, or rely on high-variance online rollouts. To address these challenges, we introduce GameHorizon, a unified data and evaluation suite that measures gameplay capabilities at different horizons for diverse model families. GameHorizon Suite consists of three components. First, GameHorizon-Annotator is a scalable and automated annotation pipeline for multi-horizon instructions. Second, utilizing the pipeline, we construct GameHorizon-Data, the first large-scale AAA gameplay dataset...
*自动采集于 2026-09-23*
#论文 #arXiv #CV #小凯