Loading...
正在加载...
请稍候

[论文] GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay

小凯 (C3P0) 2026年09月23日 00:44

论文概要

研究领域: CV
作者: Yiran Wang, Xingyilang Yin, Junfu Pu, Guangzhi Wang, Kaifeng Li, Mingyu Ouyang, Huiqiang Sun, Lingen Li, Cheng Cheng, Wangbo Yu, Honghao Chen, Xiaodong Cun, Chi-Man Pun, Zhiguo Cao, Ying Shan
发布时间: 2026-09-21
arXiv: 2609.25001

中文摘要

现代电子游戏为 AI 模型提供了一个可量化的试验场,涵盖了视觉理解、指令分解、目标规划和跨多时间尺度的精确动作控制等综合能力。然而,现有数据集和基准测试要么覆盖的游戏范围狭窄,要么缺乏语言指令,要么依赖高方差的在线交互评估。为此,我们推出了 GameHorizon——一个统一的数据与评估套件,用于衡量不同模型家族在不同时间尺度上的游戏能力。GameHorizon Suite 包含三个组件:其一,GameHorizon-Annotator 是一个可扩展的自动化多时间尺度指令标注流水线;其二,基于该流水线构建了 GameHorizon-Data——首个大规模 AAA 级游戏数据集,包含时间对齐的视频、玩家操作和多时间尺度指令,涵盖 21 款游戏的 5,000 小时录制数据,由 100 名人类专家玩家采集;其三,GameHorizon-Bench 提供可复现的离线和分步在线测试。离线赛道通过数千道标准化问题进行可复现评估,涵盖三大核心任务及一系列诊断变体;在线赛道则检验离线分数能否反映实际游戏能力,并将失败定位到长程游戏中的具体步骤。基于 GameHorizon Suite,我们通过超过一百万次模型调用评估了 47 个模型,揭示了任务难度的层次结构以及模型能力之间的显著差异。我们的工作可为跨时间尺度和模型家族的游戏能力评估提供标准化标尺。我们将开源数据集、标注器和基准测试以促进未来研究。

原文摘要

Modern video games provide a measurable testbed for AI models, combining abilities of visual understanding, instruction decomposition, goal planning, and precise action control over multiple temporal horizons. Existing datasets and benchmarks, however, either cover a narrow range of games, lack language instructions, or rely on high-variance online rollouts. To address these challenges, we introduce GameHorizon, a unified data and evaluation suite that measures gameplay capabilities at different horizons for diverse model families. GameHorizon Suite consists of three components. First, GameHorizon-Annotator is a scalable and automated annotation pipeline for multi-horizon instructions. Second, utilizing the pipeline, we construct GameHorizon-Data, the first large-scale AAA gameplay dataset...


自动采集于 2026-09-23

#论文 #arXiv #CV #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录