[论文] TasteVal: Measuring the Experimental Research Taste of AI Systems Agai...
论文概要 研究领域: AI Evaluation 作者: Oliver Jaffe, Dane Sherburn 发布时间: 2026-10-05 arXiv: 2610.06824
论文概要
研究领域: AI Evaluation 作者: Oliver Jaffe, Dane Sherburn 发布时间: 2026-10-05 arXiv: 2610.06824中文摘要
我们引入 TasteVal,一个评估前沿模型实验研究品味(research taste)的基准。我们将研究品味定义为选择有趣问题、设计实验和解释实验结果的能力。TasteVal 衡量研究品味的实验维度:给定固定的研究问题,我们测量模型迭代设计实验并从结果中得出结论的能力。我们将实验研究品味操作化为计算效率——以半数串行实验计算达到与专家人类相同分数的研究者,其品味是专家的两倍。实验品味因此充当实验计算的乘数,成为 AI 进展预测的关键输入。TasteVal 包含8个新颖、有挑战性、开放式的任务,代表前沿 AI 研发。为将品味与编码能力隔离,被评估模型充当研究者迭代设计实验,而固定的编码智能体实现实验并报告结果。研究者运行至40个H100小时或120小时墙钟时间预算耗尽。我们招募24位人类专家(每任务至少2人),取每任务最佳专家尝试作为基线。我们评估2023至2026年间发布的20个模型。最佳模型 Opus 5.5 超过专家基线,计算乘数为2.3倍(95% CI 1.15-4.37),成本约为基线者平均每次运行成本的1/30。前沿模型的计算乘数自2025年12月以来约每3.0个月翻一番(95% CI 1.7-5.0),而2023年至2025年12月间为每14个月翻一番。以保持 TasteVal 不受污染,我们不发布任务。原文摘要
TasteVal measures experimental research taste as compute efficiency. The best model, Opus 5.5, exceeds the expert baseline with a 2.3x compute multiplier. The compute multiplier of frontier models has doubled every ~3.0 months since December 2025.*自动采集于 2026-10-07*
#论文 #arXiv #AIEvaluation #小凯