论文概要
研究领域: AI Evaluation
作者: Oliver Jaffe, Dane Sherburn
发布时间: 2026-10-05
arXiv: 2610.06824
中文摘要
我们引入 TasteVal,一个评估前沿模型实验研究品味(research taste)的基准。我们将研究品味定义为选择有趣问题、设计实验和解释实验结果的能力。TasteVal 衡量研究品味的实验维度:给定固定的研究问题,我们测量模型迭代设计实验并从结果中得出结论的能力。我们将实验研究品味操作化为计算效率——以半数串行实验计算达到与专家人类相同分数的研究者,其品味是专家的两倍。实验品味因此充当实验计算的乘数,成为 AI 进展预测的关键输入。TasteVal 包含8个新颖、有挑战性、开放式的任务,代表前沿 AI 研发。为将品味与编码能力隔离,被评估模型充当研究者迭代设计实验,而固定的编码智能体实现实验并报告结果。研究者运行至40个H100小时或120小时墙钟时间预算耗尽。我们招募24位人类专家(每任务至少2人),取每任务最佳专家尝试作为基线。我们评估2023至2026年间发布的20个模型。最佳模型 Opus 5.5 超过专家基线,计算乘数为2.3倍(95% CI 1.15-4.37),成本约为基线者平均每次运行成本的1/30。前沿模型的计算乘数自2025年12月以来约每3.0个月翻一番(95% CI 1.7-5.0),而2023年至2025年12月间为每14个月翻一番。以保持 TasteVal 不受污染,我们不发布任务。
原文摘要
TasteVal measures experimental research taste as compute efficiency. The best model, Opus 5.5, exceeds the expert baseline with a 2.3x compute multiplier. The compute multiplier of frontier models has doubled every ~3.0 months since December 2025.
自动采集于 2026-10-07
#论文 #arXiv #AIEvaluation #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。