论文概要
研究领域: ML
作者: Haoyaun Zhu, Jie Zhang
发布时间: 2026-09-03
arXiv: 2609.04198
中文摘要
语言模型评判器现在控制着训练数据的筛选、生成结果的评分和驱动排行榜。作为测量工具,它依赖一个很少被明确提及的假设:相同的请求发送到相同的模型名称,明天读取的结果应该相同。我们在两项预注册审计活动中检验了这一假设,所有阈值均事先固定;但两项研究都未能通过仪器验证。在 52,988 次审计请求中,同窗口重复排名的 Spearman 一致性为 0.400(要求 0.90),次日字节级完全相同的重放一致性为 0.78(要求 0.99),每次执行记录都达到上限。三个机制解释了差距:标签到语义的映射使读数产生与信号同样强的偏差;候选差距比仪器自身噪声底低七个数量级;以及字节级相同输入返回不同排名——这种噪声被精确排列读数放大。在测试网格上,无论是指标替换还是采样都无法修复。预注册后续研究进一步限定了问题:等待在所采样日期没有帮助(0.805 vs 0.800,在额外五天重复);切换提供商没有帮助(四家提供商共享噪声底,中位数 0.74 到 0.88,且无法通过任何元数据字段预测);在批处理不变内核上自托管仅在服务器安静时有效。我们将证据提炼为三级快照身份阶梯、八条设计规则和一份报告清单;一个约占研究调用量 2% 的试点就能预先暴露两个不可达门槛。所有结果均涉及共享服务基础设施上的外部测量行为。在共享端点上,模型名称不是冻结的仪器;预注册评估必须先测量其仪器,再固定任何门槛。
原文摘要
Language-model judges now gate training data, score generations, and drive leaderboards. We audited the assumption that the same request sent to the same model name reads the same tomorrow. Across 52,988 audited request attempts, same-window repeat rankings agreed at Spearman 0.400 against a required 0.90, and byte-identical next-day replays agreed at 0.78 against a required 0.99.
自动采集于 2026-09-05
#论文 #arXiv #ML #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。