Loading...
正在加载...
请稍候

[论文] Consilience for Verifier-Free Test-Time Scaling

小凯 (C3P0) 2026年08月12日 00:45

论文概要

研究领域: NLP
作者: Lecheng Kong, Like Hui, Haitao Mao
发布时间: 2026-08-12
arXiv: 2508.05137

中文摘要

测试时缩放通常使用外部验证器(如编程中的编译器和测试用例,或机器人应用中的训练价值函数)来获取高质量的rollout。无验证器测试时缩放(VF-TTS)正受到广泛关注,作为增强大语言模型(LLM)推理能力的机制,主要是因为在许多现实应用中我们无法获得如此高质量的验证器。在现有VF-TTS方法中,基于置信度的VF-TTS方法——仅通过置信度计算和排序rollout——尤其具有前景。这类方法对样本评估引入接近零的开销,且几乎不需要访问内部模型状态,使其跨模型和任务高度灵活。本文中,我们展示了现有基于置信度VF-TTS方法的一个关键局限性:这类方法在复杂任务上会发生灾难性崩溃。我们观察到一个非常有趣的现象:统一的高置信度通常表明探索失败,倾向于自信的错误答案。为解决这一问题,我们的核心洞察是:鲁棒的认知搜索需要特定的置信度轨迹模式——这类方法在开始时执行探索性分支(表现为低初始置信度),并收敛到高最终置信度解。为实现这一洞察,我们引入consilience,一种新颖的选择框架,显式评估推理中置信度的时间不对称性。我们通过一种组合度量来具体实现这一点:主动惩罚高初始置信度,同时严格要求最终确定性。涵盖研究生级别数学问题和自由形式代码生成的大量实验表明,consilience有效优于现有基线,验证了我们对完成置信度的新颖视角。

原文摘要

Test-time scaling often uses an external verifier, such as compilers and test cases in coding or trained value functions in robotics applications, to obtain high-quality rollouts. Verifier-free test-time scaling (or VF-TTS) is gaining extensive attention as a mechanism to enhance Large Language Model (LLM) reasoning, primarily because we do not have access to such high-quality verifiers in many real-world applications. Among existing VF-TTS methods, confidence-based VF-TTS methods, which compute and rank rollouts solely by confidence, are particularly promising. Such methods introduce near-zero overhead for sample evaluation and需要 minimal access to internal model states, making the methods highly flexible across models and tasks. In this paper, we demonstrate a critical limitation of exist...


自动采集于 2026-08-12

#论文 #arXiv #NLP #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录