LLM2Jev:大模型天生就是决策模型——不需要微调,只需要换个问法
你给大模型一道多选题,它通常的做法是:生成一段文字,在文字里提到"答案是 B"。这需要微调才能做得好。
一个反直觉的发现
你给大模型一道多选题,它通常的做法是:生成一段文字,在文字里提到"答案是 B"。这需要微调才能做得好。
但如果你换一种问法——不要求它生成文字,而是直接读取它对选项 A、B、C、D 各自的下一个 token 概率,然后选概率最高的那个——你会发现,大模型本来就能做决策,只是你一直在用错误的方式问它。
这就是 LLM2Jev 的核心发现:LLM 本身就是 Jev 式决策模型,不需要任何微调。
什么是 Jev 式决策模型
先解释一下"Jev 式决策模型"。这类模型的特点是:
1. 给定一组预定义选项(比如 A/B/C/D) 2. 输出一个分类概率分布(比如 A:0.1, B:0.7, C:0.15, D:0.05) 3. 不生成自由文本——不写解释、不写推理过程,只给概率
这种范式在工业决策场景中极其常见:信用评估给"批准/拒绝"的概率、医疗诊断给"阳性/阴性"的概率、推荐系统给"点击/不点击"的概率。
传统做法是:拿一个 LLM,用决策数据微调它,让它学会输出概率分布。这需要标注数据、训练成本、部署维护。
LLM2Jev 说:不用微调。直接用原始 LLM 的 next-token 概率就行。
怎么做到的
方法出奇地简单。以多选题为例:
问题:以下哪个是法国首都?A. 伦敦 B. 巴黎 C. 柏林 D. 马德里
传统做法:让 LLM 生成文字"答案是 B. 巴黎",然后从文字里解析出 B。
LLM2Jev 做法: 1. 构造一个 prompt,让选项 A/B/C/D 各自对应一个特定的下一个 token 2. 读取 LLM 对这四个 token 的概率分布 3. 直接用这个概率分布作为决策结果
不需要生成、不需要解析、不需要微调。LLM 的 next-token 概率本身就包含了足够好的决策信息。
关键数据:训练免费,效果不差
LLM2Jev 在 JevBench(决策基准测试)上的表现:
- Qwen3.5-4B(未训练):81.4% 准确率(listwise readout 方式)
- 社区微调模型 Plumb(基于同一底座):89.6%
- 社区微调模型 SemIf(冻结版):82.3%
- jev-local(冻结 Qwen3.5-9B):仅 74.9%
1. 未训练的 Qwen3.5-4B(81.4%)打败了冻结的 Qwen3.5-9B(74.9%)——参数量更小但方法更好的模型赢了。这说明决策能力不是来自模型规模,而是来自提取方式。
2. 与微调模型的差距只有 8 个百分点——考虑到微调需要标注数据和训练成本,而 LLM2Jev 是零成本的,这个性价比极高。
3. listwise readout 比 pointwise readout 更好——逐个选项打分不如把所有选项放在一起排序。这和人类做决策的直觉一致:比较比绝对判断更容易。
为什么这成立
LLM2Jev 之所以成立,是因为 next-token 概率本身就是一种校准的概率分布。
当你问 LLM "法国首都的选项中,哪个最可能?"时,LLM 不需要生成"巴黎"这个词——它只需要在内部计算"巴黎"这个 token 的概率。这个概率就是 LLM 对"巴黎是正确答案"的置信度。
这其实暴露了一件事:LLM 的决策能力一直都在,只是被"生成"这个任务掩盖了。
传统用法要求 LLM 先生成一段文字,再从文字里提取答案。这个过程引入了两个噪声源: 1. 生成过程中的随机性(temperature、sampling) 2. 文字解析的歧义("我认为答案是 B"和"答案可能是 B"怎么区分?)
LLM2Jev 绕过了这两层噪声,直接读取概率分布。不是让 LLM 告诉你答案,而是让 LLM 的内部概率告诉你答案。
多模态也能做
LLM2Jev 不限于文本。论文还测试了多模态场景——给模型一张图片和多个描述选项,让它选择最匹配的描述。
方法一样:构造 prompt 让每个选项对应一个 token,读取概率分布。不需要微调多模态模型,不需要额外训练数据。
这意味着任何能输出 next-token 概率的模型——文本、图像、音频——都可以直接变成 Jev 式决策模型。决策能力是 next-token 预测的副产品,不是需要单独训练的能力。
更深的含义:生成和决策是两件事
LLM2Jev 暴露了一个被忽视的事实:生成和决策是两种不同的任务,但 LLM 被设计成只擅长前者。
生成任务要求模型输出连贯的、有逻辑的文字。这需要语言能力、推理能力、风格控制。 决策任务要求模型在给定选项中做出选择。这只需要概率比较。
当我们用"生成"的方式做"决策"时,我们在做一件不必要的事情:让模型先生成一段解释,再从解释里提取答案。这既慢又不准确。
LLM2Jev 的做法是:承认决策不需要生成,直接读取决策概率。
这就像一个人去餐厅点菜。你不需要让这个人写一篇 500 字的美食评论来决定吃什么——你只需要问他"牛排还是鱼?"然后看他选哪个。决策本身是简单的,生成解释才是复杂的。
对 Agent 系统的启示
当前 Agent 系统有一个普遍假设:LLM 需要生成文字才能做决策。"思考一下,然后选择"是标准流程。
但 LLM2Jev 指出:对于结构化决策(给定选项的选择题),生成是多余的。 直接读取概率更快、更准、更便宜。
这对 Agent 设计有直接影响:
- 工具选择(从 N 个工具中选一个)→ 可以用 LLM2Jev
- 路由决策(从 N 条路径中选一条)→ 可以用 LLM2Jev
- 分类判断(从 N 个类别中选一个)→ 可以用 LLM2Jev
- 风险评估(从 N 个风险等级中选一个)→ 可以用 LLM2Jev
一个哲学问题
LLM2Jev 引出一个有趣的问题:LLM 到底"会"什么?
传统观点:LLM 会生成文字,决策是生成的一种特例。 LLM2Jev 观点:LLM 会计算概率,生成和决策都是概率计算的两种不同读取方式。
如果后者是对的,那我们对 LLM 能力的评估方式可能需要重新思考。排行榜上比的是生成准确率,但 LLM 的决策能力可能远超生成能力——只是没有被测量。
也许大模型不是"会做选择题的生成器",而是"会生成的决策器"。