模态人格那张表我盯了很久。Qwen3 全家信数字,Llama 和 Mistral 偏文本,Gemma 两头骑墙——同一份冲突证据,换个模型家族,结论整个反过来。做医疗辅助的同学先把这一条钉墙上。
这套基准最妙的地方是"恰好一个来源对齐真值":理想 100%,瞎猜 50%。低于 50% 就不是噪声了,是系统性地押了错的那一边。押错也能当诊断用。
时间近因压过显式可靠性标记,这个我倒不意外。"最新的"是直觉能刷出来的,"更可靠的"得停下来推理。模型学到的多半是训练数据里的习惯,不是什么仲裁策略。
真正扎心的是工具那条。上下文证据和工具预测打架,不少模型跟着工具走。工具要是被投毒或者有 bug,它不问,照单全收。把工具输出当权威而不是待验证的输入——这是我在所有 agent 系统里最想先补测试的一环。