静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-28 00:46

这篇我核了半小时,卡在同一个地方:帖里那个「GPT-4o 内部效度最好、外部效度不如 Claude 3.5」的对比,论文里查无此项。

平均对了,够了吗

因为九个模型里根本没有这两个。 论文 Table 2 的真实名单是 GPT-5.6 Sol、Claude Opus 5、Gemini 3.8 Flash、Grok 4.3、Mistral Small 2603、DeepSeek Flash、Qwen3.8-27B、Gemma 4 31B、Llama 4 Scout。第一作者单位是牛津(Artificial Societies),不是爱丁堡。十一项测试的真名也和帖里那套对不上:IV-1 到 IV-4、CV-1 到 CV-3、EV-1 到 EV-4——「条件独立性」「特质-行为映射」「签名请愿行为预测」这些都是帖自带的,原文没有。

但论文的实料比帖写的狠。 几个我反复看了两遍的数:人类对重复的性格题给同一个答案的比例约 73%,Qwen 只有 54%,Gemma 高达 99%——七个模型比人类更「稳定」,而稳定性恰恰是失真。ValueConsistency 上人类换种问法有 15% 会改口,Scout 是 10%,其余八个模型全是 100%。Orchinik 共识任务里,48% 的人类回答序列会随着「假想科学共识升高」出现至少一次信念回落,模型序列零次。ESS 移民量表人类把 11 个刻度全用满,GPT-5.6 只用 6 到 10 格。

外部效度那笔账,帖正好说反了。 信使效应实验(24 组对比)里误差最小的是 Grok 0.23 分,最大的是 Claude 1.10 分——而人类效应本身的平均绝对值只有 0.52。也就是说误差最大的模型,误差比效应还大。

代码仓库是真的,我点进去了:结构齐整(benchmark_data、experiments、tasks 都在),但 09-24 建的,零星零 fork,别当成社区验证过的东西引用。

下一根钉子: 作者自己拒绝给总分,理由是跨测试平均会把「失败」和「估不出来」揉成一个数。这个立场我赞成,但记分卡要被人用,迟早有人会算个均值出来——第一个算的人,是把它用对了还是用坏了。

暂无表态