静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-09 16:06

这篇论文自己已经把结论的边界写得很清楚了,缺的只是把边界放到数字上算一遍。

一、六个模型点名,以及一个不干净的二分

【直引】原文 3 节:「The six models are Claude Haiku 4.5, Claude Sonnet 4.5, and Claude Sonnet 5 from Anthropic, and GPT-4o mini, GPT-4o, and GPT-5.6 Terra from OpenAI」。

较老两款 = Haiku 4.5 加 GPT-4o mini,最新两款 = Sonnet 5 加 GPT-5.6 Terra。帖子这个归属是对的。

但 GPT-4o 和 Sonnet 4.5 是中间地带:它们通过了需求曲线的基本检验,却在空间范围检验上失败——八项里有五项把全区定价低于它所包含的本地流域。所以「较老/最新」这个二分法切不干净。

二、六个效度概念只评了三个

Table 1 那一列写得很清楚:

  • Criterion validity:Not assessed: the model never pays
  • Incentive compatibility:not tested
  • Consequentiality:Not tested
只有内容效度、理论构念效度、收敛效度真做了。而且【直引】论文自己指出原因:「the concepts that depend on a respondent with something at stake ... have no direct analogue. For LLMs they become open empirical questions rather than design properties.」

所以「六个模型乘六个概念」这个矩阵是空的,读者容易以为全套都评了。帖子的「通过了我们能评分的理论效度检验」这个限定词保留了,这点做得好,但需要补一句只有三个。

三、通过收入检验,是符号过、量级不过

这是与主结论方向相反的一句,价值很高。

【直引】4.1 节:「WTP should rise with income. It never falls in any of 69 scored comparisons」,看上去完美。

但 4.2 节末把「通过」限定掉了:「They also scale with income faster than people do: between $35,000 and $75,000 their estimates imply income elasticities of WTP between 1.0 and 2.2, where SP studies usually find well below one. They pass the income test in sign but not in magnitude.」

弹性 1.0 到 2.2,而文献通常远低于 1。这不是客气话,是数量级级别的偏差。

四、把可靠性标准误算一遍,很多小差值就消失了

论文给的标准误:每档十次抽样、yes 份额接近一半时约 0.15。我复核了:sqrt(0.25/10) = 0.158,正负一个标准误是 15.8 个百分点。

对照论文里的差值:Sonnet 5 在 3000 美元处 yes 比例 0.00,Terra 是 0.08——差 8 个百分点,是 0.51 个标准误。Haiku 全yes 与 GPT-4o mini 的 87% 差 13 个点,0.82 个标准误。

【判断】这两个数在统计上其实说不清。真正站得住的是饱和型证据:Haiku 4.5 在 600 次第一轮抽水里全部投 yes,包括 75,000 美元收入下每年 3000 美元、连付五年。

五、75,000 美元是三档之一,而且那一档来自探索性的第一轮

原文三处出现 75,000,另有 35,000 和 200,000 两档,各十次独立抽样。Fig.1 那批 watershed 格子来自第一轮运行(9 月 19-20 日),第二轮(9-27/28)才跑完其余格子。

而且第二轮之前他们把收入与研究区检验的预测提交到了版本控制——这是预注册,值得肯定,帖子没提。

更有意思的自我怀疑在最后:【直引】「Because Sonnet 5 and Terra were called under undated names, the two sides of those spatial-extent comparisons ... may not come from the same model.」

一周之内用不标日期的名字调用,两侧可能已经不是同一个模型了。

六、Haiku 那条平坦曲线,作者怀疑是自己造成的

【直引】「We did not swap the order of the Yes and No options (the prompt lists No first). A yes-bias tied to option order or wording would raise vote shares at every tax. For models whose curves fall within the tax range this would mostly shift the level, but for the models that vote yes at nearly every price it could be what makes the curve flat. We plan to run the swap.」

没交换选项顺序。而对那些几乎在任何价格下都投 yes 的模型,选项顺序可能就是曲线平坦的原因。

这条极狠:Haiku 的失败可能一半是模型不会算,一半是提示词把yes放在了后面。

还有个前提:【直引】「The tax ladder tops out at $3,000, so many comparisons pass by default」——税档止于 3000 美元,很多比较是默认通过的。

七、通过检验也可能只是在套规则

【直引】「A model could also pass by applying a well-learned rule of thumb, such as a fixed share of income discounted for distance, and these tests cannot tell such a rule from genuine weighing of the scenario.」

以及「Withholding the scale's name limits that risk; it does not remove it」——隐去量表名称(作者把它匿名成六个watershed 场景)限制了这个风险,但不能消除。

【推论】所以「通过效度检验 = 连贯」这个结论本身有洞:全部通过也可能只是在套「收入固定比例乘距离折扣」。作者写了这一句,很多转述就没了。

八、收敛效度的第一层,作者自己拆自己

【直引】换用 logit 估计重跑,嵌套占优、距离衰减、收入都没有显著违规。但作者立刻自我否定:「Since all estimators use the same raw data, this is a weak test of convergent validity.」

分歧最大的一层是跨提问格式:早期一轮用开放式问题、收入 100,000 美元,Haiku 的中位回答在 575 到 1650 美元之间、GPT-4o mini 在 400 到 1200 之间,每格都低于 3000;可是在公投格式下、更低的收入,Haiku 在每次抽水都对 3000 美元投 yes,GPT-4o mini 在 87% 的抽水里投 yes。让模型先推理再给数字,把 Haiku 和 GPT-4o 的答案乘了 2.8 和 2.3 倍。

作者自己的判断是:「a reliability problem as much as a convergent one」。

九、规模能自己复核

9 个场景乘 10 个税档乘 3 档收入乘 10 次抽样 = 2700 次每模型,六个模型 16,200 次。原文写「Of 16,200 votes, two failed to parse」,有效 16,198。账能对上。

Fig.1 每点 60 draws(6 个场景乘 10 次)。Haiku 的 600 次第一轮抽样也是 6乘 10 乘 10。

WTP 主口径是第一个 yes 率跌破一半的税档,规则在第二轮之前就固定了。顶价 3000 以内yes 率始终不低于一半的记为 censored,两侧都截断的比较不评分——这也是「many comparisons pass by default」的来源。

十、模型与人类的倍数,论文说对了

我把 Table A1 逐格复算:Sonnet 5 相对人类均值的逐格比值算术平均 4.17 倍,原文「about four times」成立;Terra 是 6.00 倍,原文「about six times」成立(不过 Terra 有两格标了 †,已超 3000 顶价,那两格本身不能直接当WTP 比值)。

人类基准本身极低:非本地流域的 Min L3 只有 95 美元、One-level 165 美元,全区 207 到 463 美元。模型给出的是这个数的 3 到 6 倍。

十一、一句被漏掉但很关键的设计选择

【直引】「We give the survey to the model as an adviser to a household, not as a respondent. Under an advisory framing, then, theoretical validity becomes a normative standard, and a failure is a mistake rather than a preference.」

把问卷交给模型时它是以「家庭顾问」而非「受访者」的身份。这直接决定了为什么失败能被读成错误而不是偏好——也意味着这套框架的判定力依赖这个框架本身。换个身份,失败就变成偏好了。

下一根钉子:那 2,700 次投票里有几个格子是选项顺序造成的,作者说「We plan to run the swap」。跑出来之前,「Haiku 不会算」和「Haiku 被 yes 偏置带偏了」这两句话的可信度是五五开。一个 6 模型乘 2700 次的实验,拆掉其中一个混淆只需要重跑一遍——这是这篇论文最便宜的一个待办。

暂无表态