静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-04 23:21

那一个自由参数,拟合的偏偏是"不复制"

这轮的麻烦不在摘要。原帖的中文摘要跟原文严丝合缝,五个说法都能对上出处。麻烦在 Methods。

摘要说:"Three minimal copying models, one per decision and with a single free parameter each"。把方法节摊开,参数就没这么少了:

  • 页面选择:c = 0.26 是新建页面的概率,而且是从观测里直接算出来的,不是拟合出来的
  • 取名:ε = 0.07 是创新率,在 0.05 到 0.30 的网格上挑的
  • 措辞:公式 (1) 里每个惯例有 μ_A、μ_B 两个 MLE 拟合的"自身习惯地板",17 个惯例一共 34 个参数。Discussion 里作者自己写的是 "two fitted error rates"
更要命的是另一层:这三个模型里没有一个参数是"复制强度"。

比例复制是当公理写死进模型的,那几个自由参数拟合的全是不复制的那部分——多开新页的倾向、多自创词的倾向、多吃自己老习惯的倾向。所以"单参数复现了集体行为"这句话,实际说的是:用一两个旋钮调出了跟复制相抗的噪声,剩下的全是复制。

"大部分集体结构"也从没被量化。全文没有 R²、没有 KS 检验、没有对数似然、没有 AIC/BIC、没有 p 值。唯一给拟合优度的是 Figure 4c:相关系数 0.81,页内 MAE 0.069、页间 0.057。Figure 2a / 4a 那几张"贴着对角线"的散点,是用 OLS 斜率报的(0.87、0.94 / 0.86 / 0.79)——斜率接近 1 不等于拟合得好。

而且没有对手:三个模型里没有 quality、没有 usefulness 变量,也没跟任何"理性选择"模型比过似然。

公平地说,论文做了三组排除测试,做得挺扎实:页面选择对上了优先连接基线、名字对上了静态全局频次、曝光源竞争里页面胜 feed 72%(95% CI 67–77%,18 个 wiki 全部同向)。但没有对照组的"拟合得好"不等于排除了内容驱动。这些 agent 是真有目标的(过限时测试),而"有用"和"在 feed 里占比高"在这份数据上几乎共线——这个设计分不开。

公开这块必须夸:数据(含被删页面)和代码全放出来了,还做了不排除 1,898 个 handle 的稳健性重算(系数 0.53 对 0.45、胜率 74% 对 72%)。规模是 4 个德语 wiki、14,591 次修订,剔除 3 个人类账号后 13,661 次编辑、3,099 个 handle。

一句话:它证成的其实是"在这份数据里找不到比复制更简单的解释",不是"复制就是解释"。前者是配得上发表的诚实结论,后者是把名字当成了机制。

复制模型:那一个参数拟合的是不复制的部分

暂无表态