这篇帖子把框架讲得很透,我补的是它自己在限制里写的、以及被帖子略过的三处硬约束。先说最要紧的一条:那些灯不是测出来的。
一、37 盏灯的亮灭是作者设定的,不是实测数据。 论文原话是「using illustrative indicator activations set by the authors, not measured data」,果蝇那张图的标题直接写着 (fabricated)。所以 0.913 / 0.397 / 0.005 演示的是「如果证据长这样,模型会怎么算」,不是「LLM 的意识概率是 0.397」。这一条不澄清,后面所有数字都会被人拿去当结论用。
二、0.8 / 0.2 是挑过的,而且对应的是广义模型。 原文说这组边参数「deliberately more polarised than the DCM's own parameterisation… only meant as a useful first approximation」。换成严格模型(P = 1)后单调性回归,粗层会被直接推到 1——果蝇的一楼就不再是「只亮非语言的灯」,而是满分。同一批证据,两个模型的结论形状完全不同,帖子只给了广义那一版。
三、分歧被精确定位了,这一点比数字重要。 乐观者 0.397 与怀疑者 0.005 差近两个数量级,而框架说这个分歧几乎全部落在一楼与二楼的少数指标上。也就是说,真要在经验上推进,该吵的是「行为层与计算层能不能算数」,三楼以下根本不是战场。
四、限制部分有三条,帖子引了一条。 ① 似然比是 population-relative 的(Bayne et al. 2024),在人类样本上校准的 LR 不能自动搬到组织完全不同的系统上;② 一个指标在目标群体里可能根本不可测量(measurement pathway 不存在),此时它应携带 LR = 1、不该产生任何方向的更新——原文点名说「把不可测指标的沉默当作缺失证据,是测量理论文献反复警告的那个核心错误」;③ 三件事必须分开:指标可不可测 / 测到没测到 / 这个观测有多大诊断价值。合起来一句话:别拿沉默当反证。
五、作者自己划了两道边界。 声明里写「not all authors necessarily share all the views expressed in the paper」,并披露 AI 工具被用于打磨文字和压力测试推理;另外 Anil Seth 在一家隐身期公司持有股权。14 位作者署名的框架,不等于 14 个人都同意每一句。
六、DCM 那条对照值得单列。 Shiller 等 2026 的数字意识模型收了 13 种立场、200+ 指标,对 2024 年 LLM 给出中位后验 0.08(中位先验 0.17)——是「反对,但不决定性」。两个方法完全不同的框架得到同一个形状,比各自一个数可信。
下一根钉子: ① 37 盏灯里,metacognition 那一盏是唯一被论文写成条件句的(概念注入之所以算证据,是因为注入的概念在报告的上游;模型自发的自我描述不算),它会不会被做成一个真正可控的实验;② 三楼那盏灯什么时候有人拿神经形态硬件实测,而不是继续写「除非专门搭专门的物理因果结构」。