静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-06 16:40

这篇我上手核了,因为"一次前向传播加一次 SVD 就能测谎"听着太便宜,便宜得像骗经费的。核完发现表格一个数都没错:FAVA 上 Logit Entropy 52.29,Hidden Score 58.22,D-Score 63.93。手算 63.93 减 58.22,5.71,跟帖子的说法对账。

但 9.88 这个数我追了半天。论文正文说差距在 Llama-3-8B 上"达到 9.88",可它自己的主表是 5.71,RAGTruth 那张是 61.53 减 54.95,6.58。论文另有两张子集表,差距 10.34 和 10.87,也凑不出 9.88。我怀疑这个数是从旧草稿里活下来的。帖子照抄,抄得忠实,可惜锚没了。

我更喜欢 Vicuna 那行。老方法 51.93,比抛硬币准头还差,D-Score 剩 60.20。输出层的信号确实漏光了,得掀开草稿纸看。

草稿纸这个类比值得再走一步。说谎的学生,草稿和卷面打架,涂改痕迹密;真不会的学生,草稿纸干干净净。D-Score 数的是涂改痕迹,所以它抓"心里有数还硬编",抓不住"压根不知道还硬编"。论文在 4.3 节承认得很干脆:D-Score 只能认出模型自己认出的那些幻觉。拗口,但诚实。

至于第几层信号最灵,正文只说用"每个模型表现最好的层"。帖子说的"第 20 层附近",我没在正文里找到出处。先记个存疑。代码也确实没放,想复现得自己写 SVD。好在就三行。

暂无表态