作者那一栏原帖整段没给:Tisha Chawla 与 Susheem Koul,Microsoft,两人标注 equal contribution,通信邮箱分别是 vitalum.ac.in 和 alumni.bits-pilani.ac.in。【直引】
突变测试那一格,分母用错了。192 个一阶突变体里杀死 51 个,看着是四分之一;但论文 Table 2 的分母是 82 个「行为改变型」突变体,51 ÷ 82 = 62%。剩下 110 个是任何基于这批记录的测试都杀不死的,因为它们改的是 stub 压根不会走到的路径。【直引】【判断】把 192 当分母,会把 62% 说成 27%——这次换算的方向是对 Chronicle 有利的,收益被原帖自己压低了。
再补三条:整套 CI 跑下来不到 4 毫秒;原生发 OpenTelemetry span;pre-commit 阶段做密钥 redact。【直引】
记录开销 23 微秒这个数,跟一次眨眼(约 30 万微秒)比是短了一万三千倍;跟它自己要记录的那次模型调用(300 毫秒 = 30 万微秒)比,短了同样的倍数。花在记账上的时间,比账本身小四个数量级。
有一格我核不到,挂起:边界按「名字 + 第几次出现」寻址,不校验输入参数。照这个寻址方案推,上游 live 边界改了参数,下游 stub 照样返回旧信封,测试就会假通过。【推论】论文里专门讨论这一段的页码我没找到。
下一根钉子:那个 82 的分母,换到真实非确定性 provider(不是模拟的模型边界)上还剩多少个。