论文: Akshay Balsubramani. Information on trajectories: martingales and random times. arXiv:2608.20337, 2026-08-20.
补漏四条:
- "尾部边界控制的量本身是一个相对熵,通过链式法则分解为每步条件散度"这条原帖讲得有点抽象,但实际是把三个经典不等式(Azuma-Hoeffding / PAC-Bayes / Ville / L^p)统一在一个变分恒等式下。原帖讲"得到了即使在任意随机时刻也成立的精确变分恒等式",但更深一层是:这条恒等式说明所有这些不等式都来自同一条"信息流"的链式分解——只是不同的松弛方向(Gibbs 倾斜 / 穿越本身 / 主导证书)对应不同的"丢失信息量"。这种统一视角的学术价值是把散落在不同子领域的不等式归并到同一棵"信息树"下,让研究生不用再各学一套独立体系。
- "Gibbs 倾斜对应 Azuma-Hoeffding 和 PAC-Bayes / 穿越本身对应 Ville 边界和汇聚检验 / 主导证书对应 L^p 极大"这条三组对应,揭示了一个深层结构:每个经典不等式都可以理解成"在某种概率度量下的最优松弛"。这意味着:如果你有新的浓度不等式需求,只需在 Bregman 散度空间里找"你要的是哪种倾斜"——这是从"经验技巧"换到"系统设计"。工程上这条范式能让你在做异常检测、模型监控、可信 ML 时,直接选合适的 Bregman 散度而非乱试参数。
- "在路径-时间空间上,同一恒等式增加了一个定价预期的因子:任意随机时刻携带一个 e-过程的「偷看惩罚」"这条原帖藏在最后一段,但工程价值最大。原帖讲"任意停止亏量逐步分解为运行最大值的 Bregman 散度"+"任意随机时刻携带一个 e-过程的偷看惩罚",意思是:在线学习中你"什么时候停止"这件事本身有信息论代价——你越频繁地"偷看"是否该停,代价越高。这条"偷看惩罚"给出了一个"何时该用 sequential test、何时该用 fixed-horizon test"的判据。工程团队做实时监控、A/B 测试停止规则、模型早停时,可以直接用 Bregman 散度计算"偷看代价",而不是用经验阈值。
- 与 e-process (Howard et al. 2021) 和 testing-by-betting (Waudby-Smith, Ramdas 2024) 的关系需要单独说。Balsubramani 这篇把"任意停止"+"任意随机时刻"两条独立的扩展都融进同一恒等式,等于把 e-process 从"safe testing"框架位移到"trajectory information"框架。这条位移的工程价值是:做实时决策时,你不再需要把"测试"和"停止"分开处理,可以用同一条 Bregman 散度同时评估"该不该停 + 当前信号有多强"。但代价是数学门槛更高——工程团队需要先学 Bregman 散度的几何,才能用上这套范式。