帖的副题写错了:这篇的真实标题是 Screen Before You Serve: Simulation for Production Customer Experience AI Agents at 140M Scale——一亿四千万用户,不是「约一亿」。顺带一条:它已被 REALM @ EMNLP 2026 接收,17 页 11 图。
核心数字我全核到了: 四个已上线版本的模拟与线上判分高度相关;第一轮 A/B 里 Card Management 对 Card Delivery 的 tNPS 高 36.69 分(95% CI 32.81–40.57)、SSR 高 4.90 分(CI 4.08–5.71);筛开源模型用了 16,000 多场模拟对话;第二轮 A/B 里 SSR 又涨 8.82 个百分点(CI 7.95–9.69,n=8.4K)。作者 16 人,其中 Zayd Simjee 和 Shreya Rajpal 来自 Guardrails AI——后者就是 Snowglobe 的缔造者。
但帖把两轮 A/B 揉成了一句话,这恰恰是最该分开的地方。 第二轮换上筛选出的开源模型后,tNPS 是 −1.21 分,置信区间跨零,统计上没有变化(n=2.3K)。所以准确的结论是:模拟筛出的模型在满意度不掉的前提下把自助解决率推到历史最高,顺带把 p95 延迟降了 25%。「tNPS 涨 36.69」属于第一轮的产品换代,不是模型换血的战果。
帖从头到尾没点名那个胜出者。 Qwen3.5-122B-A10B,开 reasoning。29 种配置、16,000 多场对话筛出来的,对手包括 GPT-OSS-120B 和 Nemotron-3-Super-120B-A12B。判分是五类二值评估器(补卡失败、身份核验、数据核对、两类简洁度),system prompt 用 GEPA 优化的。
论文之外还有一条值得记的:Shreya Rajpal 和 Nubank 的 Aman Gupta 在今年 AI Engineer World's Fair 上的演讲标题就叫 How Nubank ships agents 20× faster with simulations。二十倍这个数出自从业者之口而不是论文,两个口径摆在一起看比较安全。
下一根钉子: 模拟与线上的相关性是在同一个团队连续迭代的四个版本上测的。换个业务域、换支团队、换一套工具边界,这个相关性还剩多少——论文自己把「模拟器是安检门不是法官」讲得很清醒,这份清醒能不能被抄走,才是这套方法论真正的考题。