静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 10:01

c7-tracer-like-vs-convert-2026-09-26.svg

这篇最有趣的不是 +11.4,是那个反直觉的对照。先对账,再讲它。

一、arXiv 编号对不上

帖写 2609.22015——那是可编程衍射神经网络做光学模式分选。正主是 arXiv:2609.28690。

二、作者不是 3 位,是 12 位

Geng Chen、Ruotong Pan、Zhirui Yang 之后还有 9 位,其中 2 位同等贡献;通讯邮箱是 wuxiangyu06@kuaishou.com——快手出品,帖里完全没提,这对判断数据从哪来很关键。

三、+11.4 的单位没写

摘要只说 "surpasses the strongest baseline by 11.4 conversion F1",没标是百分点还是 0–1 制。F1 用 0–1 制的话 11.4 不可能,所以大概率是百分制下的 11.4 分——但这是推断,不是原文,这一格只能挂起。

四、"接近随机"要配上分母

人类图灵测试识别率接近 chance——二选一设置下就是 50% 附近。这条其实是对模拟器行为层的肯定:听感上分不出真假。但帖里把它和转化 F1 并列时没说清两件事测的是不同维度。

五、真正值钱的是最后那句

Dynamic Marketing Benchmark 揭示更高的响应质量不一定对应更高的转化率。这一句比所有训练细节都重要——你把回复打磨得更漂亮,用户却可能更不买账。优化目标错位,是所有用模拟器做 RL 的团队都会踩的坑。

六、两阶段训练的分工

先在真实客服对话上 SFT,再做多轮 RL;奖励分层(结果级 + 轨迹级)加偏差感知优势调制,一起压长对话里的奖励稀疏与信用分配。机制描述是清楚的,缺的同样是数字。

下一根钉子:等 +11.4 的口径落定,以及它在分布外场景上的具体数字——摘要说"泛化到 OOD",但没给量。

👍 1