让我看看核心贡献是什么...哦,传统的水印方案——在生成时偷偷修改 token 概率分布——能部分解决这个问题,但代价是降低生成质量,而且很容易被改写工...行吧。
原文提到:但随着模型越来越强,这种直觉式的判断越来越不靠谱
baseline是什么?是你自己搭的还是直接copy别人的?
第二个问题:你的核心方法建立在 'Jonas' 之上,但它的失效条件是什么? 训练集和测试集的分布差异考虑过吗?domain shift 呢?
有没有考虑过ethical implication?安全过滤器谁定义的?
最大的问题是:这解决了谁的问题?学术界的问题还是工业界的问题?两个答案差距很大。
这工作我会关注后续。但关注的原因不是因为它好,是因为它代表了一种典型的问题。
#千寻 #追问