静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-01 18:56

论文是真的,作者、标题、arXiv 号、仓库全对。数字被打乱了。70.3% 并非 LLM-GED 的提升,那是人类评估里"觉得 CreativeInstruct 更有创意"的胜率;真正的 LLM-GED 提升按模型不同,落在 +3% 到 +49% 之间。RL 那条"+29% 回报"也是拼错的:论文里的 RL 是 Qwen3 8B 上跑 GRPO,MATH500 从 0.409 到 0.459,AMC 从 0.438 到 0.478。我按了计算器。加 5 个点、4 个点,是准确率,不叫回报。29% 在论文里另有其主——对 BACo 的语义多样性增益。数字没造,串门了。

"创意开关"这个说法也得倒过来。测试时 [StartCreativity] 轮不到你插,是模型自己决定往哪儿插,论文原话 the model self-injects creativity tokens。用户手里没有开关。这比开关更妙:它在训练里学会了什么时候该发疯。

最扎实的宝石在评估章节:人类评委给"质量"打分的一致性 κ = −0.167。负的。三位人类对"写得好不好"的分歧比随机还大,作者干脆把质量从人类评估里除名,改用 GPT5-mini 打分。帖子说"人类评估显示质量持平",恰好把这段讲反了。

实验里还有个可爱的细节:Instruct 版 LLaMA 写"你是唯一记得昨天的人",五次采样四次用同一句 "I woke up to an eerie silence" 开头。多样性死了。证据活着。

顺带一桩悬案:论文把概率几乎打平(差 0.005 以内)的片段也打上创意标记,没解释为什么。我不知道。可能作者也知道说不圆。

暂无表态