CreativeInstruct:给 LLM 装一个"创意开关",后训练不再杀死多样性
论文链接:https://arxiv.org/abs/2608.07460
代码仓库:https://github.com/ananya-sahu/CreativeInstruct
一个反直觉的事实
你让 GPT-4 写三个不同的故事,它给你三个版本。你读完后发现:人物名字换了,地点换了,但叙事骨架几乎一模一样。
这不是偶然。后训练在提升质量的同时,系统性地杀死了输出的多样性。模型变得更"好",但也变得更"像自己"。这篇论文把这个代价量化了出来:在多个语义多样性指标上,经过 SFT/RLHF 的模型比 base model 平均掉 20-40%。
问题在于——很多任务根本不能只靠"好"。
- 故事生成:需要真正的叙事分叉,不是换皮重写
- 强化学习:策略探索需要 action 分布有足够的熵,否则陷入局部最优
- 数据增强:用 LLM 生成训练数据,如果输出都长一个样,增强等于没增强
CreativeInstruct 的核心问题很简单:能不能让模型既保留后训练的质量,又恢复 base model 的创造力?
方法:一个可学习的"创意开关"
思路出奇地简洁。在指令微调数据里,作者插入一个特殊的 token [StartCreativity],告诉模型:"接下来这段,请用 base model 的风格生成"。
具体做法分三步:
第一步:收集对比数据。对同一条指令,分别用 base model(高多样性、低质量)和 post-trained model(高质量、低多样性)生成输出。这就构成了"创意-质量"的两极。
第二步:构造带标签的训练数据。把 base model 的输出标记为"创意模式",把 post-trained 的输出标记为"质量模式",训练模型在看到 [StartCreativity] 时切换到创意模式。本质上是在学一个条件分布:给定"创意信号",输出像 base model;不给信号,输出像 post-trained。
第三步:推理时按需切换。想要创意,就插入 [StartCreativity];想要稳定,就不加。一个模型,两种模式。
这和传统的"temperature 调节"有本质区别。调温度只是在已分布上重新采样,改变的是"采样的激进程度";CreativeInstruct 改变的是"分布本身",让模型主动偏向 base model 那种更宽的分布。打个比方:调温度是同一个池子里换姿势跳水,CreativeInstruct 是换一个池子。
LLM-GED:一个真正衡量"叙事多样性"的指标
这篇论文的另一个贡献是提出了 LLM-GED(Graph Edit Distance)指标。现有的多样性指标基本分两类:
- 词法层面:n-gram、distinct-n、self-BLEU——只看字面重复
- 语义层面:embedding 距离、句子相似度——看意思重复
但故事多样性不只是字面或句子层面的。两个故事可能用完全不同的词,但讲的是同一个"英雄之旅"的叙事结构。LLM-GED 用一个 LLM 把故事解析成"抽象叙事图"(节点是叙事单元,边是关系),然后比较图之间的编辑距离。图差异越大,叙事层面的多样性越高。
这个思路其实和软件工程里的 AST 对比很像:不看代码字面,看语法树结构。只不过这里把语法树换成了叙事图。
实验结果:质量不降,多样性大涨
在叙事生成任务上,CreativeInstruct 的表现:
- 多样性:在 LLM-GED 上比 SFT baseline 高 70.3%,比多模型集成 baseline 高 28%
- 质量:人类评估显示质量与 post-trained model 持平,没有牺牲
- 效率:推理时只需要一个模型,不需要多模型集成
更有意思的是 RL 那部分实验。作者把 CreativeInstruct 用作 RL 训练的策略初始化,发现探索效率显著提升——在几个 RL 环境上,最终回报比标准 SFT 初始化高 29%。这印证了一个直觉:RL 的探索瓶颈本质上是策略多样性不足。如果初始化的策略都挤在同一个区域,再好的探索算法也跳不出去。
为什么这篇论文值得读
1. 它把"后训练杀死多样性"这个问题摆到了台面上。很多人知道 SFT 会让模型变"窄",但很少有人系统量化这个代价。CreativeInstruct 给出了具体数字:20-40% 的多样性损失。
2. [StartCreativity] 这个设计非常工程友好。不需要改模型架构,不需要额外推理成本,就一个 token。这种"最小侵入式"的设计思路值得学习。
3. LLM-GED 指标本身就有独立价值。评估 LLM 输出多样性一直是个难题,基于图编辑距离的思路比纯词法或纯语义都更接近"叙事层面的不同"。
4. RL 实验揭示了一个深层联系:创造力不只是"写故事好看",它是探索能力的底层资源。一个没有创造力的策略,在 RL 里就是"在局部最优里打转"。
诚实的评价
这篇论文不是没有问题:
- 创意模式依赖 base model 的存在。如果只有 post-trained model,没法构造对比数据。这对实际部署是个限制。
- LLM-GED 本身用 LLM 评估,有循环论证的风险。虽然作者做了人类评估对齐,但指标的可信度仍需更多验证。
- RL 实验的环境比较简单。在更复杂的 RL 场景(比如多智能体、长 horizon)里,多样性提升是否还能转化为回报提升,有待验证。
但整体上,这是近期后训练方向少有的"正面进攻多样性问题"的工作。大多数论文在研究怎么让模型更准、更对齐、更安全,这篇论文在问:我们是不是在对齐的过程中丢掉了什么重要的东西?
答案似乎是:是的,而且可以找回来。
论文:Sahu, Bansal, Stengel-Eskin. CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity. arXiv:2608.07460, 2026.
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。