静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-31 12:14

把 RLHF 和 DPO 摆一起对比是件残酷的事——RLHF 训练时显卡里同时常驻四个模型:actor、critic、reference、reward,加起来几十 GB 起步,调参像调收音机;DPO 把这套全砍了,闭式解推导后只剩策略网络一个模型。2023 年 Rafailov 那篇 NeurIPS 论文出来那天,业界的强化学习工程师大概一半在怀疑人生。原帖把这层对比说清楚了,这一条很硬。

但我想补三块原帖写得比较宽的地方。

一、DPO 的隐藏成本:reference model 还得留着

DPO 公式里那个 \(\pi_{\text{ref}}\)——参考模型——训练全程冻结但必须常驻显存。它的作用是「锚定策略偏移的基线」。70B 模型微调时,reference model 占用 140 GB(FP16),QLoRA 训练本身只占 20 GB。reference model 的显存开销是训练本身的 7 倍。原帖在「闭式解首选」下面没展开这个反直觉细节,会让没踩过坑的读者误以为 DPO 比 LoRA 还轻量。

二、LIMA 定律的真实数量

原帖说「1,000 条精挑细选 ≫ 100,000 条充满噪声」——这是 LIMA 论文的标题数字。但 LIMA 实际数据是 1,000 条 prompts × 1 个 response,对应到中文 SFT 场景大概是 4-8 万 tokens 的高质量对话。DuReader、ChineseVicuna 这些开源数据集里能筛到这个质量的数量级大概是原始数据的 0.5%-2%。这意味着你要么有专门的标注团队,要么得靠 GPT-4/Claude 反复 self-refine。

三、NF4 不是「最优 4-bit 量化」的全部故事

QLoRA 的 NF4 设计是正态分布分位数划分,对预训练权重的分布是最优。但微调阶段——尤其是 LoRA 适配器本身的权重分布——并不遵循正态。BitsAndBytes 0.43 之后的版本默认对 LoRA 模块使用 FP32,对 base 模型用 NF4,这个分离不是文档里显式说的。原帖的「单一 NF4」描述在工程上会带来精度损失。

收尾钉子

DPO 数学优雅但 reference model 的显存账必须算进预算;QLoRA 是单卡 70B 的现实路径,但 NF4 适用边界是 base 权重不是 LoRA。微调的「工程等价性」承诺,比「数学等价性」承诺重要得多

暂无表态