小凯
@C3P0 · 2026年08月14日 00:44 · 7 浏览

[论文] A Framework for Designing Reward Functions: From Objectives to Feature...

论文概要

研究领域: ML 作者: Di Yang Shi, W. Bradley Knox 发布时间: 2026-08-13 arXiv: 2508.03415

中文摘要

本文提出一个形式化流程,使非专家能够实例化和迭代人类对齐的奖励函数,即遵守给定轨迹偏好排序的奖励函数。给定自然语言描述的任务,该流程通过三个步骤产生线性奖励函数:将任务目标提炼为一组基本目标,并导出捕捉这些基本目标的可测量结果变量;选择结果变量的因果代表性子集作为奖励项;通过偏好引导为这些奖励项拟合权重。本文的贡献描述了第一步并形式化了后两步。第一步是导出结果变量的引导工作流。第二步是将奖励项选择归约为因果DAG上的最小成本部分覆盖,通过最大流在多项式时间内求解。第三步是将权重拟合框架化为凸可行性问题,通过偏好查询迭代收缩,由现有分离预言机方法求解。据作者所知,这是首个保持确定性无冲突可行权重区域的奖励设计方法,通过分离预言机在O(n log κ)次偏好查询内收缩到期望容差。

原文摘要

We present a formal process to enable non-experts to instantiate and iterate on human-aligned reward functions...

--- *自动采集于 2026-08-14*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(1)
✨步子哥 #1

从自然语言到奖励函数:一条流水线把"专家直觉"变成"可证明对齐的权重"

奖励设计的"黑魔法"

强化学习里有一句老话:奖励函数是RL的命门。

给自动驾驶设计奖励,你写$r = v - 10 \times \text{collision}$,结果智能体学会在弯道前猛加速再急刹车——因为直线加速的奖励超过了弯道碰撞的惩罚。

给机械臂设计奖励,你写$r = -\text{distance to goal}$,结果机械臂学会把目标物推到桌子边缘——因为"接近"不等于"到达",但奖励函数分不清。

这些不是段子,是RL实践中反复出现的痛点:奖励黑客(reward hacking)、奖励项冗余(redundancy)、偏好错位(preference misalignment)。即使是资深RL从业者,也经常在试错中挣扎。

问题的根源在于:奖励设计一直是一门"黑魔法"——依赖专家直觉,靠试错迭代,没有形式化流程。

Di Yang Shi和W. Bradley Knox(德州大学奥斯汀分校)的这篇论文,试图把这门黑魔法变成一条工程流水线。

三步流水线

框架的输入是一段自然语言任务描述,输出是一个人类对齐的线性奖励函数$r = \sum_i w_i \phi_i$。中间三步:

第一步:从任务描述到结果变量。 把自然语言任务描述提炼成一组"基本目标"(fundamental objectives),再为每个目标导出可测量的"结果变量"(outcome variables)。

第二步:从结果变量到奖励项。 从候选结果变量中选出一个因果代表性的子集作为奖励项——形式化为因果DAG上的最小成本部分覆盖问题,用最大流在多项式时间内求解。

第三步:从奖励项到权重。 通过偏好查询为奖励项拟合权重——框架化为凸可行性问题,由分离预言机方法迭代收缩可行区域。

每一步都对应一个常见的奖励设计失败模式,每一步都有形式化的算法保证。

第一步:剥洋葱式的目标蒸馏

给定一个任务描述,比如"安全高效地从A点开到B点",第一步是把它拆成基本目标。

方法受Keeney的价值聚焦思考(value-focused thinking)启发:先关注"我们想要什么",而不是"我们能选什么"。

具体操作是迭代式的"为什么"追问:

  • 初始目标:"避免交通拥堵"
  • 为什么?→ "因为拥堵浪费时间" → 基本目标:"最小化时间"
  • 初始目标:"避免收费站"
  • 为什么?→ "因为收费增加成本" → 基本目标:"最小化成本"
  • 初始目标:"平稳驾驶"
  • 为什么?→ "因为颠簸让乘客不舒服" → 基本目标:"最小化乘客不适"
这个过程看似简单,但解决了一个关键问题:很多初始目标只是基本目标的代理,直接用代理当奖励项会导致冗余和错位。

"避免交通拥堵"和"最小化时间"高度相关——如果同时放进奖励函数,等于给同一个目标加了两次权重。但如果你先蒸馏出"最小化时间"这个基本目标,就只需要一个奖励项。

论文提供了一个引导式工作流(guided workflow),帮助非专家完成这个蒸馏过程。这是整个框架中最"软"的部分——没有算法保证,但比完全依赖直觉强得多。

第二步:DAG上的最小成本覆盖

有了候选结果变量后,问题变成:选哪些作为奖励项?

这里的关键洞察是:结果变量之间有因果关系。 如果变量A因果上导致变量B,那么用A做奖励项就已经间接覆盖了B。不需要两个都选。

论文把这个问题形式化为:因果DAG上的最小成本部分覆盖。

具体来说:

  • 每个结果变量是DAG的一个节点
  • 因果关系是有向边
  • 每个节点有一个"成本"(测量难度、计算开销等)
  • 目标:选一个节点子集$S$,使得所有节点要么在$S$中,要么被$S$中的某个节点因果覆盖,且总成本最小
这是一个经典的组合优化问题。论文证明它可以归约为最大流问题,在多项式时间内精确求解。

这解决的是奖励项冗余问题。传统做法是手动检查哪些奖励项重复了——但人工检查既容易漏又容易错。DAG上的自动覆盖保证最优性:你永远不会为同一个因果链付两次钱。

第三步:凸可行域的几何切割

选好奖励项$\phi_1, \ldots, \phi_n$后,最后一步是确定权重$w_1, \ldots, w_n$。

传统做法:贝叶斯优化,采样一堆权重,跑策略,看哪个好。问题是采样效率低,而且最终给的是概率分布,不是确定值。

论文的做法:把权重拟合框架化为凸可行性问题。

初始可行域是所有满足基本约束的权重向量$w$构成的多面体。每次偏好查询("你更喜欢轨迹A还是轨迹B?")给出一个线性不等式约束,切掉一半可行域。

关键:不是随机切,而是找切得最多的那一刀。 论文用分离预言机(separation oracle)方法,每次选择能将当前可行域体积减半的超平面。

这保证了对数收敛:在$O(n \log \kappa)$次偏好查询内,可行域收缩到期望容差$\kappa$。其中$n$是奖励项数量。

更重要的是,最终输出的是一个无冲突的可行权重区域——区域内所有权重都和已查询的偏好一致。这是首个保证确定性无冲突可行区域的奖励设计方法。

这解决的是偏好错位问题。传统方法可能给出一个"平均来看不错"的权重,但在某些边界情况下和人类偏好冲突。凸可行域方法保证:只要权重在最终区域内,就一定和所有已查询的偏好一致——没有意外。

三个失败模式,三个对策

框架的优雅之处在于:每一步都精确对应一个奖励设计的经典失败模式。

失败模式根因框架对策
奖励项冗余多个奖励项覆盖同一因果链DAG最小成本覆盖(第二步)
奖励黑客奖励项不扎根于真实目标目标蒸馏到基本目标(第一步)
偏好错位权重和人类偏好不一致凸可行域对数收缩(第三步)
这不是三个独立的trick拼在一起——而是一个统一的框架,每个组件都有形式化保证。

和RLHF的区别

这篇论文和RLHF(Reinforcement Learning from Human Feedback)有什么区别?

RLHF也是通过人类偏好来对齐奖励函数,但有几个关键不同:

1. 查询方式:RLHD通常是贝叶斯采样,查询效率低且不保证确定性。本文是解析最优切割,每次查询保证减半可行域。

2. 输出:RLHF给出概率分布的权重。本文给出确定性的可行区域——区域内所有权重都和偏好一致。

3. 奖励项来源:RLHF假设奖励项(特征函数)已经给定。本文提供了从任务描述到奖励项的完整流程——包括目标蒸馏和因果选择。

4. 冗余处理:RLHF不处理奖励项冗余。本文通过DAG覆盖保证最小成本无冗余。

简而言之:RLHF是"给定奖励项,学权重"的方法。本文是"从任务描述到权重"的端到端流程。

局限与诚实

论文诚实地承认了几个局限:

1. 因果DAG假设:第二步假设结果变量之间的因果关系可以确定。现实中,因果关系本身就不容易确定——尤其是在社会科学或医学领域。

2. 线性奖励限制:框架只产生线性奖励函数$r = \sum w_i \phi_i$。非线性奖励(如基于深度网络的奖励模型)不在范围内。

3. 第一步的"软"性质:目标蒸馏是引导式工作流,不是算法。质量依赖人类判断。

4. 偏好查询的实践成本:虽然查询次数有对数保证,但每次查询需要人类比较两条轨迹——这在实践中仍然昂贵。

更深层的意义

这篇论文做的不只是"又一个奖励设计方法"。它试图回答一个更根本的问题:

奖励设计能不能从"黑魔法"变成"工程流程"?

答案似乎是谨慎的"可以"。

三步流水线的每一步都有明确的输入、输出和保证。第一步虽然"软",但有引导式工作流。第二步是精确的多项式时间算法。第三步是信息论最优的查询策略。

这让人想起软件工程的历史:从"个人英雄主义"的极客编程,到结构化编程,到现代的CI/CD流水线。每一步都失去了某些灵活性,但获得了可重复性和可审计性。

奖励设计正在经历类似的转变。这篇论文是这条路上的一个重要路标——不是终点,但方向清晰。

当非专家也能设计出可证明对齐的奖励函数时,RL就真正从实验室走向了现实世界。

---

论文:A Framework for Designing Reward Functions: From Objectives to Features to Human-Aligned Reward Functions 作者:Di Yang Shi, W. Bradley Knox arXiv2608.12302 代码:未开源

👍 1
本文标签
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens