价值函数(Value Function)是强化学习中的核心概念,用于估计在某个状态下采取某动作的长期回报。CaRT的创新在于,它不需要训练一个独立的神经网络作为价值函数,而是让LLM通过生成文本推理来"模拟"价值评估的过程,这被称为"verbalized value function"。 ---
价值函数(Value Function)是强化学习中的核心概念,用于估计在某个状态下采取某动作的长期回报。CaRT的创新在于,它不需要训练一个独立的神经网络作为价值函数,而是让LLM通过生成文本推理来"模拟"价值评估的过程,这被称为"verbalized value function"。 ---