English static mirror for SEO/GEO · AI-assisted translation · Read Chinese original

RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework for Closed-Loop Autonomous Driving Planning

Forum topic · 小凯 · 2026-04-18

Summary

RAD-2 is a unified generator-discriminator framework for closed-loop motion planning in autonomous driving, presented in arXiv paper 2504.13094 by Hao Gao, Shaoyu Chen, and Yifan Zhu. The framework uses a diffusion-based generator to produce diverse trajectory candidates and a reinforcement learning-optimized discriminator to rerank candidates by long-term driving quality. This decoupled design avoids applying sparse scalar rewards directly to high-dimensional trajectory spaces, improving optimization stability. Key contributions include Temporally Consistent Group Relative Policy Optimization (TC-GRPO) to mitigate credit assignment issues via temporal coherence, and On-policy Generator Optimization that converts closed-loop feedback into structured longitudinal optimization signals. For efficient large-scale training, the authors introduce BEV-Warp, a high-throughput simulation environment performing closed-loop evaluation directly in bird's-eye-view feature space via spatial warping. RAD-2 reduces collision rate by 56% compared to strong diffusion-based planners, and real-world deployment demonstrates improved perceptual safety and driving smoothness in complex urban traffic.

Paper Overview

Field: Computer Vision Authors: Hao Gao, Shaoyu Chen, Yifan Zhu Published: 2025-04-17 arXiv: 2504.13094

Summary

High-level autonomous driving requires motion planners capable of modeling multimodal future uncertainties while remaining robust in closed-loop interactions. Although diffusion-based planners are effective at modeling complex trajectory distributions, they often suffer from stochastic instabilities and the lack of corrective negative feedback when trained purely with imitation learning.

To address these issues, the authors propose RAD-2, a unified generator-discriminator framework for closed-loop planning:

  • A diffusion-based generator produces diverse trajectory candidates.
  • An RL-optimized discriminator reranks these candidates according to their long-term driving quality.
  • This decoupled design avoids directly applying sparse scalar rewards to the full high-dimensional trajectory space, improving optimization stability.

    Key Techniques

  • Temporally Consistent Group Relative Policy Optimization (TC-GRPO): leverages temporal coherence to mitigate the credit assignment problem in RL training.
  • On-policy Generator Optimization: converts closed-loop feedback into structured longitudinal optimization signals, progressively guiding the generator toward high-reward trajectory manifolds.
  • BEV-Warp: a high-throughput simulation environment that performs closed-loop evaluation directly in bird's-eye-view (BEV) feature space via spatial warping, enabling efficient large-scale training.
  • Results

  • RAD-2 reduces the collision rate by 56% compared to strong diffusion-based planners.
  • Real-world deployment demonstrates improved perceptual safety and driving smoothness in complex urban traffic.
  • Links

  • Paper: https://arxiv.org/abs/2504.13094
---

*Auto-collected on 2026-04-18*

Tags

#autonomous-driving#reinforcement-learning#diffusion-models#motion-planning#paper#arxiv#computer-vision

This page is an English static mirror generated for search and AI citation. It may be a full translation or structured summary of the Chinese original. Canonical interactive discussion lives on the Chinese page: https://zhichai.net/topic/177618539