TGViewer
404 Driver Not Found 404 Driver Not Found @drivernotfound · 1.53K subscribers
Post #97 1.11K
Learning Rollout from Sampling: An R1-Style Tokenized Traffic Simulation Model

Сегодняшняя статья о том, как адаптировать RL-алгоритм GRPO к задачам автономного транспорта. Авторы проанализировали распределение энтропии для разных сцен и по результатам сформулировали следующее:

1. У сложных сцен (Waymo Hard) более высокая энтропия токенов, поэтому имеет смысл увеличить exploration.

2. В простых сценах (Waymo Easy), наоборот, излишнее семплирование вносит ненужный шум.

Лучше использовать адаптивное семплирование. Авторы предлагают вариант, где параметр K в TopK зависит от энтропии: K_t = k_min + (k_max — k_min) / (1 + e^(-H_t))

Авторы утверждают, что при таком разделении по сложности после RL уменьшается энтропия и улучшаются метрики в hard-кейсах. От себя добавлю, что не хватает ablation, какое распределение энтропии получается после обычного RL.

Отдельного внимания заслуживают выбор параметров и способ обучения:

🔴 При group-нормализации нет деления на STD, только вычитают среднее — из-за небольшого количества траекторий дисперсия может быть шумной.
🔴 Делают KL-дивергенцию на претрейн-политику (ref-политика).
🔴 В качестве ревордов используют произведение ADE_like_reward и Collision_reward.
🔴 Замораживают энкодер агентов и карты за исключением последнего слоя

Таким образом, авторы предлагают подход для эффективного баланса между exploration и exploitation. Предложенный сетап RL выглядит интересно, и некоторые идеи вполне могут работать на практике.

Разбор подготовил ❣️ Павел Лукьянов
404 driver not found
  • 👍 9
  • ❤ 6
  • 🔥 6
More from @drivernotfound
  1. Sep 17, 2026Mask2Map: Vectorized HD Map Construction Using Bird's Eye View Segmentation Masks Что буде…
  2. Sep 11, 2026Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous…
  3. Sep 10, 2026Автономный транспорт на ECCV 2026: несколько слов о долгосрочном развитии На воркшопе Emer…
  4. Sep 4, 2026π0.5: a VLA with Open-World Generalization π0 — система, которая помогает делать large-sca…
  5. Aug 28, 2026BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth Guidance Де…
  6. Aug 13, 2026LISO: Lidar-only Self-Supervised 3D Object Detection Разметка 3D-боксов очень дорогая, дол…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →