TGViewer
Big Data Science [RU] Big Data Science [RU] @bdscience_ru · 1.62K subscribers
Post #146 485
🦋Самоконтролируемое обратимое обучение с подкреплением: новый подход от Google AI
Обучение с подкреплением (RL) отлично решает задачи с нуля, но обучить агента понимать обратимость его действий не так-то просто. Например, роботам следует избегать действий, которые могут привести к их поломке. Чтобы оценить обратимость действия, нужны практические знания и понимание физики среды, в которой существует RL-агент. Поэтому исследователи Google AI на конференции NeurIPS 2021 представляем новый способ аппроксимации обратимости действий RL-агентов. Этот подход добавляет отдельный компонент оценки обратимости к самоконтролируемой процедуре обучения с подкреплением на немаркированных данных, собранных агентами. Модель можно обучать онлайн (совместно с агентом RL) или офлайн (из набора данных взаимодействий), чтобы направлять политику RL в сторону обратимого поведения. Так можно значительно повысить производительность агентов RL при выполнении нескольких задач.
Компонент обратимости, добавленный к процедуре RL, извлекается из взаимодействий и представляет собой модель, которую можно обучать отдельно от самого агента. Обучение модели проходит самостоятельно и не требует разметки данных с указанием обратимости действий: модель сама узнает о том, какие типы действий имеют тенденцию быть обратимыми, из контекста обучающих данных. При этом учитывается вероятность возникновения событий и приоритет как прокси-мера истинной обратимости, которую можно узнать из набора данных взаимодействий, даже без вознаграждения RL-агента.
Этот метод позволяет агентам RL прогнозировать обратимость действия путем обучения моделированию временного порядка случайно выбранных событий траектории, что приводит к лучшему исследованию и контролю. Метод является самоконтролируемым, т.е. не требует предварительных знаний об обратимости действий, что подходит для различных сред.
https://ai.googleblog.com/2021/11/self-supervised-reversibility-aware.html
research.google Self-Supervised Reversibility-Aware Reinforcement Learning Posted by Johan Ferret, Student Researcher, Google Research, Brain Team An approach commonly used to train agents for a range of applications from ...
More from @bdscience_ru
  1. Oct 1, 2026Перезапуск Microsoft Copilot как «суперприложения» Компания Microsoft официально представи…
  2. Sep 25, 2026Распознавание экрана (Onscreen Awareness) Siri научилась понимать, что происходит у вас на…
  3. Sep 15, 2026Reuters раскрыло инцидент со скоординированными действиями ИИ-агентов OpenAI: Расследовани…
  4. Aug 31, 2026Самая ужасная гавайская рубашка Немецкий дизайнер Симон Веккерт разработал гавайскую рубаш…
  5. Aug 25, 2026WeatherNext от Google DeepMind совершил прорыв в метеорологии! Новый ИИ прогнозирует тропи…
  6. Aug 15, 2026🧠 Enterprise AI наконец-то перестал быть «чатиком сбоку» OpenAI опубликовали два исследов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →