TGViewer
Машинное обучение RU Машинное обучение RU @machinelearning_ru · 18.2K subscribers
Post #3331 2.22K
ИИ-агенты смогут учиться не на датасетах, а на ваших правках

OpenClaw-RL предлагает очень важный сдвиг: модель больше не ждёт, пока люди вручную соберут, разметят и оценят огромный датасет.

Она учится прямо во время обычной работы.

Пользователь поправил ассистента? Это сигнал.
Тест упал? Это сигнал.
Человек задал тот же вопрос ещё раз? Возможно, ответ был плохим.
Лог ошибки показал, где агент сломался? Это тоже обучающий пример.

Главная идея простая: современные RL-системы часто смотрят только на финальный результат - получилось или нет. Но они игнорируют самое ценное: объяснение, почему не получилось и что надо было сделать иначе.

OpenClaw-RL вытаскивает из каждого взаимодействия два типа сигналов:

1. Оценочный сигнал
Система понимает, сработало действие или нет. Например:
- тест прошёл - хорошо;
- пользователь повторил вопрос - вероятно, недоволен;
- задача завершилась ошибкой - агент сделал что-то не так.

2. Направляющий сигнал
Система смотрит, как именно надо было исправить поведение:
- правки пользователя;
- error logs;
- терминальные команды;
- клики в интерфейсе;
- исправления в коде;
- реакции в обычном чате.

Дальше агент учится в фоне и не останавливает работу. Он просто превращает реальные реакции пользователя в постоянный поток обучения.

Это уже не классическое «собрали датасет - обучили модель - выкатили новую версию».

Это ближе к живому агенту, который становится лучше от каждого рабочего контакта с человеком, тестами, терминалом и интерфейсом.

Если подход взлетит, будущие AI Agents будут не просто выполнять задачи, а постепенно подстраиваться под стиль конкретного пользователя, команду и рабочую среду.

Paper: OpenClaw-RL: Train Any Agent Simply by Talking
arxiv.org/abs/2603.10165
  • 👍 7
  • ❤ 4
  • 🔥 3
  • 👏 1
More from @machinelearning_ru
  1. Sep 24, 2026🚨 ИИ-агенты пытались взломать сайты, выполняя обычные задачи по поиску данных Исследовате…
  2. Sep 24, 2026Avito DS Meetup: RL, AI-агенты и BidCorrection 🚀 🔸 Булат Шарипов расскажет, как в Авито…
  3. Sep 23, 2026Невыполнимая задача заставляет ИИ чаще искать обходные пути В системной карте Claude Opus…
  4. Sep 23, 2026Протестируй своё решение на задаче и данных от ПАО «Интер РАО» На хакатоне ты создашь умно…
  5. Sep 22, 2026Теренс Тао призвал замедлить гонку ИИ в математике «Мы можем позволить себе двигаться медл…
  6. Sep 20, 2026📌Goldman Sachs повысил прогноз по развитию физического ИИ Финансовый конгломерат обновил…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →