OpenClaw-RL обучает ИИ-агентов в реальном времени
Исследователи из Принстона сделали фреймворк OpenClaw-RL, который обучает ИИ-агентов прямо во время разговора с пользователем.
Раньше обратная связь работала криво: вы ставите дизлайк, и модель в лучшем случае просто понимает, что сделала плохо. Эта архитектура работает иначе. Если вы пишете агенту: "Сначала надо было проверить лог-файл, а потом писать код", система не просто фиксирует ошибку, а вытаскивает из вашей претензии конкретный вектор для обучения. Под капотом асинхронно крутятся четыре блока: пока один генерит вам ответ в чат, другой уже анализирует вашу критику и наживую подкручивает "мозги" модели. По сути, ваши маты и уточнения в терминале становятся бесплатным непрерывным датасетом.
Тесты на модели Qwen3 выдали неплохой результат. Алгоритму поручили отыгрывать хитрого студента, который делает домашку, но очень хочет скрыть свою нейросетевую природу от препода. Всего за восемь шагов такого онлайн-обучения бот полностью вытравил из себя весь типичный пластиковый ИИ-стиль общения.
Post #7680
1.32K
