Как работают замкнутые циклы тренировки ЛЛМ без людей?
Разметка данных людьми уходит в прошлое
Новое поколение open-weight моделей (например, Ornith-1.5) переходит на обучение в замкнутом цикле
Как это работало раньше (RLHF)?
Модель пишет код → человек-оценщик ставит балл → модель подстраивается под вкус человека.
Это медленно и дорого...
Ведь надо платить человеку
Как работает новый цикл (RLVR)?
В задачах вроде программирования есть беспристрастный маркет — набор тестов
Цикл выглядит так
1. Генерация. Агент получает задачу и пишет код
2. Самопроверка. Модель сама для себя пишет юнит-тесты, создает фиктивные данные и окружение для проверки.
3. Песочница. Код и тесты запускаются в изолированном контейнере
4. Проверка и награда. Тесты прошли? Модель получает +1. Упала Ошибка? Модель получает -1 и видит лог ошибки.
Далее делаются тысячи итераций, вносятся изменения в веса и получается обновленная модель
Но есть подвох — модель может написать такие тесты, чтобы всегда получать +1. Пока эту проблему решают :)
👍 — пусть эту проблему НЕ РЕШАТ
👨🚒 — пусть эту проблему РЕШАТ
🪐 Вездесущий ИИ | Чат с админом | Консультация
