Вышел open-source фреймворк для RL-сред агентов, а NVIDIA показала, как на проверяемых средах по очереди обновлять модель и харнесс.
Оба проекта говорят о том, что ИИ-агента бесполезно учить в среде, которая врёт.
Среда - это песочница с задачей, где агенту дают цель, инструменты и способ проверить, справился он или нет. Если проверка дырявая, модель быстро находит вариант обхода. Дальше она учится искать лазейку, а не делать работу.
Стартап Preference Model выложили в open source свой Karotte - фреймворк для сборки RL-сред, это инструмент, чтобы такие песочницы собирать аккуратнее.
Docs
Code.
А NVIDIA выпустила статью под названием VERA, в котором говорится о следующем шаге.
Мало иметь честную среду, надо ещё понять, что именно улучшать: саму модель или харнесс вокруг неё. В VERA из реальных прогонов собирают проверяемые песочницы, а потом по очереди обновляют то модель, то харнесс. Правку оставляют только, если она проходит проверку на отдельном наборе задач. Так прирост не записывают не на тот счёт.
Post #13487
1.02K