Теперь можно рассчитать, сколько вычислений тратить на обучение ИИ
Одна из редких статей, которая даёт конкретную математику по распределению бюджета между предобучением и пост-тренингом. Для всех, кто планирует большие тренировки - очень полезно.
Группа исследователей взяла шахматы как удобный тестовый полигон и прогнала много экспериментов, чтобы понять, как правильно делить вычислительные ресурсы между предобучением и RL.
И вот, что получилось:
1. Чем сильнее претренированная модель, тем лучше она потом учится на RL и тем выше финальный результат.
2. При небольшом бюджете почти всё нужно отдавать претренингу. С ростом общего компюта доля RL должна увеличиваться, авторы показывают, как находить оптимальную точку.
3. RL не просто усиливает уже известные модели ходы: на сложных задачах он реально вытаскивает редкие правильные решения, которых почти не было на этапе SFT.
Часть выводов подтвердили на языковой модели (OLMo 1B) на математике.
GitHub
Post #13224
2.16K