❤️ Sebastian Raschka выпустил большую статью про будущее обучения языковых моделей
Кратко: эпоха простого масштабирования закончилась, теперь всё внимание на обучение с подкреплением (RL).
RLHF давно помогает моделям подстраиваться под людей, но для реального мышления этого мало. Сейчас на сцену выходит GRPO — более легкий вариант, без лишних затрат. Так обучали, например, DeepSeek-R1-Zero.
Проблема в том, что RL нередко приводит к растянутым и ошибочным ответам. Решения ищут: где-то штрафуют за длину текста, где-то пересчитывают преимущества. А DeepSeek V3 и вовсе показывает зачатки мышления без RL, только на хороших данных.
Вывод: RL нужен, но без фанатизма. Главное — грамотная комбинация техник, контроль длины и автоматическая проверка. Тогда у моделей появляется шанс действительно думать, а не просто выдавать красивые тексты.
❤️ Читать полностью тут
❤️ Data Signal
Post #111
833


- ❤ 2
- 👍 2
- 🔥 2