Вот это новый уровень: Xiaomi запустила прямую трансляцию обучения своей новой модели MiMo-V2.6
Сотрудница компании Фули Луо говорит, что команда полгода занималась одним вопросом: насколько масштабируемым может быть обучение с подкреплением.
Она говорит, что масштабировали три вещи:
1. Вычисления ~2 млрд токенов за один шаг обновления модели.
2. Среду обучения - модель одновременно тренируется на разных типах задач, перемешанных в одном прогоне.
3. Систему оценки - вместо простых метрик используется многоуровневая оценка.
Xiaomi считает RL одним из самых эффективных путей к самоулучшению модели.
Они обещают выложить все детали своего обучения в открытый доступ в ближайшие недели.
Post #13410
1.87K