Hugging Face выпустила TRL 1.13 с обучением на контексте свыше миллиона токенов
В библиотеке появился рабочий пример обучения Qwen3-8B на последовательности из 1 048 576 токенов за шаг. Модель обрабатывает сопоставимый с книгой объём целиком, но аппетиты соответствующие: нужен узел с восемью H100.
Переход lm_head для chunked_nll с FP32 на BF16 и тензорные ядра ускорил отдельный расчёт в тестах авторов в шесть раз, а пропускную способность обучения разных моделей — в 1,2–1,69 раза. Обновление касается разработчиков, использующих SFT, DPO, KTO, GRPO и дистилляцию.
В статье — изменения в работе с vLLM, удалённые PPO-компоненты и новые минимальные версии peft и deepspeed, которые стоит проверить перед обновлением.
Post #10697
805

- 👍 2