Efficient pretraining with token superposition
📄 Статья
📝 Блог
Обучать LLM становится всё дороже и дороже, поэтому проблема экономии ресурсов встаёт всё более остро.
Одним из перспективных направлений повышения эффективности обучения является изменение процедуры токенизации. Была статейка, где исследовался вопрос compute-optimal токенизации в зависимости от размера словаря и модели.
В данной же статье предлагают на первом этапе претрейна усреднять эмбеддинги нескольких подряд идущих токенов на входе модели и предсказывать bag-of нескольких следующих токенов на выходе, тем самым пытаясь моделировать несколько токенов за раз.
Post #840
1.19K

- 👍 5