Когда мы говорим про обучение LLM с нуля - pretraining - информации всегда не хватает. Знаете, на каких данных обучали модель GPT-3 шесть лет назад, а на каких обучают сейчас?
Но еще более интересные вопросы - чем эта эволюция обусловлена и что в действительности происходит при обучении модели в контексте распределения признаков, статистически представленных в наборе данных.
Об этом я написал новую статью:
https://pikabu.ru/story/ot_chego_zavisit_uspekh_obucheniya_bolshoy_yazyikovoy_modeli_i_kakie_dannyie_dlya_yetogo_nuzhnyi_13825390
Post #186
1.55K