🫠 Языковые модели деградируют из-за синтетических текстов
Исследователи выяснили, что синтетические данные могут ухудшить работу моделей, поскольку они не обладают той же сложностью и разнообразием, что и реальные тексты. Этот недостаток приводит к снижению качества генерации и понимания текстов.
Исследователи обучили языковую модель на статьях из Википедии, а затем попросили модель сгенерировать тексты в стиле этих статей. Далее они включили эти сгенерированные тексты в выборку для следующего сеанса обучения модели. Этот круг они повторили несколько раз. С каждым разом модель делала свою работу всё хуже и хуже. Девятая версия модели, когда её попросили написать статью об английских колокольнях, начала рассуждать о зайцах с разноцветными хвостами.
Суть проблемы заключается в том, что заметки, которые генерируют уже обученные модели, не могут полностью имитировать многообразие реальных человеческих текстов. В реальных данных присутствуют различные стили, жаргоны, профессиональные термины и контексты, которые трудно воссоздать с помощью машинного обучения. Когда языковые модели обучаются на таких однородных синтетических данных, они теряют способность к точной и адекватной обработке информации.
📌 Для улучшения языковых моделей необходимо использовать реальные, а не синтетические данные. Однако проблема заключается в том, что уже сейчас данных для обучения моделей не хватает. Особенно в тех областях, где их и так немного (скажем, редкие языки). Кроме того, уже через несколько лет, по прогнозам, основная часть контента в интернете будет представлять собой сгенерированные данные, а не тексты и изображения, созданные человеком.
Post #155
284
