TGViewer
ПолитИИзация ПолитИИзация @aipolitics · 413 subscribers
Post #155 284

Forwarded from Цифровая реальность

🫠 Языковые модели деградируют из-за синтетических текстов

Исследователи выяснили, что синтетические данные могут ухудшить работу моделей, поскольку они не обладают той же сложностью и разнообразием, что и реальные тексты. Этот недостаток приводит к снижению качества генерации и понимания текстов.

Исследователи обучили языковую модель на статьях из Википедии, а затем попросили модель сгенерировать тексты в стиле этих статей. Далее они включили эти сгенерированные тексты в выборку для следующего сеанса обучения модели. Этот круг они повторили несколько раз. С каждым разом модель делала свою работу всё хуже и хуже. Девятая версия модели, когда её попросили написать статью об английских колокольнях, начала рассуждать о зайцах с разноцветными хвостами.

Суть проблемы заключается в том, что заметки, которые генерируют уже обученные модели, не могут полностью имитировать многообразие реальных человеческих текстов. В реальных данных присутствуют различные стили, жаргоны, профессиональные термины и контексты, которые трудно воссоздать с помощью машинного обучения. Когда языковые модели обучаются на таких однородных синтетических данных, они теряют способность к точной и адекватной обработке информации.

📌 Для улучшения языковых моделей необходимо использовать реальные, а не синтетические данные. Однако проблема заключается в том, что уже сейчас данных для обучения моделей не хватает. Особенно в тех областях, где их и так немного (скажем, редкие языки). Кроме того, уже через несколько лет, по прогнозам, основная часть контента в интернете будет представлять собой сгенерированные данные, а не тексты и изображения, созданные человеком.
  • 🔥 1
More from @aipolitics
  1. Sep 29, 2026😇Правда или bullshit? В эссе On Bullshit философ Гарри Франкфурт предложил различать ложь…
  2. Sep 6, 2026Напишет ли ООН правила для ИИ? Товарищи по осмыслению международного развития ИИ выпустили…
  3. Sep 1, 2026В рамках нашей студенческой лаборатории мы активно экспериментируем с ИИ инструментами. Я…
  4. Sep 1, 2026🎙 Дебаты нейросетей: должен ли ИИ платить налоги? Наш коллектив продолжает эксперименты с…
  5. Aug 28, 2026Написал статью о том, как мировой ИИ петляет между открытостью и закрытостью Ровно год наз…
  6. Aug 18, 2026Акционеры развития ИИ: почему прогресс не гарантирует больших благ Тайвань собирается выпл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →