TGViewer
Системный Блокъ Системный Блокъ @sysblok · 11.6K subscribers
Post #1441 2.81K
Брюхоногие моллюски, пептид и редкие фамилии: как сделать языковой корпус репрезентативным

Из-за одного журнала по гастроэнтерологии слова пептид и эндоскопия неожиданно оказались среди самых частотных слов в языковом корпусе английского языка. Редкие слова вдруг могут показаться самыми распространенными в языке, если составить корпус текстов неудачно. Рассказываем, почему при создании языковых корпусов важнее не количество текстов, а то, как именно они отобраны. 

Что значит «репрезентативный корпус»

Языковой корпус — это размеченное собрание текстов, которое помогает исследовать язык: выяснять, когда появилось новое значение слова, как отличаются жанры или какие языковые особенности характерны для разных групп говорящих.

Чтобы выводам такого исследования можно было доверять, корпус должен быть репрезентативным — то есть отражать язык таким, каким он используется в реальной жизни, а не только в отдельных типах текстов. Для этого его делают сбалансированным: включают произведения разных жанров, тексты разных эпох, авторов и тематик. Иначе особенности одной группы текстов могут исказить общую картину языка.  

Проблема моллюсков и гастроэнтерологов

Лингвисты называют один из таких эффектов проблемой букцинумов. Если добавить в корпус целую монографию о брюхоногих моллюсках, редкое слово букцинум начнет встречаться непропорционально часто и создаст ложное впечатление о своей распространенности.

Похожая история произошла при создании Британского национального корпуса. В него целиком включили специализированный журнал по гастроэнтерологии, из-за чего слова пептид и эндоскопия неожиданно оказались в числе самых частотных слов английского языка. Позже этот перекос пришлось исправлять вручную. 

Почему редкие слова любят повторяться

Есть и другая проблема — проблема Норьеги. Если редкая фамилия уже встретилась в тексте, вероятность увидеть ее снова гораздо выше, чем если бы слова распределялись случайно. То же относится и к другим ключевым словам: текст обычно развивает уже начатую тему, а не перескакивает между случайными сюжетами.

Именно поэтому при создании больших корпусов исследователи предпочитают собирать множество сравнительно небольших фрагментов из разных источников, а не несколько длинных специализированных текстов. Такой подход позволяет лучше отразить языковое разнообразие и избежать тематических перекосов. 

Подробнее о том, каким должен быть хороший корпус, читайте в полной версии материала. А если вы хотите больше знать про то, как изучать язык с помощью данных, загляните в наш новый проект.

Время чтения: 9 минут

🤖 «Системный Блокъ» @sysblok
  • 🔥 20
  • ❤ 10
  • 👏 9
  • 👍 3
More from @sysblok
  1. Sep 22, 2026Едят ли корейцы собак? Отвечает статистика В феврале 2027 года в Южной Корее истекает пере…
  2. Sep 19, 2026От Пикуля к ИИ: как создавалась и на чем держится книжная империя Эксмо-АСТ За последние д…
  3. Sep 18, 2026Как построить систему самообучения: алгоритм от цели до результата Можно скачать 10 прилож…
  4. Sep 12, 2026Post #1484
  5. Sep 9, 2026OpenAI заявила о решении задачи тысячелетия — и оказалась в центре скандала 8 сентября Ope…
  6. Sep 9, 2026Муки творчества на аутсорсе у LLM: что остается человеку? Вы потратили несколько часов на…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →