TGViewer
Системный Блокъ Системный Блокъ @sysblok · 11.6K subscribers
Post #1410 3.17K
Что такое корпус текстов?

Что общего у Библии, рилсов и постов в ЖЖ? Это все материалы для лингвистических корпусов. В новом выпуске глоссария объясняем, почему корпус бывает размером с интернет и размером с тетрадку — и тот и другой одинаково важен.

Три правила настоящего корпуса

Корпус — это не просто большая папка с файлами. В лингвистике корпусом называется любой набор данных на исследуемом языке, в том числе набор переведенных предложений из исследовательской анкеты для носителей языка. У него три главных правила: он должен быть большим, аутентичным (реальные тексты, а не придуманные для исследования) и репрезентативным (отражать разные стороны языка).

Что значит «отражать язык»?

Добиться репрезентативности корпуса довольно сложно. Если отбирать для него текста, как в жизни, то 90% корпуса станет устной речью и останется 7% на литературу. А если собирать то, что люди читают, картина будет другой. Раз уж невозможно составить по-настоящему репрезентативный корпус, создатели делают ставку на разнообразие. В корпус добавляют как можно больше разных языковых вариантов: от научных статей до постов в соцсетях.

Сколько слов нужно для корпуса?

Единственный честный ответ на вопрос, насколько большим должен быть языковой корпус: «Никто не знает». В погоне за объемом могут теряться другие важные параметры: например, корпусы, собранные на основе скачиваемых подряд массивов текстов из интернета, могут содержать большие объемы нейросетевых текстов. Объем корпуса сильно зависит от поставленной задачи, сейчас для большинства задач хватает 1–500 млн токенов. А для малых языков, которых почти нет в сети, даже несколько тысяч слов — уже огромный шаг вперед.

Когда человек не знает, что его изучают

Аутентичность корпуса — тоже непростая задача. Когда лингвисты собирают устные высказывания, то люди, узнав о записи, начинают говорить так, как им кажется, от них ожидает исследователь. Но и это не все: при переносе в корпус исчезают интонации, жесты, мимика, а у письменных текстов — шрифт, цвет и положение на странице. Современные мультимедийные корпусы, вроде мультимедийного русского корпуса, пытаются это исправить.

Корпусы бывают разными — и большими, и маленькими

Гиганты вроде Национального корпуса русского языка (больше 2 млрд слов) и ГИКРЯ (больше 20 млрд токенов) помогают лингвистам видеть общую картину, а малыши вроде корпуса абазинского языка (около 3 тысяч токенов) спасают исчезающие языки, создают словари и учебники.

Больше примеров и тонкостей создания корпусов вы найдете на сайте.

Время чтения: 9 минут

🤖 «Системный Блокъ» @sysblok
  • 👍 18
  • ❤ 16
  • 🔥 9
More from @sysblok
  1. Sep 25, 2026Минпросвещения составило правила для учителей по работе с ИИ Ведомство рекомендует школам…
  2. Sep 22, 2026Едят ли корейцы собак? Отвечает статистика В феврале 2027 года в Южной Корее истекает пере…
  3. Sep 19, 2026От Пикуля к ИИ: как создавалась и на чем держится книжная империя Эксмо-АСТ За последние д…
  4. Sep 18, 2026Как построить систему самообучения: алгоритм от цели до результата Можно скачать 10 прилож…
  5. Sep 12, 2026Post #1484
  6. Sep 9, 2026OpenAI заявила о решении задачи тысячелетия — и оказалась в центре скандала 8 сентября Ope…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →