Что такое корпус текстов?
Что общего у Библии, рилсов и постов в ЖЖ? Это все материалы для лингвистических корпусов. В новом выпуске глоссария объясняем, почему корпус бывает размером с интернет и размером с тетрадку — и тот и другой одинаково важен.
Три правила настоящего корпуса
Корпус — это не просто большая папка с файлами. В лингвистике корпусом называется любой набор данных на исследуемом языке, в том числе набор переведенных предложений из исследовательской анкеты для носителей языка. У него три главных правила: он должен быть большим, аутентичным (реальные тексты, а не придуманные для исследования) и репрезентативным (отражать разные стороны языка).
Что значит «отражать язык»?
Добиться репрезентативности корпуса довольно сложно. Если отбирать для него текста, как в жизни, то 90% корпуса станет устной речью и останется 7% на литературу. А если собирать то, что люди читают, картина будет другой. Раз уж невозможно составить по-настоящему репрезентативный корпус, создатели делают ставку на разнообразие. В корпус добавляют как можно больше разных языковых вариантов: от научных статей до постов в соцсетях.
Сколько слов нужно для корпуса?
Единственный честный ответ на вопрос, насколько большим должен быть языковой корпус: «Никто не знает». В погоне за объемом могут теряться другие важные параметры: например, корпусы, собранные на основе скачиваемых подряд массивов текстов из интернета, могут содержать большие объемы нейросетевых текстов. Объем корпуса сильно зависит от поставленной задачи, сейчас для большинства задач хватает 1–500 млн токенов. А для малых языков, которых почти нет в сети, даже несколько тысяч слов — уже огромный шаг вперед.
Когда человек не знает, что его изучают
Аутентичность корпуса — тоже непростая задача. Когда лингвисты собирают устные высказывания, то люди, узнав о записи, начинают говорить так, как им кажется, от них ожидает исследователь. Но и это не все: при переносе в корпус исчезают интонации, жесты, мимика, а у письменных текстов — шрифт, цвет и положение на странице. Современные мультимедийные корпусы, вроде мультимедийного русского корпуса, пытаются это исправить.
Корпусы бывают разными — и большими, и маленькими
Гиганты вроде Национального корпуса русского языка (больше 2 млрд слов) и ГИКРЯ (больше 20 млрд токенов) помогают лингвистам видеть общую картину, а малыши вроде корпуса абазинского языка (около 3 тысяч токенов) спасают исчезающие языки, создают словари и учебники.
Больше примеров и тонкостей создания корпусов вы найдете на сайте.
Время чтения: 9 минут
🤖 «Системный Блокъ» @sysblok
Post #1410
3.17K
- 👍 18
- ❤ 16
- 🔥 9