Stylo: какие слова отличают один текст от другого?
Stylo — программа для исследования количественной стилистики текста. «Системный Блокъ» подготовил для вас уже третий гайд по этому инструменту (вот ссылки на первые два, базовый и продвинутый). На этот раз разбираемся с функцией oppose(), которая помогает найти отличия между лексическими составами двух корпусов текстов. Например, выяснить, чем Толстой отличается от Достоевского, а Тургенев — от Гончарова.
Для каждого из корпусов oppose() показывает, какие слова характерны для входящих в него текстов и в то же время редко встречаются во втором наборе. Также функция может учитывать дополнительный, контрольный, корпус — его добавляют, если нужно проверить точность результатов или определить, какой из двух исследуемых корпусов больше похож на контрольный (используется при определении автора текста).
oppose() анализирует текст по фрагментам (длины можно выбрать самостоятельно), и благодаря этому учитывает распределение слов в тексте: даже если какое-то слово встречается часто, но лишь в одном фрагменте длинного текста, оно не будет отмечено как характерное для всего корпуса.
В полной версии гайда мы сравнили романы Тургенева «Накануне» и «Дворянское гнездо» с «Обрывом» и «Обыкновенной историей» Гончарова, добавив контрольный корпус из «Обломова» и «Рудина». В результате получилось, что у Тургенева персонажи больше говорят (для выбранных романов характерны слова типа промолвить, воскликнуть, возразить), а у Гончарова — смотрят (романы отличают слова поглядеть, смотреть, посмотреть, взгляд).
Если изменить параметры визуализации, то можно получить график, где будет показано, насколько далеко отстоят друг от друга тексты из разных корпусов — то есть, насколько сильно они отличаются и, наоборот, какие похожи друг на друга. Предлагаем читателям угадать, какие выводы удалось сделать на основе получившегося у нас графика.
🤖 «Системный Блокъ» @sysblok
Post #940
3.37K
- 👍 23
- ❤ 11
- ❤🔥 8
- 🥰 1