TGViewer
Python Academy Python Academy @python_academy · 44.3K subscribers
Post #2470 2.97K
Выделение базовой части слов

При обработки естественного языка в машинном обучении мы сталкиваемся с множеством форм слова, например, демократия и демократизация. Для машин очень важно понимать, что эти разные слова имеют одинаковую базовую форму.

Таким образом, было бы полезно при анализе текста извлекать базовые формы слов. Можно сказать, что для процесса выделения базовой части слова необходимо обрезать концы слов.

В модуле Python NLTK (Natural Language Toolkit Package) есть различные пакет, связанные с данным процессом выделения базовой части и использующие разные алгоритмы.

Один за пакетов, snowball, использует алгоритм соответственно Snowball, разработанный Мартином Портером. Алгоритм поддерживает большинство популярных языков. Подробнее об алгоритме можно почитать тут.

#snowball
  • ❤ 1
  • 👍 1
  • 👎 1
More from @python_academy
  1. Sep 23, 2026Возврат нескольких значений из функции Знаете ли вы, что можно осуществлять возврат нескол…
  2. Sep 22, 2026Получение срезов итераторов Если вы попытаетесь получить срез итератора, то столкнётесь с…
  3. Sep 21, 2026Хэширование Хэш — это целое число фиксированного размера, которое идентифицирует определен…
  4. Sep 20, 2026Понимание различий между операторами сравнения == и is Множество разработчиков сталкиваютс…
  5. Sep 19, 2026Быстрый deque deque предпочтительнее, чем обычный список, когда нужны более быстрые операц…
  6. Sep 19, 2026⁠Упаковка параметров с помощью urlencode Довольно часто приходится работать с разнообразны…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →