👍🏻4 полезные Python-библиотек для NLP!
Часто Data Scientist’у нужно решать маленькие NLP-задачи, которые не реализованы в популярных и крупных фреймворках. Поэтому будет полезно знать о небольших библиотеках с отличной документацией и удобным интерфейсом, которые помогут справиться со специальными видами обработками текстов:
• EMOT – библиотека для обнаружения эмотиконов и эмодзи. Она пригодится, если нужно предварительно обработать текстовые данные, чтобы удалить эмотиконы с эмодзи или изучить их влияние на семантику текста. На практике это подходит для анализа данные из соцсетей, например, Twitter. https://github.com/NeelShah18/emot
• Flastext – библиотека для извлечения и замены ключевых слов в предложениях. Благодаря использованию собственных алгоритмов, она работает гораздо быстрее регулярных выражений. https://github.com/vi3k6i5/flashtext
• Numerizer – библиотека, которая переводит числа, записанные словами на английском языке, в набор арабских цифр. Это пригодится в NLP-задачах, где требуется извлечь данные из текста. https://github.com/jaidevd/numerizer
• Word-to-Number-Russian – аналог Numerizer для перевода числительных на русском языке. https://github.com/SergeyShk/Word-to-Number-Russian
Post #198
1.27K