TGViewer
Big Data Science Big Data Science @bdscience · 3.57K subscribers
Post #197 1.15K
🤜🏻От слов к делу: 3 NLP-метода векторизации слов в PySpark
Обработка естественного языка (NLP, Natural Language Processing) предполагает перевод обрабатываемых слов в числовую форму с последующей векторизацией полученных данных для передачи алгоритмам машинного обучения. Для этого в Apache Spark можно использовать следующие методы:
• CountVectorizer, который считает, сколько раз слово встретилось в документе (предложении, абзаце, посте, комментарии). CountVectorizer возвращает разреженные вектора (sparse vectors), значения в которых отсортированы по частоте встречаемости слова.
• TF-IDF – метод векторизации признаков, часто используемый при анализе текстов. Он помогает отразить важность слова в отдельном документе и в целом наборе (корпусе). TF-IDF состоит из Term Frequency (TF, частота слова) и Inverse Document Frequency (IDF, обратная частота документа). TF – это отношение встречаемости слов к общему числу слов в документе. IDF считается для каждого слова в словаре, а не в документе. Интересно, что в PySpark, в отличие от Python-библиотеки Scikit-learn, части TF и IDF считаются отдельно друг от друга. TF можно также посчитать через CountVectorizer или его более быстрый аналог HashingTF, в котором индексы значений хранятся в хэш-кодах, вычисляемых через алгоритм MurmurHash3. В PySpark за вычисление IDF отвечает одноименный класс, метод fit() которого возвращает объект IDFModel, куда следует передать результат TF (HashingTF или CountVectorizer).
• Word2Vec – нейросеть, вычисляющая распределенное векторное представление слов, которое считается одним из самых эффективных методов векторизации в NLP, и используется для распознавания именованных сущностей, устранения неоднозначностей, синтаксического анализа и машинного перевода. Векторизация Word2Vec в PySpark выполняется с помощью одноименного метода. В аргументах метода, кроме входного датасета и результата, можно также указать длину векторного представления vectorSize (по умолчанию 100) и minCount – минимальное число встречаемости слова, чтобы включить его в словарь модели и избавиться от редких слов.
More from @bdscience
  1. Nov 27, 2025💎 Imagen AI — an intelligent Adobe Lightroom assistant that automates photo editing by le…
  2. Oct 28, 2025🌐 OpenAI has released ChatGPT Atlas Atlas is a browser with an integrated AI sidebar, bui…
  3. Sep 16, 2025🤖 Nanobanana.ai is an AI aggregation platform that provides unified subscription-based ac…
  4. Jul 30, 2025🏀 Photoleap by Lightricks is a premier AI-powered image editing app that seamlessly blend…
  5. Jun 19, 2025⚙️ Rumi Labs transforms passive media into interactive entertainment A San Francisco-based…
  6. May 27, 2025📈Genspark AI: the autonomous super-agent for multi-step business workflows 🧠 Mixture-of-…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →