TGViewer
Ebout Data Science | Дима Савелко Ebout Data Science | Дима Савелко @eboutdatascience · 7.74K subscribers
Post #47 1.26K
Предобработка данных - г#&%о!

Сегодня поговорим об языковых моделях, их токенизации и том нужно ли для них предобработывать текстовые данные или нет ? 🥸

Модели 🤖
В word2vec, glove используется токенизация по словам, то есть каждому слову даётся айдишник ,и на инференсе выдаются эмбеддинги слов.
В FastText используются n-grams, слово делится на кусочки, и на инференсе эмбеддинги кусочков агрегируются в один эмбеддинг.
В BERT моделях используются BPE - это алгоритм сжатия данных, который заменяет наиболее часто встречающиеся пары байтов на новый байт, который не встречается в последовательности - очень круто сжимает данные.
Например: крышесноснящий при токенизации превратиться в примерно что-то такое: крыш###, ###снос###, ###ящий

Предобработка данных в языковых моделях 🧮
Под предобработкой я подразумеваю следующие операции над текстом: стемминг, лемматизация, удаление стоп слов, очистка от пунктуации.
В word2vec, glove, FastText - предобработка очень важна, так как их токенизация и архитектура не может запомнить зависимость прошедшего времени в слове от какой-нибудь другой сущности в тексте, а в BERT моделях лучше не предобработывать данные, так как их токенизация и механизм внимания позволяет запомнить связи между грамматикой. Но стоит отметить, что любой мусорный (без информации) текст всё таки стоит удалить.

Например 🙌
Я брал текста из статей, которые разделены на темы: спорт, война, инициация, Путин...
На первой картинке с обработкой, на второй - без. Модель: miniLM (Это SBERTовая модель). Каждый цвет - это топик статьи.
Как видно из распределений на первой картинке (с обработкой) - всё в кучу по сравнению со второй (без обработки). Это означает, что эмбеддинги статей получились лучше для текста без предобработки, так как распределения стали лучше различимы, они не смешиваются в кашу, как на первой картинке. Стоить заметить, что мы сделали такой вывод, только исходя из разметки статей.
  • 👍 2
  • 🔥 2
  • ❤ 1
More from @eboutdatascience
  1. Oct 6, 2026Post #711
  2. Oct 1, 2026Симулятор Дата Суетолога - отзыв действующего слона 🚬 В предыдущих постах (первый пост, в…
  3. Sep 29, 2026Как выбрать трек: Classic ML, NLP/LLM или Agents 🍔 Мне часто прилетает вопрос в ЛС: Дим,…
  4. Sep 28, 2026Запись эфира про накрутку, ИИ на собесах, двух работах со стороны лида из Сбера 🤑 Ребят,…
  5. Sep 25, 2026Эфир - Что спросим у лида из Сбера? 👀 УЖЕ ЗАВТРА, то есть в субботу, 26 сентября в 18:00…
  6. Sep 25, 2026РАЗБОР СОБЕСА в Т-Банк на 350к middle+ по NLP, LLM, Agents - НОВЫЙ ДРОП 😎 Выложил разбор…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →