TGViewer
Start Career in DS Start Career in DS @start_ds · 11.5K subscribers
Post #467 8.08K
🤖Модели перевернувшие NLP: как устроен Transformer

Transformer - тип нейронной сети, который был представлен в 2017 году в работе Attention Is All You Need.

До появления Трансформеров в работе с текстом в основном использовали рекуррентные нейросети (RNN, LSTM и GRU). Трансформер же позволяет избавиться от ключевых недостатков рекуррентных сетей: отсутствие распараллеливания обучения и потеря контекста в длинных последовательностях.

Трансформеры используют головы механизма внимания (Multi-Head Self-Attention), которые позволяют таким моделям понимать естественный язык и решать ключевые проблемы RNN.

❗️Например: в предложении "Кошка сидит на ковре" механизм внимания позволяет модели оценить каждое слово и понять его важность в контексте других слов: Кошка (текущее слово): "сидит" (0.8), "на ковре" (0.6); сидит (текущее слово): "Кошка" (0.8), "на ковре" (0.7), на ковре (текущее слово): "Кошка" (0.6), "сидит" (0.7). Каждый слой механизма внимания может находить свои такие зависимости в предложении.

🧠Transformer имеет три основные части:
1. Кодировщик (Encoder) - преобразует исходное предложение в некий набор чисел (векторное представление - emdedding).
2. Механизм самовнимания (Self-Attention) - в процессе моделирования текста обращает «внимание» на все слова в предложении одновременно, чтобы понять, какие из них наиболее важны.
3. Декодировщик (Decoder) - использует информацию от блока кодировщика и слоёв внимания, чтобы пошагово генерировать текст.

🦾Модели на базе Трансформера:
- GPT (Generative Pre-trained Transformer) - обучен на большом количестве текста и может генерировать осмысленные ответы на вопросы. Хороший пример - ChatGPT.
- BERT (Bidirectional Encoder Representations from Transformers) - может строить векторное представление слов, используя контекст предложения с обеих сторон.

🔥 Дополнительно:
▫️Подробное объяснение работы трансформеров от Игоря Котенкова на ютуб - первое, что нужно посмотреть, если вы не в теме.
▫️Очень простой обзор статьи Attention Is All You Need на Хабре, подойдет новичку.
▫️Крутой гайд с полным обзором разработки языковых моделей на Хабре, много дополнительных ресурсов и доступные объяснения, будет полезно любому уровню.
▫️[ENG] Интерактивное объяснение работы трансформера на картинках, для визуалов.
▫️[ENG] Google Sheets, где вы сможете воспроизвести слой внимания своими руками.
▫️[ENG] Репозиторий с качественными ресурсами и гайдами для работы с большими языковыми моделями (LLM) для людей с продвинутым пониманием концепций NLP.

Пишите свои вопросы и комментарии!
Ставьте лайки❤️ и огоньки🔥 для следующих постов про NLP!
До встречи👋🏻
  • 🔥 46
  • ❤ 8
  • 👍 7
More from @start_ds
  1. Sep 1, 2026🔥 Соревнование от Группы «Интер РАО»: получи подготовленные данные и разработай ИИ-ассист…
  2. Aug 8, 2026Мы как-то просили вас пройти опрос про роли и зарплаты профессий вокруг ML и аналитики дан…
  3. Aug 8, 2026От стажёра до Head of DS: что я узнал, изучив почти 700 карьер в Data Science 🧬 Наконец-т…
  4. Jul 28, 2026Пора тряхнуть стариной и в этом канале, давненько тут ничего не было 🙂 Я в личном канале…
  5. Jul 28, 2026🏆 Преподавание ML студентам очно в Москве Знаю, что этот канал читают многие мои выпускни…
  6. May 12, 2026🏆 ML-соревнование на стыке ML, роботов и науки Ребята из CayleyPy делают крутую штуку на…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →