🤖Модели перевернувшие NLP: как устроен Transformer
Transformer - тип нейронной сети, который был представлен в 2017 году в работе Attention Is All You Need.
До появления Трансформеров в работе с текстом в основном использовали рекуррентные нейросети (RNN, LSTM и GRU). Трансформер же позволяет избавиться от ключевых недостатков рекуррентных сетей: отсутствие распараллеливания обучения и потеря контекста в длинных последовательностях.
Трансформеры используют головы механизма внимания (Multi-Head Self-Attention), которые позволяют таким моделям понимать естественный язык и решать ключевые проблемы RNN.
❗️Например: в предложении "Кошка сидит на ковре" механизм внимания позволяет модели оценить каждое слово и понять его важность в контексте других слов: Кошка (текущее слово): "сидит" (0.8), "на ковре" (0.6); сидит (текущее слово): "Кошка" (0.8), "на ковре" (0.7), на ковре (текущее слово): "Кошка" (0.6), "сидит" (0.7). Каждый слой механизма внимания может находить свои такие зависимости в предложении.
🧠Transformer имеет три основные части:
1. Кодировщик (Encoder) - преобразует исходное предложение в некий набор чисел (векторное представление - emdedding).
2. Механизм самовнимания (Self-Attention) - в процессе моделирования текста обращает «внимание» на все слова в предложении одновременно, чтобы понять, какие из них наиболее важны.
3. Декодировщик (Decoder) - использует информацию от блока кодировщика и слоёв внимания, чтобы пошагово генерировать текст.
🦾Модели на базе Трансформера:
- GPT (Generative Pre-trained Transformer) - обучен на большом количестве текста и может генерировать осмысленные ответы на вопросы. Хороший пример - ChatGPT.
- BERT (Bidirectional Encoder Representations from Transformers) - может строить векторное представление слов, используя контекст предложения с обеих сторон.
🔥 Дополнительно:
▫️Подробное объяснение работы трансформеров от Игоря Котенкова на ютуб - первое, что нужно посмотреть, если вы не в теме.
▫️Очень простой обзор статьи Attention Is All You Need на Хабре, подойдет новичку.
▫️Крутой гайд с полным обзором разработки языковых моделей на Хабре, много дополнительных ресурсов и доступные объяснения, будет полезно любому уровню.
▫️[ENG] Интерактивное объяснение работы трансформера на картинках, для визуалов.
▫️[ENG] Google Sheets, где вы сможете воспроизвести слой внимания своими руками.
▫️[ENG] Репозиторий с качественными ресурсами и гайдами для работы с большими языковыми моделями (LLM) для людей с продвинутым пониманием концепций NLP.
Пишите свои вопросы и комментарии!
Ставьте лайки❤️ и огоньки🔥 для следующих постов про NLP!
До встречи👋🏻
Post #467
8.08K
- 🔥 46
- ❤ 8
- 👍 7