Всем привет. Сегодня хочу поделиться видео «Attention in Transformers – step-by-step», которое показывает, как именно под капотом работают большие языковые модели (LLM), построенных на архитектуре Трансформеров.
Механизм attention - это то, что позволяет LLM «понимать», как одно слово связано с другим, даже если они далеко друг от друга в тексте. Благодаря ему модели могут работать с длинными контекстами, реагировать на синонимы и удерживать смысл.
Что происходит внутри:
⁃ Каждое слово превращается в вектор и порождает три компонента: Query (Q), Key (K), Value (V).
⁃ Модель вычисляет, насколько каждый Query «связан» с каждым Key и дает веса (attention scores).
⁃ Затем эти веса применяются к Value-векторам и получается новое представление слова, уже учитывающее контекст.
⁃ Механизм Multi-Head Attention позволяет смотреть на данные сразу с разных «углов» и извлекать разные зависимости.
Поэтому если вы хотите лучше понимать, как модели LLM предсказывают слова при написании ответа, как работают векторные БД, то данное видео советую посмотреть обязательно.
Ссылка на видео
Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #60
601

- 👍 3
- 🔥 1