TGViewer
Научно-просветительский проект "Стройка века" Научно-просветительский проект "Стройка века" @century_arch · 382 subscribers
Post #1097 110
Трансформеры

В предыдущей статье мы с вами поговорили о RNN — прекрасной архитектуре, но все-таки с некоторыми минусами. И сегодня мы рассмотрим альтернативную архитектуру — трансформеры. Эта инновационная архитектура актуальна вследствие нескольких проблем RNN:

Во-первых, RNN содержат всю информацию о последовательности в скрытом состоянии, которое обновляется с каждым шагом. Если модели необходимо “вспомнить” что-то, что было сотни шагов назад, то эту информацию необходимо хранить отдельно . Следовательно, придется иметь либо очень большое скрытое состояние, либо мириться с потерей информации.
Во-вторых обучение рекуррентных сетей сложно распараллелить: чтобы получить скрытое состояние RNN-слоя для шага i+1, необходимо вычислить состояние для шага i
Механизм внимания
Уникальная особенность трансформеров, позволяющая нам справиться с этой проблемой — “механизм внимания”. “Механизм внимания” основывается на трех сущностях: “Запросы” (Q, Что я ищу?), “Ключи” (K, Как я могу быть описан?) и “Значения” (V, Какую информацию я несу?). Механизм вычисляет, насколько каждый запрос соответствует каждому ключу, получая веса внимания, которые показывают степень важности других слов. Затем эти веса используются для построения взвешенной суммы их значений, создавая представление слова, отражающее контекст.

Чтобы разобраться, давайте обратимся к математической формуле внимания. Внимание(Q, K, V) = Softmax((Q * K^T) / scale) * V., где Q * K^T — шаг сравнения, Softmax(…) — функция активации, о которой мы говорили в предыдущих статьях (нормализация), * V — взвешенное суммирование смыслов (шаг извлечения контекста).

Multi-Head Attention
Однако, одного механизма внимания мало. Ведь бывают сложные предложения, с разнообразными связями между словами. Чтобы выявлять их все одновременно, трансформер использует Multi-Head Attention. Этот механизм можно сравнить с работой команды, где каждый участник работает со своей специализацией. Например, первый участник ищет связи между субъектом и действием, второй между действием и объектом, а третий — логические связи. Таким образом, multi-head attention позволяет выявлять разные типы связей в данных, применяется: параллельно запускаются несколько блоков внимания с разными параметрами, а их результаты объединяются.

Таким образом, трансформер состоит из следующих слоев энкодер (для анализа) и декодер (для генерации), каждый из которых состоит из следующих блоков: слой эмбеддинга, multi-head attention, полносвязная нейросеть, остаточные связи (для перебрасывания информации между слоями нейросети), и нормализация. Если вам что-то из этих слоев кажется незнакомым — посмотрите предыдущие статьи, чтобы углубиться в устройство нейронных сетей.

Хоть трансформеры изначально были разработаны для обработки текста, они успешно применяются и в других сферах, например для анализа изображений или генерации.

Автор:
#Алексеенко_Недышилова

Редактор:
#Сабуров
#Ершов

#Заметка
#IT
  • ❤ 4
More from @century_arch
  1. Sep 12, 2026Channel name was changed to «Научно-просветительский проект "Стройка века"»
  2. Jul 25, 2026Бактериофаги - древние вирусы бактерий и главные драйверы эволюции. Вероятно, самая распро…
  3. May 25, 2026Вы когда-нибудь задумывались о том, как восстанавливается чувствительность после травм? По…
  4. Apr 25, 2026Мы всегда держим слово! Готов наш новый сборник! На этой неделе мы публиковали заметки пос…
  5. Apr 25, 2026Суда - это древнейший вид транспорта насчитывающий более 5 000 лет. Кочи, речные суда, ато…
  6. Apr 23, 2026В начале была буква, и буква была – нуклеотид. А, Т, Ц, Г. Припоминаете что-то такое еще с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →