Для чего большим языковым моделям нужен декодер?
Работая с LLM и изучая их внутренние алгоритмы, я пришел к одному интересному сравнению, которое решил объяснить в этом посте. Как известно, эволюция языковых моделей шла от простейших N-граммных к нейросетям, оперирующим текстовыми эмбеддингами. Главные изменения касались того, как именно модель описывала вероятностное распределение данных. Вначале это была статистическая таблица вероятностей со всеми возможными сочетаниями токенов из словаря, которая, как легко понять, не масштабируется - длина контекста сильно ограничена. Отсюда берет начало стимул к поиску представлений признаков в виде векторов меньших размерностей.
Но что собой представляют эти загадочные «латентные признаки», как не обобщение, или абстрактное представление реальных токенов, которые мы видим на выходе нейросети? Для того, чтобы вместить стремящееся к бесконечности множество вариантов, конечно, модели пришлось выучить абстракции над этими вариантами. Поэтому можно утверждать, что объектом внимания AI в процессе инференса являются не слова и не токены, а их общие прототипы, то есть идеи. Процесс преобразования такой абстрактной идеи под влиянием контекста в реальную последовательность токенов является декодингом.
То есть, латентные признаки соответствуют идеям человеческого разума до того, как эти идеи получат какую-либо отчетливую форму, а декодинг - тому процессу, к которому мы прибегаем, выражая общую мысль через подходящие по ситуативному контексту слова.
Post #188
1.31K
- 👍 12
- ❤ 3
- 🔥 3
- 👀 3