К такому выводу я пришел, обучая модели-эмбеддинги и MLP - то есть модели, с которых начиналось развитие LLM. Сначала я обучил простую, но исторически важную Word2Vec модель c архитектурой SkipGram. Эта модель, описанная в статье Efficient Estimation of Word Representations in Vector Space, заложила один из первых важных камней в фундамент будущих LLM, так как эмбеддинги являются первой абстракцией над токенами. В более раннем посте я сравнил их с идеями. Эмбеддинг токена - это его абстрактное, но изолированное пока еще представление, нет механизма для моделирования связей между токенами. Смысл комбинаций токенов зависит от их позиций в латентном пространстве, на что опирается feed-forward network типа многослойного перцептрона.
В языковой топологии, конкретно - морфологической структуре, роль эмбеддингов играют односложные корни слов в некоторых языках (моносиллабических). В китайском, вьетнамском, тайском, лаосском - основных моносиллабических языках - слова главным образом независимы. Эти языки изолирующие по строю, то есть смысл в них зависит от порядка неизменяемых слов. Более простые признаки отдельных слов складываются в новые смысловые конструкции путем комбинации в определенном порядке.
我 去 北京
я ехать Пекин
Sequence Models - следующая ступень после MLP - уже заставляет токены влиять друг на друга, чтобы позиция токена могла изменять смысл всей последовательности. Рекуррентную сеть очень просто сделать из нескольких MLP, которые последовательно передают друг другу состояние, строя смысл постепенно:
h_t = F(x_t, h_{t-1}). F здесь это MLP-блок, но соседние блоки уже могут влиять на него через рекуррентное состояние h_{t-1}.В языках есть принцип, действующий именно так - это агглютинация. Суффиксы, каждый с определенным значением, присоединяются к основе один за другим, последовательно меняя смысл слова. Например, в турецком:
ev = дом
evler = дома
evlerde = в домах
Сравните с RNN, где каждый новый вход слегка модифицирует предыдущее состояние. Как и в рекуррентных моделях существует необходимость хранения длинных последовательностей, так и в агглютинативных языках - например, в финском и том же турецком - слова могут достигать десятков символов.
Наконец, трансформер - это аналогия флективных языков, где при словообразовании используется фузия. В трансформере значение токена формируется не последовательным накоплением, а взаимодействием множества признаков одновременно:
token_i + attention ко всем token_j
После нескольких слоёв получается распределённое представление, смесь признаков, которую уже нельзя разложить на их исходные векторы. Также во флективных языках одна морфема одновременно выражает несколько грамматических категорий.
стол-ом
Окончание
-ом одновременно кодирует единственное число, творительный падеж, мужской род, тип склонения. Эти признаки уже не отделяются друг от друга.Вопрос, что такого в том, что искусственные языковые модели "зеркалят" естественные? А в том, что топология языка влияет на LLM, и глубину этого влияния еще предстоит исследовать. Откуда берутся "эмерджентные" способности, которые модель не учит напрямую, и такое малопонятное явление, как In-Context Learning? Если они не закодированы в весах модели, то не в самом ли естественном языке?