Evidence of Linear Superposition in LLMs
Языковые модели ЕЩЁ ЛИНЕЙНЕЕ, чем мы думали. Это, конечно, какой-то смех, но если тупо усреднить инпут-эмбеддинги у входных текстов, то LLM будет в аутпуте продолжать оба текста сразу. То есть она может параллельно о двух разных вещах думать и разбираться в усреднённых активациях, распутывая их. Похоже, это следствие линейности внутренних репрезентаций, которую я описывал в старой работе.
У меня тоже получилось немного помочь с этой статьёй и залететь в соавторы, но я там скорее рядом постоял просто. Все лавры Паше Тихонову за крутую находку.
Статья
Post #461
7.69K