Субквадратичное внимание
Недавно вышла статья ребят из SubQ: они придумали и реализовали механизм субквадратичного внимания. Рассказать о нем вменяемо не вдаваясь в технические детали крайне сложно, поэтому ограничусь самыми общими словами: вместо того, чтобы перемножать матрицы параметров для вычисления внимания по каждому токену из истории, оно выбирает только те токены, которые напрямую относятся к текущему запросу. Ещё и ограничивает их по количеству. Благодаря этому алгоритму сложность вычисления векторов внимания падает с квадратичной O(n²) до почти линейной O(n). Что даёт огромный буст к производительности на большом контексте, а стало быть - делает LLM дешевле.
Для сравнения: на контексте в 128к токенов бенчмарка RULER LLM от SubQ показала 97% точности против 94% у Opus 4.6. И по стоимости это вышло $2600 за апишку Антропиков против $8 за инференс на своем железе у LLM SubQ.
Понятное дело, что сравнивать цену АПИ с ценой инференса на своем железе некорректно, но и разница тут не в 2 и даже не в 10 раз.
А еще SubQ уже запустили свою апишку к LLM с аж 12 миллионами токенов контекста! И обещают приличную точность даже на таком объеме. 12, Карл!
Что дальше? Диффузионные модели?
Есть еще такие замечательные вещи как диффузионные LLM. Они создают текст так же, как картинку: сначала появляется шум заданного размера, а затем он за несколько шагов уточняется (это называется денойзинг: из шума появляются корректные очертания). Это не особо популярная технология, потому что ее не выгодно гонять в облаке: у обычных трансформеров (GPT) GPU нагружен постоянно сразу кучей пользователей. Видеокарта отдает токен и сразу же считает другой токен. Возможно, уже другого пользователя. Ноль простоя железа, ноль задержки для пользователей при стриминге. В случае с денойзингом сгенерированный видеокартой ответ не имеет смысла до тех пор, пока не пройденые ВСЕ его шаги (скажем, 20 шагов). Плюс к этому независимо от длины полного ответа, даже если он состоит из одного токена, видеокарта обрабатывает холст полного размера, скажем 256х256 токенов. В итоге получаются лишние вычисления, а пользователи стоят в очереди и ждут, пока API ответит всем остальным вместо того, чтобы увидеть 1 следующий токен своего ответа.
Но чем диффузионки хороши?
А тем, что полный ответ вычисляется значительно быстрее и дешевле, чем в случае с архитектурой GPT, потому что количество обсчетов матриц внимания равно количеству шагов денойзинга. При ответе в 1000 токенов эта архитектура оказывается в 4-5 раз быстрее GPT. Для инференса на своей видеокарте это прекрасно. А еще, как я упомянул раньше, они при генерации ответа видят его весь целиком, благодаря чему снижается шанс словить галюцинацию очередного токена.
Но почему я сейчас о них вспомнил? Все просто: дифузионные модели тоже расчитывают матрицы внимания. Большая разница состоит в том, сколько раз это происходит: если шагов денойзинга у нас 20, то и расчеты произведутся 20 раз. И точка. Но сложность самих расчетов все еще зависит от длины контекста, где и прячется все та же O(n²). И если эти расчеты заменить на алгоритмы субквадратичного внимания с его линейной сложностью, то мы получим как буст к скорости работы с длинным прыдыдущим контекстом, так и повышенную точность на гигантских контекстах.
Когда же ждать диффузионные большие языковые модели с субквадратичным вниманием??
Ответ простой и сложный одновременно: когда у разработчиков появится свободное время, а у компаний - потребность в пиаре. Две огромные проблемы - это то, что диффузионки не нужны облачным провайдерам LLM, и что стоимость их обучения просто космическая. Поэтому одиночки-энтузиасты ничего не смогут сделать, как бы ни хотели. Будем ждать очередной акт невиданной щедрости, например от Google вроде обновленной DiffusionGemma. Если они захотят, конечно.
#ai
Post #372
173
- 🔥 6
- ❤ 1
- 👏 1