TGViewer
Виктор Прогает в Сербии Виктор Прогает в Сербии @viktorprogger_channel_ru · 115 subscribers
Post #372 173
Субквадратичное внимание
Недавно вышла статья ребят из SubQ: они придумали и реализовали механизм субквадратичного внимания. Рассказать о нем вменяемо не вдаваясь в технические детали крайне сложно, поэтому ограничусь самыми общими словами: вместо того, чтобы перемножать матрицы параметров для вычисления внимания по каждому токену из истории, оно выбирает только те токены, которые напрямую относятся к текущему запросу. Ещё и ограничивает их по количеству. Благодаря этому алгоритму сложность вычисления векторов внимания падает с квадратичной O(n²) до почти линейной O(n). Что даёт огромный буст к производительности на большом контексте, а стало быть - делает LLM дешевле.
Для сравнения: на контексте в 128к токенов бенчмарка RULER LLM от SubQ показала 97% точности против 94% у Opus 4.6. И по стоимости это вышло $2600 за апишку Антропиков против $8 за инференс на своем железе у LLM SubQ.
Понятное дело, что сравнивать цену АПИ с ценой инференса на своем железе некорректно, но и разница тут не в 2 и даже не в 10 раз.

А еще SubQ уже запустили свою апишку к LLM с аж 12 миллионами токенов контекста! И обещают приличную точность даже на таком объеме. 12, Карл!

Что дальше? Диффузионные модели?
Есть еще такие замечательные вещи как диффузионные LLM. Они создают текст так же, как картинку: сначала появляется шум заданного размера, а затем он за несколько шагов уточняется (это называется денойзинг: из шума появляются корректные очертания). Это не особо популярная технология, потому что ее не выгодно гонять в облаке: у обычных трансформеров (GPT) GPU нагружен постоянно сразу кучей пользователей. Видеокарта отдает токен и сразу же считает другой токен. Возможно, уже другого пользователя. Ноль простоя железа, ноль задержки для пользователей при стриминге. В случае с денойзингом сгенерированный видеокартой ответ не имеет смысла до тех пор, пока не пройденые ВСЕ его шаги (скажем, 20 шагов). Плюс к этому независимо от длины полного ответа, даже если он состоит из одного токена, видеокарта обрабатывает холст полного размера, скажем 256х256 токенов. В итоге получаются лишние вычисления, а пользователи стоят в очереди и ждут, пока API ответит всем остальным вместо того, чтобы увидеть 1 следующий токен своего ответа.
Но чем диффузионки хороши?
А тем, что полный ответ вычисляется значительно быстрее и дешевле, чем в случае с архитектурой GPT, потому что количество обсчетов матриц внимания равно количеству шагов денойзинга. При ответе в 1000 токенов эта архитектура оказывается в 4-5 раз быстрее GPT. Для инференса на своей видеокарте это прекрасно. А еще, как я упомянул раньше, они при генерации ответа видят его весь целиком, благодаря чему снижается шанс словить галюцинацию очередного токена.
Но почему я сейчас о них вспомнил? Все просто: дифузионные модели тоже расчитывают матрицы внимания. Большая разница состоит в том, сколько раз это происходит: если шагов денойзинга у нас 20, то и расчеты произведутся 20 раз. И точка. Но сложность самих расчетов все еще зависит от длины контекста, где и прячется все та же O(n²). И если эти расчеты заменить на алгоритмы субквадратичного внимания с его линейной сложностью, то мы получим как буст к скорости работы с длинным прыдыдущим контекстом, так и повышенную точность на гигантских контекстах.

Когда же ждать диффузионные большие языковые модели с субквадратичным вниманием??
Ответ простой и сложный одновременно: когда у разработчиков появится свободное время, а у компаний - потребность в пиаре. Две огромные проблемы - это то, что диффузионки не нужны облачным провайдерам LLM, и что стоимость их обучения просто космическая. Поэтому одиночки-энтузиасты ничего не смогут сделать, как бы ни хотели. Будем ждать очередной акт невиданной щедрости, например от Google вроде обновленной DiffusionGemma. Если они захотят, конечно.

#ai
  • 🔥 6
  • ❤ 1
  • 👏 1
More from @viktorprogger_channel_ru
  1. Oct 7, 2026У Yii3 снова поднялся вопрос шедулера: мол, будет ли такой пакет? У Yii2 такой был, у Лары…
  2. Sep 16, 2026Вам интересны LLM? У меня уже есть некоторый опыт в работе с ними: ▫️ Использование в алго…
  3. Sep 15, 2026По уже сложившемуся распределению видно, что я жестоко ошибался ☺️ Каюсь, и впредь буду де…
  4. Sep 15, 2026Post #384
  5. Sep 14, 2026Быстрый файловый обмен WSL ↔️ Windows Вчера Леонид @nex_otaku принес благую весть: он сдел…
  6. Sep 10, 2026Немного нелепого вам в ленту
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →