TGViewer
Гриненко про ИИ, бизнес и образование Гриненко про ИИ, бизнес и образование @devspotting · 3.12K subscribers
Post #127 847
Subquadratic Selective Attention: запихнуть в контекст весь репозиторий и не разориться

UPD: есть мнение, что это скам. Добавился в их дискорд, наблюдаю.

Малоизвестный (по крайней мере для меня) стартап Subquadratic опубликовал технические детали по своей модели на базе новой архитектуры Subquadratic Selective Attention. И это звучит как очередной прорыв: 12М контекста и 52x ускорение по сравнению с FlashAttention на 1M токенов.

Проблема

Классический аттеншн — квадратичный. Удвоил контекст — получи в четыре раза больше вычислений. Поэтому топовые модели биллят длинный контекст заметно дороже. При этом качество на длинном контексте ощутимо деградирует. FlashAttention эффективнее по памяти, но вычислительная сложность никуда не девается.

Что такое SSA

Subquadratic Selective Attention — вместо вычисления для всех пар токенов подряд, алгоритм сначала определяет, какие позиции вообще релевантны по смыслу, и работает только с ними. Content-dependent routing — модель смотрит туда, где что-то есть, а не туда, куда велит позиция в последовательности.

Итого
- Линейная сложность — растёт с числом выбранных позиций, а не со всей длиной контекста
- Смысловой роутинг — важное достаётся независимо от того, где оно лежит
- Точное извлечение — конкретный факт из начала контекста не «размазывается»

Кстати, DeepSeek Sparse Attention (DSA), которую мы обсуждали в посте про DeepSeek V4, — тоже разреженная, но квадратичная: там lightning-индексер честно перебирает все пары query-key с теми же O(n²).

Цифры

Prefill speedup над стандартным dense attention (с FlashAttention-2) на B200:
- 128K токенов → 7.2×
- 256K → 13.2×
- 512K → 23.0×
- 1M токенов → 52.2×

По качеству — на MRCR v2 (это не «найди иголку в стоге», а «собери и свяжи несколько разбросанных фактов»): SubQ набирает 65.9%. Для сравнения: Opus 4.6 — 78%, GPT 5.4 — 39%, Gemini 3.1 Pro — 23%. Да, они опережают два из трёх флагманов на самом жёстком long-context бенче.

На SWE-Bench Verified 81.8% — лучше Opus 4.6 и Gemini 3.1 Pro, но уступает Opus 4.7 (87.6%).

При этом обещают цену в 5% от цены на Opus!

Заявления смелые, стартап новый, model card еще нет. Но если всё правда — вскоре можно ожидать условно безграничный контекст и у ключевых игроков!

Поменяется ли ваш подход к разработке, если в каждый запрос можно будет смело закидывать весь проект целиком?

@devspotting
  • 🔥 12
  • 🤔 3
  • 👍 2
  • ❤ 1
More from @devspotting
  1. Sep 17, 2026#ГриненкоПро №25 с Анастасией Бианко, руководителем отдела подбора персонала в Циан https:…
  2. Sep 17, 2026Аркадий, а что мы ускорили? Помните Аркадия, которого мы просили убрать руки с клавиатуры?…
  3. Sep 16, 2026На OpenRouter очередная бесплатная стелс-модель — Union Alpha. UPD: лавочка закрылась, мод…
  4. Sep 15, 2026Шестой выпуск «ИИ — не новостей» уже на Ютубе (или на ваших любимых стримингах). На этот р…
  5. Sep 15, 2026But I'm likely human after all I'm likely human after all Don't put your blame on me Don't…
  6. Sep 14, 2026Недавно рассказывал, что указание агенту задавать недостающие вопросы может сильно повысит…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →