Subquadratic всё еще не выкатили карточку модели, но появились независимые бенчи:
* В 56 раз быстрее FlashAttention-2 на 1М токенов контекста
* Снижение количества математических операций в 62.8 раза. Для сравнения, MoE дает экономию в 4-8 раз по сравнению с плотной моделью.
* SWE-Bench Verified — 81.8%, то есть ускорение не приводит к падению качества
* RULER на 128K токенов — 95.6%, MRCR на 512K–1M — 86.2%. Доказывает, что модель действительно не упускает важные данные из контекста, результаты на уровне SOTA.
По-прежнему нельзя уверенно утверждать, что это не скам. Нет подтверждения внутренним замерам на 12М контекста. Но теперь Appen поставили на кон свою репутацию.
Очень хочу верить, что мы в скором времени получим практически неограниченное контекстное окно и резкое падение стоимости инференса в придачу!
@devspotting
Post #135
827
Гриненко про ИИ, бизнес и образование Subquadratic Selective Attention: запихнуть в контекст весь репозиторий и не разориться UPD: есть мнение, что это скам. Добавился в их дискорд, наблюдаю. Малоизвестный (по крайней мере для меня) стартап Subquadratic опубликовал технические детали по своей…Appen Benchmarking Subquadratic’s latest model & SSA Kernel | Appen 56× faster than FlashAttention-2 at 1M tokens. Independent efficiency, retrieval, and SWE-Bench benchmark of sparse self-attention. Download the full report.
- 👍 7
- 🔥 4
- 🙏 2