TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1303 2.9K
⚡ SageAttention — революция в скорости работы трансформеров

Исследователи из THU-ML представили инновационный метод ускорения attention-слоёв, который не требует изменения архитектуры моделей. Проект использует интеллектуальное 8-битное квантование матриц внимания, сохраняя при этом точность оригинальных моделей.

На новых GPU RTX 5090 решение показывает впечатляющие 2.7x ускорение по сравнению с FlashAttention-2. Технология уже интегрируется в популярные фреймворки, для тестирования достаточно заменить одну строку кода.

🤖 GitHub

@bigdatai
  • 👍 5
  • ❤ 2
More from @bigdatai
  1. Oct 4, 2026🔥 Бесплатный курс по Claude Code на русском: от установки до команды агентов На GitHub вы…
  2. Oct 4, 2026Agent harness: шесть решений, после которых ИИ-агента можно оставить одного Агент рапортуе…
  3. Oct 2, 2026ИИ Speculative decoding: зачем большой модели черновик от маленькой? Наруто пишет вперёд ч…
  4. Oct 2, 2026🚨 Anthropic начала жёстче блокировать доступ к Claude из Гонконга. Пользователи, которые…
  5. Oct 1, 2026OpenAI раскрыла масштабную попытку вытащить скрытые рассуждения своих моделей. След ведёт…
  6. Sep 30, 2026🚨 Claude-Red: библиотека навыков для пентестов с Claude. В репозитории собраны файлы SKIL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →