TGViewer
Машинное обучение RU Машинное обучение RU @machinelearning_ru · 18.2K subscribers
Post #2992 2.13K
🚀 Оптимизация Sparse Attention для LLM

Flash Sparse Attention (FSA) предлагает эффективную реализацию нативного разреженного внимания, улучшая производительность на современных GPU. Этот репозиторий включает уникальный дизайн ядра, который минимизирует объем памяти и вычислений, что позволяет значительно ускорить обработку.

🚀 Основные моменты:
- Эффективная реализация для LLM на GPU.
- Уменьшение объема памяти и вычислений.
- Поддержка различных размеров групп GQA.
- Оптимизированный Triton-код для повышения производительности.

📌 GitHub: https://github.com/Relaxed-System-Lab/Flash-Sparse-Attention

@machinelearning_ru
  • 👍 3
  • ❤ 1
More from @machinelearning_ru
  1. Sep 30, 2026🧠 Открытые нейросетевые фреймворки представили на главной конференции по рекомендательным…
  2. Sep 29, 2026Intern-Decision - новая серия компактных моделей для принятия решений по тексту и изображе…
  3. Sep 28, 2026Anthropic выпустила Claude Sonnet 5.5 - новую модель с упором на код, агентные задачи и по…
  4. Sep 28, 2026🦾 Практический RecSys: собери рекомендательную ленту с помощью ML — на бесплатном вебинар…
  5. Sep 26, 2026Жиза
  6. Sep 24, 2026🚨 ИИ-агенты пытались взломать сайты, выполняя обычные задачи по поиску данных Исследовате…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →