TGViewer
Channel Public Channel
Awesome DL

Awesome DL

@awesome_dl

Авторский канал: @anvilarth

Boost: https://t.me/awesome_dl?boost
Subscribers
871
Photos
30
Videos
4
Links
73
Recent Posts 20 shown
Post #107 549
Age of Autoresearch

Был обычный вечер, и мне было откровенно лень гонять гипотезы руками. Я описал pipeline текстом, попросил Gemini судить результат каждой попытки и лёг спать. Утром в логе было 40 проверенных гипотез.

Потом выяснилось, что у этого уже есть имя — autoresearch — и пара громких прецедентов до меня.

написание кода с ассистентом → делегирование подзадач → цикл, который перебирает сам

Написал эссе о том, что этот сдвиг делает с работой человека. Рецептов там нет, у меня их и нет — скорее попытка разобраться, что остаётся, когда знание «как устроена задача» перестаёт быть самой работой.

👉 /autoresearch.html

Заодно сделал блог agent-friendly: markdown-версия поста лежит на /autoresearch.md, весь сайт для агентов — /llms.txt. Так что можно просто кинуть ссылку в своего любимого агента и попросить пересказать.

Enjoy!
Andrei Filatov Age of Autoresearch Expertise moves from 'find the solution' to 'build the system that finds it'. Oracles, loops, pitfalls — and what remains for the human.
  • 🗿 10
  • 👍 1
Post #105 1.09K
Новая эра интерфейсов

Мне давно хочется создавать системы, которые живут и адаптируются как человек — прям как живое существо рядом с тобой. Чтобы сайт подстраивался лично под тебя, а не был статичной менюшкой для всех сразу. Меня всегда напрягало, что сайты вообще не адаптируются под человека: ну есть a/b по ui/ux, но концептуально сайт один и тот же для всех.

И тут в апреле вижу в твиттере демку flipbook.page — минимальное mvp, которое показало, что то, о чём я мечтаю, реально. Сайт полностью динамический, ни одной заранее написанной страницы. Кликаешь на объект — и новая страница генерится прямо сейчас, под твоим кликом. Идёшь дальше — мир достраивается под ногами и адаптируется под тебя. Я офигел.

Я хотел персонализированные динамичные сайты — а увидев, как это реализовано, понял: будущее за этим куда круче, чем я думал. Сайт же это просто интерфейс поверх контекста, который человек хочет тебе донести, — и он может собираться прямо под тебя. Покупаешь джин — тебе сразу показывают, как лучше намешать именно этот джин-тоник. Читаешь разбор FSDP или ring attention — видишь таблички и схемы, как всё работает. Ровно то, что зайдёт тебе.
И если генерить это в реальном времени — а что если твой телефон вообще не набор приложений, а персональный стриминг пикселей? Любое нажатие динамично, тебе не нужен ни текстовый ai, ни генерация приложений — оно само понимает, как должно выглядеть любое приложение, которое ты хочешь. Разработчики приложений становятся не нужны — не потому что их заменил ai, а потому что приложение это просто поток пикселей. Останутся только те, кто пилит сами модели.

И вот это самое крутое — что такое уже возможно, и это куда ближе, чем кажется. Реализуется оно через realtime-видеогенерацию — я как раз прикидывал, когда она наступит: на компах это на горизонте 2-3 лет, на телефонах подольше. А пришёл я к этой мысли, когда готовил доклад на DataFest в Белграде про realtime video generation — го смотреть. Может, и у вас появятся идеи.

Enjoy!
  • 🔥 15
  • ❤ 1
  • 👏 1
Post #103 1.18K
Krea-2: taste is what matters

4 месяца назад я перешёл в Krea и вчера мы выкатили модель Krea-2 и я мега рад этим поделиться.

Меня давно бесило что большинство image-моделей, тот же ChatGPT Image или Nano Banana, оптимизированы под среднюю красивую картинку — генеришь 4 варианта одного промпта и по факту получаешь один и тот же концепт просто под разными углами. Это убивает разнообразие стилей и прям не даёт выразить своё видение, каждая генерация тянет к центру, к усреднённому.

С Krea 2 мы реально занялись разнообразием — один и тот же промпт даёт реально разные концепты и эстетики. И ещё по верх этого сделали своё midjourney внутри Krea: reference-генерация и персональные мудборды — закидываешь свои референсы, собираешь мудборд, и модель тянет в твою сторону, а не к среднему. Получилось gucci.

Я как раз работал над одной из лучших штук в продукте — системой reference-генерации и мудбордами. И кстати, по независимому бенчмарку K2 топ-2 по следованию стилям, впереди только gpt-image-2.0 — при размере нашей команды и ресурсах это просто офигенный результат. А ещё за эти 4 месяца я сам дофига расширил своё видение стилей и красоты, прям сильно. Чего не сделаешь для крутого результата.

Короче, рад что вышло круто, смотреть тут → krea.ai/krea-2
  • 🎉 28
  • 😎 11
  • ❤ 8
  • 👍 1
Post #102 1.19K
История о том, как штука для рисования треугольников стала самым важным чипом на планете

Мы все каждый день используем GPU, но мало кто копался в том, какая история за ними стоит. Я решил разобраться с нуля — и больше всего меня зацепила красота инженерных решений: каждое следующее — прямое следствие предыдущего.

отрисовка треугольников → параллелизм → SIMD → unified cores → CUDA → ML → Tensor Cores

Ни одно звено не случайно. Когда видишь эту цепочку целиком — понимаешь, почему GPU устроен именно так.

Лонгрид на ~20 минут с интерактивными демками.

anvilarth.github.io/gpu-story.html

Enjoy!
anvilarth.github.io История о том, как штука для рисования треугольников стала самым важным чипом на планете История GPU от первых принципов
  • 🔥 18
  • ❤ 2
Post #101 1.24K
Когда мы получим realtime видео? Считаю от first principles (Лонгрид)

Мне всегда было интересно предсказывать будущее — на знании будущего можно заработать деньги, лучше определить путь своего развития. А как это делать?

Ответ у меня начал зарождаться в 2023, во время прослушивания интервью Хинтона о будущем искусственного интеллекта. Он упомянул, что скоро LLM будут инференситься на отдельных устройствах (смотря из 2026 так просто выглядит). Для меня это было непонятно — тогда я не задумывался об устройстве памяти, ограничениях вычислений. Я знал только, что есть A100/H100. А оказывается, создание специализированных чипов для инференса конкретной модели — один из самых эффективных методов ускорения, например Taalas, который с оговорками, но выдаёт 16k токенов в секунду, за счёт отсутствия универсальности CUDA и оптимизированного memory bandwidth

И тут я понял: глубинное знание базовых нюансов — скорость вычислений устройства, memory bandwidth — это ключ к пониманию того, где лимиты технологии и какие AI-продукты мы можем получить в ближайшие 5-10 лет (ну если AGI не наступит раньше).

Поэтому я решил сделать расчёты для близкой мне технологии — видеогенерации, а именно realtime видеогенерации: какой сейчас статус, что мы можем получить за счёт ускорения GPU и когда это дойдёт до мобильных устройств.

Сами расчёты — в лонгриде
Интерактивно потыкать и посмотреть как меняться будут предсказания можно — на сайте

Лонгрид
Демо

Enjoy!
Teletype First Principles расчёт realtime видеогенерации Для расчётов нам нужна конкретная архитектура, которую можно разложить на числа. Берём Wan2.1-14B — одну из лучших open-source моделей...
  • 🆒 7
  • 🔥 4
  • 😎 1
Post #100 1.21K
How to build your search engine?

Понимание бэкенда + архитектуры помогает делать ваш вайбкод one-shot готовым решением. Поэтому я люблю читать блоги про о том, как создается архитектура разных приложений - так нарабатывается насмотренность для решения архитектурых задач. А тут бац, и человек собрал свой поисковик с 0 нуля и рассказал все нюансы создания:

- как парсить данные
- как их готовить
- как их хранить
- как эффективно инференсить поисковик, чтобы не ждать вечность
- и сделать своё ai overview

Сохраняйте и читайте 🔖
  • 👍 8
Post #99 1.09K
Всем привет, live update: перехожу в стартап Krea.ai!

Год в роли тимлида был продуктивным. Выстроил систему генерации контента (горжусь почти реалтайм видео генерацией), пару раз спидранил идеи до прода меньше чем за 3 дня и чудо - начал писать код, который бэкендеры не хотят переписать сразу.

Сейчас понял: пора в эпицентр хайпа. Хочу в SF, поближе к умным ребятам и направлению World Models (мне очень нравится идея, что можно сгенерить целый мир по одному запросу). Мечта - собрать Skyrim или Minecraft по одному промпту и наконец-то легально вернуться в детство. Как только виза будет на руках, посмотрю вживую, как Скэм Альтман скамит народ. А пока кайфую от доступа к мощным GPU и будущей возможности погонять модели на B200.

Почему Krea? Чуваки выпустили свой тюн на реализм Flux и Realtime Video. У них крутая философия: моделям сейчас не хватает "вкуса", и они хотят как "Прометей" дать каждому инструменты, которые позволят выражаться каждому человек.

Короче, LFG! 🔥
  • 🔥 30
  • ❤ 19
  • 👍 2
  • 🤯 1
Post #98 2.44K
Привет! Меня зовут Олег, я исследую, как оптимально скейлить языковые модели в Jülich Supercomputing Centre. Пока Андрей подзаряжается энергией для будущих постов, с его позволения поделюсь тут нашей новой работой — “Optimal Scaling Needs Optimal Norm”. Всем, кто задумывался о правильном тюнинге гиперпараметров — будет интересно!

Главная проблема в скейлинге — как подбирать гиперпараметры (learning rate, batch size и т.д.) на масштабе >1B параметров и >100B токенов, когда перебор брутфорсом уже не вариант. Известные подходы вроде muP и других параметризаций гарантируют оптимальность при скейлинге модели, но не объясняют, что делать при увеличении размера датасета — скажем, с 1B до 1T токенов. Эмпирические scaling laws (пример или наша прошлая работа) помогают, но теории объединяющей всё вместе пока не существует.

Мы подошли к этой проблеме со стороны norm-based optimization. Сейчас на хайпе Muon, который бьёт Adam, а в основе всего лежит теория Jeremy Bernstein (Modular Duality) — очень советую глянуть, это прям база. Также этот подход позволяет отслеживать эволюцию норм по слоям, и именно в них оказывается кроется секрет оптимального скейлинга!

С Scion (улучшенная версия Muon) мы показали: чтобы достичь оптимального скейлинга одновременно модели и(!) датасета, нужно удерживать веса на одном и том же manifold’е — то есть сохранять норму весов постоянной при любом масштабе. Кроме того, мы вывели, как оптимально подбирать batch size и learning rate в этом сэтапе, выпустили Distributed Scion для тренировки на множестве GPU + открыли логи 2000+ экспериментов.

В общем, всех инсайтов вкратце не описать, так что гляньте статью — буду рад обсудить идеи и услышать ваши мысли в комментах 😌

И апвоутните нас на Hugging Face! Было бы круто попасть в топ Daily Papers, мы уже очень близко 🚀
arXiv.org Optimal Scaling Needs Optimal Norm Despite recent progress in optimal hyperparameter transfer under model and dataset scaling, no unifying explanatory principle has been established. For Adam and Scion optimizers, we discover that...
  • 🔥 12
  • ❤ 1
  • 👏 1
Post #96 1.59K
Пока я путешествую по разным странам и набираюсь опыта, у меня не всегда остаётся время писать в канал. Хотя идей накопилось немало — год назад я о многих из них даже не думал. Чтобы заполнить паузу и заодно набраться мотивации через новых подписчиков, решил поучаствовать в папке.

Я честно рекомендую ребят, которых приведу ниже — уделил время просмотру их контента:

- Тимлид и работа руками — про то, как совмещать управление и свои задачи от друга Сани, у которого еще есть офигенный канал про то как стать тимлидом.
- Коммуникация с бизнесом и умение говорить "НЕТ. Андрей круто рассказывает про то важно говорить, на желание построить космолёт.
- Путь Арины — Арина ведет канал уже долго и мне понравилось, что можно посмотреть на путь развитие в DS/ML человека, и найти себя в этом пути.
- Мотивация от Тани — Таня тоже рассказывает свой путь, но больше уделяет внимания внутренним переживаниям лично мне этого не хватает, часто контент это просто разбор статей+материалы, за которыми теряется реальный человек.
- Длинный опыт в DS — тут из подборки один из самых опытных челов. Тут вы узнаете больше про решение реальных кейсов и проблем. Мне такое часто помогает — я раньше писал, что 30 минутный разговор может спасти вам месяцы работы

Сама папка тут — уверен, каждому приглянётся хотя бы один канал.

А я продолжаю путешествовать 🚶‍♂️🌍

https://t.me/addlist/v5lLkN7LNPQ4MmJi
Telegram DS/DA Andrei Filatov invites you to add the folder “DS/DA”, which includes 16 chats.
  • ❤ 14
  • 🔥 10
  • 👏 4
  • 🗿 3
  • 😎 3
  • 🆒 1
Post #95
Awesome DL pinned «Пост знакомство Я Андрей Филатов – Team Lead Gen AI CV в стартапе, занимаюсь применением генеративных моделей для создания визуального контента: создание изображений/видео, редактирования изображений/видео, создание персонализированных генераций. В ML/DL…»
Post #94 2.41K
Пост знакомство

Я Андрей ФилатовTeam Lead Gen AI CV в стартапе, занимаюсь применением генеративных моделей для создания визуального контента: создание изображений/видео, редактирования изображений/видео, создание персонализированных генераций.

В ML/DL уже более 6 лет – с момента стажировки в Тинькоффе в 2019 году, где работал почти по соседству с Олегом Тиньковым и сохранил пару историй о нём. Затем был EPFL (где публиковался на NeurIPS) и работа в команде Kandinsky Sber AI.

Параллельно мне нравится делиться знаниями. Вёл курсы в МФТИ (DL), в HSE/Sber/Сколтехе (CV), сейчас техлид курса по диффузионным моделям. А ещё иногда помогаю студентам с научным руководством.

Философия канала

ML-контент в телеграм часто повторяется поэтому моё желание писать на аутентичные темы, что внести вклад в общее ML знание русскоязычного коммунити. А с дальнейшим развитием вещать и на международную аудиторию

📌 Ключевая идея: объяснять сложное просто, писать аутентично.

Что можно найти в канале?

🔹 Гайдбуки :
Диффузионные модели
Видео-диффузионные модели

🔹 Выступления и подкасты:
Генеративные аугментации, ещё один
Подкаст про искусство и ИИ

🔹 Разбор интересных тем:

Табличные данные в ML
Робототехника + ML (совместно с @TimeEscaper, он пишет в своём канале)
Kandinsky и важность синтетики
Синтетические данные в ML

💡 Если вам интересно сотрудничество, нужно консультация или просто интересно пообщаться, то пишите сюда @anvilarth
taskdiscovery.epfl.ch Task Discovery: Finding the Tasks that Neural Networks Generalize on Deformable Neural Radiance Fields creates free-viewpoint portraits (nerfies) from casually captured videos.
  • ❤ 46
  • 😎 4
Post #93
Channel photo updated
Post #92 1.46K
Хочу рассказать про канал моего друга Саида.

Саид уже сделал одну из топовых моделей на HF, а сейчас полностью ушёл в работу над своим стартапом AnyAgent. Немного завидую — он выбрал идею и просто пошёл её делать — человек пошел за мечтой.

AnyAgent — это ассистент, через который можно обновить календарь, запланировать встречу или распланировать день. Я попробовал сам — понравилось, как он помогает с микроменеджментом, особенно с календарём. Это то, что обычно забивает голову. Сейчас продукт находится в стадии бета тестировании и активно двигается к тому, чтобы создать единый портал для вашей жизни!

Если интересно смотреть, как продукт строится с нуля, или просто хочется попробовать такого “джарвиса” — советую подписаться на канал Саида
Telegram ASTEX | ИИ для Бизнеса Приношу клиентам прибыль через автоматизацию бизнес процессов - Внедрение ИИ в предприятия - Разборы реальных кейсов - Истории из опыта построения агентства Подпишись!) https://azizovhq.com
  • ❤ 6
  • 🔥 3
Post #91 1.58K
Создал агента для ответов на вопросы

В рамках своего вайб-кодинга я начал делать мини-демки, чтобы понять, какие полезные штуки можно собрать и параллельно своими действиями вдохновить людей создавать интересные вещи самостоятельно.

Сейчас на хайпе — агенты: те самые, которые должны решать за вас задачи, работать быстро и эффективно и вообще сильно упрощать жизнь.

В полноценную замену человека я пока не верю, но понимаю, что на API можно сделать много прикольных и реально полезных штук. Поэтому я провёл небольшой ресерч и пришёл к выводу:

Самое простое и полезное применение агентов — это работа с большими материалами в формате Q&A.


Логика очень простая:
- собираешь базу знаний,
- делаешь по ней быстрый поиск,
- и вуаля — можно разгрузить себе голову от однотипных ответов.

Так как я техлид по курсу «Диффузионные модели», я решил в рамках курса собрать MVP-бота, который будет отвечать на вопросы по материалам. Результатом стал бот: https://t.me/ImpressiveNameBot

Пока это базовая версия, которая может отвечать на ваши вопросы по диффузионным моделям и помогать в сложных терминах, но следующим шагом планирую добавить память.

За основу взял LangChain (от которого потом отказался из-за хостинга), к которому подключил OpenAI API. Код тут:

Я планирую дальше развивать бота (основное, что хочется сделать это добавить ему память), и тут мне очень помог пост о том, как можно работать с векторными индексами в LLM.

Помимо памяти, на Канале Доброго Вани ещё можно прочитать про технологическое предпринимательство, разного уровня материалы для Data Science, хакатоны — и много чего другого.


Как появится свободное время, думаю, допилю бота, чтобы можно было использовать его не только как Q&A, но и как полноценного ассистента.

P.S. Если у вас есть идеи как улучшить бота / добавить супер RAG, то буду рад любой помощи!)
Langchain LangChain: the open agent platform to own your intelligence LangChain enables every company to own their intelligence. Control, govern, and compound intelligence with an open agent engineering platform. Trusted by 7k+ organizations.
  • 🔥 3
Post #89 1.06K
Автоматизация контента в соцсетях

У меня всегда была идея, что круто писать на зарубежную аудиторию. Там и охваты выше, и расти можно быстрее, потому что международный рынок контента более конкурентный — сразу видно, работает твой контент или нет.

💡 Поэтому я решил выйти в открытый океан и попробовать писать туда. Но как человек ленивый, быстро понял, что самому что-то новое сочинять влом. Решил переписать свои старые посты. Потом стало влом и это — и я сделал бота, который сам конвертирует посты из телеги в формат для других соцсетей ( с переводом и форматированием).

С фидбэком от @fminxyz удалось довести первую версию до вменяемого состояния (пример на картинке это — https://t.me/fminxyz/30). Хотел уже выложить и дать всем попробовать, но Telegram внезапно выдал три бана на ботов и столько же раз выкинул из аккаунтов. Стало немного стрёмно.

Так что пока не выкладываю публично. Но если хочется потестить — просто скиньте ссылку на пост в личку, и я покажу, как он может выглядеть после конвертации. Пока что так, по-тихому 🙃.

P.S. В комментариях накинул еще примеров
  • 🔥 11
Post #88 864
o4-mini-high is AGI?

Короче, решил потестить o4-mini-high на проге. Это жесть.
‣ По сравнению с o3, намного быстрее скорость инференса, вообще не приходится ждать.
‣ C точки зрения идей и решений — мама дорогая. Я где-то пару недель спрашивал людей как ускорять модели, она выдала все идеи после одного запроса и сразу же имплементировала. Для меня взрыв мозга.

Конечно, если говорить о нишевых задачах — например, вырезание фона — тут всё ещё мимо: выдаёт фигню, потому что нужно реально видеть картинку и оценивать результат визуально. Но качество идей и решений — это просто взрыв мозга.

Я в комментах приложил сравнение: простая реализация vs. реализация после нескольких уточнений. Раньше, чтобы просто понять, как это сделать, ушло бы недели две. А теперь — один запрос, и всё готово.
  • 🔥 5
  • 🗿 1
Post #87 894
🛠 Опыт is a key to success

Последний год работы в стартапе сильно изменил моё отношение к тому, что такое опыт.

Раньше мне казалось, что опыт — это просто накопленные знания и навыки. Но теперь я вижу, что настоящая сила опыта в другом: это грамотное распределение ресурсов на долгосрочной перспективе.

Когда общался с автором xformers, он сказал, что одна из главных проблем стартапов (от себя добавлю, что и больших компаний в России) в гонке AI — понять, куда направить ресурсы. Вложиться в создание собственной технологии или подождать, когда кто-то другой выпустит уже готовое решение? И ответа на это нет, кроме одного — собственного опыта.

Опыт — это искусство принимать грамотные решения, чтобы не тратить самый ценный ресурс — время — впустую. Если идёшь не туда, ты не просто теряешь время сейчас, ты ещё и теряешь время, возвращаясь назад.

Самые дорогие ошибки — те, что происходят из-за недостатка опыта. Ты можешь даже не понять, что идёшь в тупик, пока не окажешься в начальной точке снова.

Что изменилось в моём подходе сейчас?

1️⃣ Я перестал гоняться за самыми крутыми решениями просто потому, что они крутые. Теперь для меня важно видеть общую картину. Я выбираю простоту и устойчивость, потому что за такими решениями будущее. Подумайте, какие решения обеспечат стабильность вашего проекта в будущем.

2️⃣ Опыт даёт возможность видеть картину целиком — именно поэтому опытные руководители бесценны. Ты можешь делать всё правильно в моменте, но без общей стратегии через пару лет всё просто развалится. Есть ли у вас человек, который может помочь вам своим опытом?

3️⃣Если вам интересно узнать больше о грамотном принятии решений, рекомендую почитать вот этот пост. А также рекомендую самый простой способ начать собирать опыт — это набивать шишки и двигаться дальше самостоятельно. Не бойтесь экспериментировать и набираться опыта самостоятельно.
  • 🔥 13
  • ❤ 1
Post #86 1.15K
⚡️SageAttention — brand new attention

Flash Attention бустит классический attention по скорости, но что если я скажу, что можно еще быстрее, если правильно квантизовать Flash Attention. Sage Attention за счёт умной квантизации + понимании CUDA ускоряют Flash Attention 2 от 2x до 5x раз.

Небольшое введение в квантизацию.
Допустим, у нас есть матрица A, которую мы хотим перевести из формата FP16 в INT8. Для этого:
1. Сначала находим максимальное абсолютное значение элементов матрицы и вычисляем коэффициент скейлинга (scale factor):
δA = max(|A|) / 127
2. Делим исходную матрицу на этот коэффициент и округляем, получая матрицу низкой точности \hat{A} (например, INT8):
 = round(A / δA)
3. После вычислений в низкой точности (например, произведения матриц AB), получаем итоговый результат, снова умножая на коэффициенты скейлинга:
C ≈ (Â × B̂) × (δA × δB)

Здесь приведен простой пример квантизации — на самом деле, факторы скейлинга можно выбирать для каждой строчки отдельно, что улучшить качество за счёт бОльшего числа факторов. В статье
SageAttention про это подробно рассказано, рекомендую ознакомиться.

Основной проблемой данного подхода является то, что могут возникать выбросы:

Например, если в исходной матрице A:
A = [0.1, 0.2, 0.15, 1000]

То коэффициент скейлинга будет:
δA = 1000 / 127 ≈ 7.87

И после квантизации получится:
A_quant = round(A / δA) = [0, 0, 0, 127]

Поэтому залог успешной квантизации, подумать головой и разобраться с выбросами, что и сделали в SageAttention.


Небольшое введение в формулы и погнали:
➤ P = Attention = Softmax(QK^T / \sqrt{d})
➤ V - value -> V* = PV

SageAttention:
➤ Переводим вычисление QK^T в INT8 и стабилизируем выбросы с помощью нормализации матрицы K (это стандартная техника для борьбы с выбросами, берите на вооружение!). Дополнительно оптимально подбираем стратегию квантизации, глядя на структуру самих матриц.
➤ Делаем фьюзинг (объединение) операций скейлинга и анскейлинга с соседними слоями.
➤ Вычисление PV делаем в FP16 — так стабильнее, потому что FP8 слишком сильно теряет точность.

SageAttention2:
➤ Современные GPU (например, Nvidia H100) поддерживают не только INT8, но и INT4. Поэтому теперь делаем квантизацию матриц Q и K в INT4, а также дополнительно нормализуем матрицу Q, чтобы не искажать итоговый результат attention.
➤ Реализуем глубокие CUDA-оптимизации. Например, оказывается, что масштабирование при квантизации можно параллельно применять сразу к элементам векторов по специальной формуле (каждый 8i + 2k + 1-й элемент). Жёсткая оптимизация на низком уровне GPU 🔥
➤ Вычисления PV делаем в FP8, так как теперь нашли способ стабилизировать результат при помощи двойной буферизации с FP32

SpargeAttention:
➤ FlashAttention работает с матрицами поблочно. Если какой-то блок attention заполнен нулями, то считать его нет смысла — результат не изменится.
➤ Авторы придумали механизм, как быстро находить и пропускать такие блоки на основе похожести матриц Q и K.
➤ Дополнительно, в процессе вычисления attention можно пропускать отдельные блоки, основываясь на пороге.
➤ Поверх этой разреженности используется подход из SageAttention2 (с INT4-квантизацией и CUDA-оптимизациями).

Результат

🔥 SageAttention уже быстрее, чем FlashAttention2 примерно в 2.1 раза (на RTX4090), а также на 2.7 раза быстрее xformers. При этом точность моделей практически не страдает.
🔥 SageAttention2 ускоряет attention примерно в 3 раза по сравнению с FlashAttention2 и в 4.5 раза быстрее xformers на RTX4090.
🔥 SpargeAttn ускоряет inference дополнительно, обеспечивая от 2.5 до 5 раз быстрее по сравнению с другими методами attention.

Как применить у себя.

Устанавливаем библиотеку и дальше делаем вот так

import torch.nn.functional as F

from sageattention import sageattn
F.scaled_dot_product_attention = sageattn
  • 🔥 13
  • ❤ 3
Older posts →

About this channel

How can I read @awesome_dl without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Awesome DL: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Awesome DL have?
Awesome DL (@awesome_dl) has 871 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Awesome DL know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →