TGViewer
Channel Public Channel
AI Brain (Aibek Alanov)

AI Brain (Aibek Alanov)

@aibrain_channel

Рассказываю про искусственный интеллект, генеративные модели и новости моей научной команды.

Автор: @aibrain Айбек Аланов

Наш ридинг клаб для совместного разбора статей: @controlgenai_rg
Subscribers
1.07K
Photos
18
Videos
0
Links
15
Recent Posts 12 shown
Post #41 2.39K
Сегодня выступил на конфе AIJ 2025. Рассказал про наши исследования по генеративкам 😎
  • 🔥 61
  • ❤ 18
  • 😎 8
  • 👍 2
  • 🤩 2
  • 💩 1
  • 👻 1
Post #40 16.2K
Набор студентов на наши исследовательские проекты 🎓

Октябрь - время выбирать темы курсовых и дипломов. Наши команды из Controllable GenAI (AIRI) и BayesGroup (ВШЭ) запускают новый поток проектов по генеративным моделям.

Темы на любой вкус:

🔁 от диффузионок и GANов до GFlowNets;
⚡️ от ускорения и квантизации до поиска интерпретируемых векторов в генеративных моделях;
🖼 от редактирования изображений и видео до персонализированной генерации;
🧬 от генерации текстов, белков/протеинов, кристаллов и планировок — до 3D и объектов в Minecraft.

Чтобы поработать с нами, нужно пройти отбор — показать, насколько хорошо вы умеете рассуждать и проводить научные эксперименты.
Как проходит отбор:
📖 Разбор статьи по вашему выбору: мотивация, метод, сильные/слабые стороны, идеи улучшений.
🧪 Практика: дообучить генеративную модель под конкретную задачу.

📋 Регистрация и список тем:
https://forms.gle/Wd3mBG3KTFKFYC1E8

🗓 Дедлайн подачи: 2 ноября (не откладывайте до последнего).

Что получите:
👥 менторство от исследователей AIRI/ВШЭ
📝 шанс написать совместные статьи и сильные курсовые/ВКР
🔬 опыт исследований в передовой области генеративных моделей

Вопросы — в комментарии к посту или в лс @aibrain.
Всем удачи! 💪

@aibrain_channel
  • ❤ 36
  • 🎉 11
  • ❤‍🔥 7
  • 💩 1
  • 🐳 1
Post #39 3.12K

Forwarded from Институт AIRI

Подробнее о генеративных моделях для изображений — в новом Хабре⤵️

Нейросети для генерации изображений — это одно из самых горячих направлений в машинном обучении последних лет. Кандидат компьютерных наук, руководитель группы «Контролируемый генеративный ИИ» лаборатории FusionBrain AIRI, заведующий Центра глубинного обучения и байесовских методов ВШЭ Айбек Аланов прочитал о них лекцию на МТС True Tech Day, по мотивам которой написал статью на Хабре.

Айбек рассказал об истории генеративных моделей для изображений: как они развивались и в каком состоянии находятся сейчас. Он подробно остановился на основных типах моделей, а также объяснил, в каких практических задачах их можно использовать и как лучше выбрать подходящий вариант архитектуры.

Читайте по ссылке📎
  • ❤ 20
  • 🔥 5
  • 👍 4
  • ❤‍🔥 1
  • 💩 1
  • 🏆 1
Post #38 3.21K
Пишу про нашу новую работу, которую мы недавно засабмитили на NeurIPS.

В нашей статье ImageReFL: Balancing Quality and Diversity in Human-Aligned Diffusion Models мы исследуем методы дообучения диффузионных моделей на основе пользовательских предпочтений для повышения качества генерации изображений.

Существующие методы оптимизации (ReFL, DraftK, DRTune, AlignProp) страдают от reward hacking — модель переобучается на модель награды, что снижает разнообразие изображений. Мы предлагаем метод комбинированной генерации, позволяющий управлять балансом между качеством и разнообразием, а также новый способ дообучения, который позволяет повысить разнообразие без потери качества.

Также мы создали небольшую библиотеку, позволяющую удобно обучать модели как нашим методом, так и классическими ReFL и DraftK.

Прошу поддержать нашу новую работу на Hugging Face Papers и поставить звездочки на гитхабе)

Кроме того, мы опубликовали дообученные модели SD1.5 и SDXL на Hugging Face.
  • 🔥 29
  • ❤ 8
  • 👍 5
Post #37 2.87K
AI Brain (Aibek Alanov) Video message
Сегодня выступаю на True Tech Day. Рассказываю про современные генеративки и как они устроены 😉
  • ❤ 26
  • 🔥 15
Post #36 2.6K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 24
  • 🔥 1
Post #35 4.98K
Всем привет! Мы сейчас готовим статьи к конференции NeurIPS. Это одна из самых престижных конференций по AI.

UPD. Всем спасибо! ♥️ Мы набрали нужное количество данных для нашего исследования, поэтому бота уже выключили.

Нам для одной из статей нужно провести сравнение нашего метода с лучшими конкурентами с помощью человеческих оценок (это называется user study). Поэтому мы будем очень благодарны, если вы сможете помочь и пройти наш опрос 🙏

Мы сделали супер удобного бота @tlora_sbs_bot для оценки изображений, чтобы всем было приятно и комфортно размечать задания.
Вы можете сделать столько заданий, сколько хотите, но если у вас получится сделать хотя бы 5 - то мы будем просто безгранично благодарны вам❤️🫂

В боте нужно будет сравнивать картинки по нескольким критериям. Пожалуйста, ВНИМАТЕЛЬНО ПРОЧИТАЙТЕ ИНСТРУКЦИЮ в боте, НЕ ИГНОРИРУЙТЕ ЕЕ, даже если вам кажется, что и так все понятно. Она маленькая и ее прочтение не займет у вас больше минутки.

Заранее огромная благодарность всем, кто поучаствует! 😊

ЮЗЕР СТАДИ БОТ: @tlora_sbs_bot
  • ❤ 25
Post #34 2.29K
Как ускорить обучение диффузионных моделей с помощью self-supervised признаков

Известно, что в процессе обучения диффузионки выучивают внутренние семантические представления объектов. Это логично, ведь чтобы сгенерировать объекты, модель должна «понимать» их семантику.

Однако существует целое направление машинного обучения — self-supervised learning (SSL), цель которого как раз заключается в обучении энкодеров, эффективно выделяющих семантические признаки объектов без необходимости генерации. Интересно понять, насколько представления, получаемые диффузионками, уступают или превосходят признаки, полученные self-supervised подходами.

В этой статье авторы выяснили, что семантические признаки, формируемые диффузионками, менее информативны по сравнению с признаками из self-supervised энкодеров, и хуже подходят для решения негенеративных задач, например, для классификации, сегментации и тд. Предположительно это связано с тем, что диффузионки вынуждены хранить много дополнительной, высокочастотной информации, необходимой для генерации деталей изображения.

Исходя из этого наблюдения, авторы предложили простое решение: добавить регуляризацию в виде косинусного расстояния между представлениями диффузионной модели и предобученного self-supervised энкодера. Эта идея сработала отлично — обучение диффузионки ускорилось на порядок, и качество генерации заметно улучшилось.

В исследовании подробно рассмотрели различные конфигурации: разные размеры и типы self-supervised энкодеров, разные представления диффузионок (выходы с разных слоев) и т.д. Результаты убедительно подтверждают эффективность предложенного подхода.

Мне статья понравилась своей простотой и убедительными экспериментами. Сразу возникают куча новых вопросов: Чем принципиально отличаются внутренние представления диффузионок и SSL-энкодеров? Можно ли напрямую использовать SSL-лоссы вместо предобученных энкодеров? Какие представления и на каких этапах должны формироваться диффузионками? Обилие таких вопросов подчеркивает важность и перспективность предложенного подхода.

Статья, гитхаб
  • 👍 24
  • ❤ 6
  • 🔥 3
  • 🌚 2
Post #32 2.03K
Гайденс в диффузионных моделях

В этом посте начнем разбираться с техникой гайденса, без которой не работают все современные диффузионки, такие как Flux, SD 3.5 и т.д.

Все, кто на практике использовал диффузионки, знают, что для более качественной генерации необходимо использовать высокий гайденс скейл. Без этого генерация будет совсем плохой - будет страдать общее качество и соответствие текстовому промпту (первая картинка - генерация с высоким гайденс скейлом, вторая - с низким).

Хотя техника гайденса является критичной для работы современных диффузионок, она все еще малоизучена. Непонятно, почему без гайденса не получаются хорошие генерации, как подбирать оптимальный гайденс скейл, почему гайденс улучшает не только соответствие промпту, но и общее качество генерации? Мы коснемся этих вопросов в следующих постах, а пока я напомню, как выглядит формула гайденса и в чем ее идея.

Гайденс в диффузионках работает так:

выход на шаге t = eps(x_t, text) + g_scale * (eps(x_t, text) - eps(x_t, null)),

где eps(x_t, text) - предсказание нашей диффузии eps на шаге t для зашумленного объекта x_t и входного промпта text;
null - это пустой промпт, то есть это безусловная генерация.

То есть, основная идея этой техники - это добавить к предсказанию диффузии направление eps(x_t, text) - eps(x_t, null) с высоким гайденс скейлом g_scale, которое уводит генерацию в области пространства, где сгенерированные картинки хорошо соответствуют промпту text. На практике это удивительным образом улучшает еще и само качество генерации. Основной минус - это может сильно снизить разнообразие картинок. И если сильно повышать скейл g_scale, могут появиться артефакты сильной контрастности картинки.

Вывод: техника гайденса в диффузионках очень важна, но есть еще много вопросов, которые остаются открытыми и о которых мы еще поговорим.

Основные статьи, чтобы лучше разобраться в этой технике:
Diffusion Models Beat GANs on Image Synthesis
Classifier-Free Diffusion Guidance
  • ❤ 19
  • 🔥 7
  • ❤‍🔥 4
  • 👍 3
Post #31 1.42K
Хочу наконец возобновить посты в этом канале и рассказывать про интересные темы и статьи в генеративках. Хотя все еще сложно находить на это время, но чувствую, что желание делиться мыслями и писать про крутые работы сильнее.

Поэтому я хочу вернуться к ведению этого канала, буду писать нечасто, но регулярно. Буду рад вашей поддержке, это меня правда мотивирует и очень вдохновляет. Сегодня будет новый пост 😉
  • 🔥 45
  • ❤ 24
  • 👍 3
Post #26 2.13K

Forwarded from Институт AIRI

Когда чувства компилируются без ошибок❤

Мы сделали валентинки для тех, кто видит красоту в коде, звёздное небо в репозиториях и всегда выбирает оптимальный путь — и в науке, и в жизни. Отправляйте их коллегам, друзьям и просто дорогим людям.

Пусть ваши градиенты сходятся, модели не переобучаются, а сердце остаётся в стабильной конвергенции!
  • 💘 16
  • ❤ 13
Post #25 2.38K
🔬Знакомство с нашей научной группой в Вышке

Приглашаю всех заглянуть к нам на встречу в Вышке, где мы расскажем про наш Центр, и покажем, что наука — это не скучные формулы, а интересные и красивые задачи. Если у вас уже есть вопросы — готовьте их, мы любим дискуссии. 😉

Подробности есть в этом посте https://t.me/fcs_life/72

Если возникнут вопросы, пишите в комментариях или мне в лс

Ждем вас в Вышке!
Telegram ФКН внеучебка #Лаборантская ➖➖➖➖➖ ❓Занимаешься анализом данных и интересуешься тем, как решать сложные задачи в этой области? Спроси об этом ученых, которые отвечают на такие вопросы в лаборатории. 📢 Во вторник, 1️⃣0️⃣ декабря, вы сможете познакомиться и задать свои…
  • ❤‍🔥 16
  • 🤩 7
  • 👍 3
  • ❤ 1
Older posts →

About this channel

How can I read @aibrain_channel without a Telegram account?
TGViewer shows the public web preview Telegram publishes for AI Brain (Aibek Alanov): recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does AI Brain (Aibek Alanov) have?
AI Brain (Aibek Alanov) (@aibrain_channel) has 1.07K subscribers on Telegram, refreshed roughly every 30 minutes.
Does AI Brain (Aibek Alanov) know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →