TGViewer
Channel Public Channel
Complete AI

Complete AI

@complete_ai

Меня зовут Андрей Кузнецов

Руковожу управлением в Sber AI, построил успешную лабораторию FusionBrain в AIRI, один из основателей Kandinsky, к.т.н., 15+ лет опыта в Computer Vision, выступаю с лекциями и пишу о событиях в AI и ML
Subscribers
7.86K
Photos
517
Videos
38
Links
288

Showing posts older than #558 · Back to latest

Older Posts 18 shown
Post #555 2.79K
Что же объединяет представителей команд?
  • ❤‍🔥 12
  • ⚡ 6
  • 🙏 4
  • 😁 3
  • 😱 2
  • ❤ 1
  • 🙊 1
Post #553 2.7K
⚡️6⃣🅾🅾4⃣
Благодарю всех подписчиков за доверие🙏
  • ⚡ 41
  • 😎 8
  • ❤ 7
  • 👏 6
  • 🏆 2
Post #552 2.66K

Forwarded from Ivan Oseledets’ Channel

Сегодня закончили трехдневную научную отчетную сессию AIRI, на которой исследователи, от младших научных сотрудников до директоров лабораторий, поделились итогами работы за этот год и планами на следующий. За 3 дня мы прослушали 45 докладов и обсудили 159 постеров.

Всем участникам — большое спасибо за интересные выступления, активные обсуждения и вовлеченность! Вместе мы делаем науку сильнее.
  • ❤‍🔥 35
  • 🔥 7
  • 🏆 4
  • 👍 3
  • 👏 2
Post #551 2.85K
Уже завтра состоится финальная ИИшница этого года, где исследователи расскажут про свои статьи на NeurIPS 2024 🍳

На онлайн-митапе будут два моих сотрудника:

⚫️Инженер-исследователь Robotics Антон Антонов с RClicks: Realistic Click Simulation for Benchmarking Interactive Segmentation — методом интерактивной сегментации для реалистичной оценки скорости и робастности аннотирования. Метод основан на оригинальной модели кликабельности, которая генерирует реалистичные клики аннотаторов. Исследование показало, что не существует одновременно оптимального метода с точки зрения скорости и робастности разметки.

⚫️Младший научный сотрудник Controllable Generative AI Максим Николаев с HairFastGAN: Realistic and Robust Hair Transfer with a Fast Encoder-Based Approach — методе для редактирования причёсок на фотографиях. Метод основан на использовании пространства StyleGAN и набора предобученных энкодеров, что обеспечивает высокую скорость работы. HairFastGAN превосходит аналоги как по качеству переноса причёсок, так и по скорости исполнения, включая самые сложные случаи.

Подробнее об ИИшнице ➡️ тут.
  • 🔥 16
  • ❤‍🔥 6
  • ❤ 5
Post #549 2.36K
Complete AI Помните, на прошлой неделе я говорил об анонсе новой модели от Amazon? Релиз состоялся вчера в рамках конференции Amazon re Invent, где показали аж целое семейство фундаментальных моделей Nova: 📍Micro — маленькая языковая модель, быстрая и дешевая (контекст…
the_amazon_nova_family_of_models_technical_report_and_model_card.pdf20.2 MB
☝️Метрики и детали в большом техническом отчете

В части картинок и видео список моделей в сравнении не очень большой (если для картинок ещё показали автоматические метрики TIFA и ImageReward, то для видео только HumanEval с Gen 3 Alpha и Luma 1.6)

Хочешь быть SoTA — начни с выбора удобной метрики😅
  • 👍 5
  • 🔥 3
  • 😁 3
  • ❤ 1
Post #548 2.07K

Forwarded from Институт AIRI

Исследователи из лаборатории «Сильный ИИ в медицине» и лаборатории FusionBrain AIRI вошли в топ-5 соревнования MIDRC XAI Challenge 🔥

Этот конкурс был направлен на решение одной из ключевых задач в области анализа медицинских изображений: создание интерпретируемых и надежных моделей искусственного интеллекта. Задачей участников была разработка и обучение модели классификации фронтальных рентгенограмм грудной клетки на наличие затемнений в лёгких, связанных с любым типом пневмонии.

По итогам команда представила 3 варианта решения задачи и вышла в топ-5 лучших наряду с учёными из Университета Джона Хопкинса, Университета Берна, команды Женского госпиталя в Бирмингеме, а также исследователями из Стенфорда и Университета Тюбингена.

📎Подробнее об участии в конкурсе команда рассказала в свежей статье на нашем Хабре.
  • ❤ 13
  • 🔥 5
  • 👍 2
Post #547 2.42K
Complete AI ⚡️Похоже на следующей неделе нас ждёт анонс новой модели от бигтех компании🧐 Amazon готовится показать на следующей неделе на ежегодной конференции свою мультимодальную LLM с упором на понимание видео (например, найти нужный момент на видео по описанию) —…
Помните, на прошлой неделе я говорил об анонсе новой модели от Amazon?

Релиз состоялся вчера в рамках конференции Amazon re Invent, где показали аж целое семейство фундаментальных моделей Nova:

📍Micro — маленькая языковая модель, быстрая и дешевая (контекст 128к токенов)
📍Lite, Pro — мультимодальные модели для понимания текста, изображений и видео (контекст 300к токенов)
📍Premier — мультимодальная модель с упором на способность к рассуждениям (только анонс, релиз в 2025 году)
📍Canvas — SoTA модель генерации изображений по тексту
📍Reel — SoTA модель генерации видео по тексту и стартовому кадру

В новости добавили примеров работы моделей ( даже есть сгенерированное видео рекламы пасты ). Деталей в целом пока немного, но я обязательно расскажу как только они появятся.

Доступ к моделям можно получить через фреймворк Amazon Bedrock, который посредством API является единой точкой входа в большой список существующих больших моделей (не только от Amazon).

⚡️Также анонсировали выпуск в середине 2025 года мультимодальной модели формата «any-to-any», которая сможет как понимать текст, картинки, аудио и видео, так и генерировать эти типы данных. Неужели 2025й будет новым витком популярности end-to-end декодеров?🤔

🔥По ссылке ещё больше сгенерированных с помощью Reel видео

UPD:
сравнение с другими моделями в комментариях👇

@complete_ai
  • 👍 13
  • 🔥 3
  • ❤ 2
Post #545 3.47K
⚡️Похоже на следующей неделе нас ждёт анонс новой модели от бигтех компании🧐

Amazon готовится показать на следующей неделе на ежегодной конференции свою мультимодальную LLM с упором на понимание видео (например, найти нужный момент на видео по описанию) — Olympus.

Пишут, что там якобы 2T параметров (кстати, размер они анонсировали больше года назад, а как будет «сегодня» — узнаем)! Как когда-то WuDao 2.0 был лидером гонки параметров (говорили про 1.75Т)

Т - триллион😊
  • 👀 17
  • 🙊 5
  • 🔥 3
  • 👍 2
Post #544 3.37K
Новый шаг для индустрии игр или способ синтеза данных для обучения больших моделей?

Что думаете?
  • 🔥 23
  • 👾 5
  • 🤓 4
  • 🙊 4
  • 💯 2
  • 👍 1
Post #543 3.41K
⚡️Вот и релиз новой языковой модели OLMo2 от Allen Institute подоспел

Просто взгляните на метрики💪
https://allenai.org/blog/olmo2

@complete_ai
  • 🔥 15
  • 👍 4
  • 🏆 3
  • 🤝 2
Post #541 3.81K
⚡️Reducio! Microsoft в соавторстве с Гарри Поттером на днях выпустил статью про свой новый image-conditioned VAE для видео

За счёт кодирования латентов движения удалось побить по сжатию обычный 2D VAE в 64 раза без потери качества (TxHxW: 1x8x8 -> 4x32x32)

Основной блок энкодера - это пространственно-временной 3D-VAE. Ключевая идея Reducio в том, что кадр из середины кодируемой видео последовательности (T/2, где T - длина видео) используется на этапе декодера при пирамидальной развёртке видеолатента через слой cross-attention. Проще говоря, средний кадр «помогает» восстановлению видео из сжатого пространства признаков (content image prior).
Кстати, похожий эффект с дополнительным image prior помог нам выбить лучшее качество при разработке Kandinsky 2.1.

Скорость работы Reducio очень высокая в разрешении 1024x1024 — 16 кадров генерируются 15.5 секунд на A100. При этом на обучение генеративной модели DiT по заявлениям потрачено всего 3.2k A100 часов!

По качеству даже побили свеженький Cosmos-VAE от Nvidia недельной давности🔥

Статья
Код
Веса
  • 🔥 13
  • ⚡ 10
  • ❤ 5
  • 👍 2
Post #540 3.1K
Выступал сегодня на фесте «Формула будущего» в Иннополисе. Разгоняли со студентами тему карьеры в науке: с чего начать, как выглядит карьерный трек, как построена работа у меня в лабе в AIRI, какие направления занимают пальму «популярности» сейчас в исследованиях, а также о симбиозе науки и бизнеса в современных реалиях.

Интересный опыт для меня — отличается от привычных tech talk выступлений на конференциях. Тем не менее получилось довольно интересно, искали ответы на непростые вопросы (и это не про цену контрактов) — тимлид экспертизой оказалось тоже приятно делиться💪

Встретились и пообщались на фесте с Егором Бугаенко (автор канала @yegor256news) и Валей Малых (автор канала @valuableai) — они тоже выступали с докладами, обсудил с ними карьерные пути студентов в исследованиях и разработке, кадровый голод в некоторых направлениях и ещё много всего. Кажется, вопросов хватит не на один подкаст😉

UPD: презентация доклада в комментариях 👇
  • ❤ 18
  • 🔥 14
  • ⚡ 6
  • ❤‍🔥 3
  • 👍 2
Post #539 2.94K
Натальная карта появления AGI от лидеров мнений💪
  • 😁 16
  • ❤‍🔥 9
  • 👍 4
  • 😱 1
  • 👾 1
Post #537 3.33K
⚡️Nvidia выкатила веса и демку text2image модели Sana

Демо
Код
Статья
  • ❤‍🔥 11
  • 🔥 8
  • 👍 5
Post #534 3.07K
⚡️Компания Sony не так часто выходит с какими-то громкими релизами. Но вот анонсировали 2 модели на NeurIPS 2024: GenWarp и PaGoDA

Первая про синтез 3D сцен по одной картинке (судя по качеству интересно проверить для задач робототехники и 3D моделирования)

Вторая про генерацию картинок в высоком разрешении на базе low-res предобученной модели (вычислительно эффективно — максимум 32 карты A100, рост разрешения с 32x32 до 512x512 почти без потери качества)

Детали тут👇
Ссылка
  • ❤ 9
  • 🔥 4
  • 👀 4
  • 👍 2
Post #531 3.26K
  • 👾 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →