TGViewer
The Layer The Layer @layercv · 853 subscribers
Post #171 14.7K
Привет!
Сегодня для нас очень важный день, поскольку мы подходим к большой и важной вехе на нашем рабочем и жизненном пути. Жизненном потому, что это давно вышло за рамки исполнения обязанностей и стало личным.

Сегодня мы представляем вам проект с рабочим названием Malvina. Технологию, с чьей помощью GigaChat теперь умеет редактировать любые изображения просто по обычному текстовому промпту на любом языке.

Не хочется распинаться о том, какая Malvina крутая модель. Она способна говорить сама за себя.

Но, всё-таки, будет одно громкое заявление:
На основании наших технических метрик, а так же нескольких SBS-сравнений независимыми разметчиками, Malvina обходит на основных задачах по качеству Gemini и Grok.

Мы не говорим здесь о новом ChatGPT-4о (в этом контексте имеется ввиду новая возможность для AR-генерации изображений) потому, что модели невозможно напрямую адекватно сравнить. Мы много рассказали об этом в статье на Хабре, поэтому тут просто кратко повторим: ChatGPT-4о — совершенно потрясающая, стоящая на переднем крае науки, модель. Но на данный момент она не выполняет попиксельное редактирование. И пусть результат часто близок к этому (хотя ещё чаще — нет), всё-таки это сильно разные задачи с разным потолком качества.

Gemini же, на удивление, вполне хорошо справляется с именно нашей задачей, поэтому мы больше ориентируемся на неё.
На всякий случай, мы оставили SBS вот тут.

Но вернёмся к к теме. Поскольку у Malvina под капотом одновременно и сильная VLM модель и качественная диффузионка, она умеет очень много всего классного.

В том числе, делает такие штуки, за которые люди часто хотят денег: удаляет объекты по любому текстовому описанию, восстанавливает и раскрашивает старые фотографии, меняет внешность, удаляет и добавляет бороды, меняет цвет глаз, причёски, одежду, аксессуары, удаляет фон для фотографии на паспорт, перекрашивает что заблагорассудится пользователю, меняет материалы объектов, она даже может восстановить ржавый автомобиль или прибраться за вас в комнате (ну, пока только на фотографии).

И ещё очень много всего, мы даже не всё сами знаем. Кажется этот случай, когда пользователи могут исследовать возможности глубже, чем сами создатели. Главное — следовать духу экспериментаторства и пробовать несколько раз подряд, проверять разные подходы к промпту.

Есть и то, чего модель честно не умеет, просто потому, что пока мы над этим не работали в достаточной мере: ей плохо даётся смена поз или вращение объектов, она не умеет добавлять текст, не всегда справляется с сильными структурными изменениями. Мы не заканчиваем разработку этим релизом, скорее только начинаем, так что в конечном счёте мы решим и эти проблемы.

А сейчас, мы хотим показать, чего уже достигли, и приглашаем вас в GigaChat попробовать самостоятельно!
  • 🔥 44
  • ❤ 17
  • 👏 13
  • 👍 6
  • 🎉 1
More from @layercv
  1. Aug 21, 2025✨Big Tech Night: не пропусти первую «Ночь музеев» в мире IT 12 сентября в Москве пройдёт B…
  2. Jul 22, 2025Ещё раз напомню, что доступно бесплатное демо нашего файнтюна Bagel-NHR-Edit на HuggingFac…
  3. Jul 22, 2025Абсолютно всё в этих примерах создано без участия человека, мы просто задали направление.…
  4. Jul 22, 2025NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining Вышел наш первый пр…
  5. Jul 8, 2025⚡Полная версия MiVOLO на HuggingFace! Наша молниеносная модель в 29 млн. параметров для оп…
  6. Jul 8, 2025Вакансия: Deep Learning Engineer, ASR 🎧 Ищем инженера-исследователя в ML команду распозна…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →