Текст на сгенерированных картинках больше не похож на эльфийский 🪄
Microsoft выкатила новую модель MAI-Image-2, и она с ходу залетела на 3-е место в лидерборде Arena.ai. Предыдущая версия болталась на девятой строчке, так что апгрейд серьезный. Впереди пока только флагманы от Google (Gemini 3.1 Flash Image) и OpenAI (GPT-Image 1.5).
Что важно для нас:
→ Адекватный рендер текста: модель наконец-то умеет генерировать читаемые диаграммы, инфографику и рабочие слайды.
→ Упор на реализм: освещение и композицию подкрутили, обучаясь на датасетах и фидбеке реальных фотографов и дизайнеров.
→ Доступность: уже можно дергать по API через Microsoft Foundry или тестировать в MAI Playground (VPN on, с российских IP сервис ожидаемо не пускает).
Скоро обещают нативно вшить в Copilot.
Голосуем, чей API сейчас лучше всего справляется с генерацией изображений под рабочие задачи?
👍 Google (Gemini 3.1)
😀 OpenAI (GPT-Image)
😚 Microsoft (MAI-Image-2)
😱 Midjourney (API костыльное, но результат решает)
#AI #GenAI #LLM
Microsoft Newsroom
Post #323
66

- ❤ 3
- 👍 1
- 😁 1