Как ИИ-агенты управляют операционной системой и оживляют героев романов: топ-10 исследований ИИ за апрель 2025
На дворе уже июнь, а я до сих пор не выложил обзор исследований ИИ за апрель. По будням я решаю большую задачу по ИИ-трансформации крупного финтеха, а по выходным пишу рецензии на диссертации магистрантов ИТМО.
Поэтому времени на обзор статей было мало, но лучше поздно, чем никогда. Тем более, что исследования действительно интересные.
1. Phi-4-Mini-Reasoning: Малая языковая модель нового поколения
Microsoft представила компактную модель с 3,8 млрд параметров, которая превосходит более крупные аналоги на математических задачах. Благодаря новым методам обучения модель достигла 94,6% точности и может эффективно работать на мобильных устройствах.
🤖 Модель
2. AI Scientist v2: Автоматизация научных исследований
AI Scientist v2 может не только генерировать идеи, но и самостоятельно проводить эксперименты, писать статьи и проходить рецензирование. Одну из сгенерированных статей приняли на научный воркшоп. Это делает процесс исследования более автономным, хотя вопрос этики все еще остается открытым.
💾 Код
3. Paper2Code: Перевод научных статей в код
80% научных работ по машинному обучению не имеют кода. PaperCoder позволяет автоматически преобразовывать научные ML-статьи в полноценные рабочие репозитории, сокращая время на проверку результатов и воспроизведение экспериментов.
💾 Код
4. Desktop AgentOS UFO: Управление операционной системой с ИИ-агентами
Microsoft представила систему UFO, которая позволяет ИИ-агентам самостоятельно управлять Windows-приложениями без участия человека. Авторы планируют масштабировать подход на Linux и macOS. Уверенный шаг в сторону операционных систем на базе LLM.
💾 Код
5. UniversalRAG: Мультимодальный RAG
UniversalRAG удачно решает две ключевые задачи RAG: работает с разными типами данных (текст, изображения и видео) и гибко меняет объемы контекста. Все то, чего нам так не хватало.
💾 Код
6. UXAgent: Симуляция юзабилити-тестирования с ИИ-агентами
UXAgent заменяет реальных пользователей на тысячи ИИ-агентов, которые взаимодействуют с веб-интерфейсами. Это позволяет значительно сократить время на тестирование пользовательского опыта без найма дополнительных UX-исследователей.
💾 Код
7. AgentA/B: ИИ-агенты для A/B-тестирования
Фреймворк использует армию ИИ-агентов для проведения A/B-тестов веб-интерфейсов. Этот метод позволяет лучше принимать решений о том, какую фичу раскатить на реальных пользователей. Так у авторов даже получилось повысить средний чек.
8. BookWorld: Многопользовательская генерация историй
Система BookWorld оживляет литературных героев, превращая их в интерактивных ИИ-агентов, которые взаимодействуют друг с другом, создавая новые сюжетные линии и позволяя симулировать коллективное поведение. Будущее ролевых игр?
💾 Код
9. MOSAIC: Песочница социальных ИИ-агентов
MOSAIC симулирует социальные сети с помощью ИИ-агентов, которые взаимодействуют между собой, лайкают, репостят и проверяют фейки, что помогает безопасно тестировать методы модерации контента и борьбы с дезинформацией.
💾 Код
10. Generative AI Act II: Инженерия когнитивных систем
Произошел сдвиг парадигмы. Мы перешли от простого промт-инжениринга к более сложной когнитивной инженерии. Теперь важный навык ИИ-инженера - умение управлять цепочками рассуждений для решения сложных задач.
Можете ознакомиться с полным обзором этих исследований, а если хотите быть в курсе самых новейших работ в области ИИ, то воспользуйтесь Dataist AI — бесплатным ботом, ежедневно обозревающим свежие научные публикации.
#исследования
Post #214
3.83K