Завершился наш с Никитой модуль по AI-агентам в ВШЭ и МФТИ
Финальная задача - разработать агентную систему для решения ML-задач, aka MLE-STAR
57 студентов, 22 решения. Давайте разберем результаты 🧐
Немного про задачу и ограничения:
⚡️Соревнование на Kaggle, которое должно было решаться агентами - всё в лучших практиках - через MCP
⚡️Нужно было использовать только open source модели - так интереснее (конечно, ведь можно взять opus 4.6 и решить задачу в 3 промпта - но это скучно)
⚡️Пять критериев оценки:
1. Архитектура: качество системы, протоколы, современные паттерны;
2. Автоматизация и безопасность: полнота автоматизации, механизмы защиты и мониторинга;
3. Качество модели: результаты на тестах, устойчивость к атакам;
4. Бенчмаркинг: система оценки, сравнение архитектур;
5. Документированность: структурированность кода, качество документации, воспроизводимость;
Что интересного нашел в процессе проверки:
95% команд получили ≥8 за архитектуру, но с качеством модели наоборот: 14 из 22 получили ≤6, и никто не получил 10.
Почему? Корреляция между архитектурой и качеством модели: r = 0.16. Почти независимы.
1️⃣ Агенты не гарантируют качество модели. Оркестрация - про «как организовать работу», а не «какой будет результат». Можно идеально координировать 5 агентов, которые все делают посредственный feature engineering
2️⃣ Базовые ML-решения. Большинство команд ограничились LightGBM/XGBoost/CatBoost с дефолтными или минимальными настройками. Сложная агентная обёртка вокруг простого пайплайна.
Ещё несколько находок:
🔵Корреляция между критериями оценки почти нулевая (r=0.06–0.24). Команды прокачивают разные навыки своей архитектуры независимо
🔵Каждая дополнительная интересная фича добавляет ~0.3 балла - сильнейший предиктор (r=0.56) (например: rag по открытой базе ноутбуков, изоляция исполнения кода в Docker, параллельные запуски конкурирующих агентов)
⚙️ Фреймворки
LangGraph - 55% команд (ср. 7.60), Pure Python - 41% (7.09). Лучшие связки: LangGraph + codegen (7.80), LangGraph + plan-execute (7.60)
Было реализовано много интересных мультиагентных архитектур, но не все они выигрывают соревнования. Нестандартные решения и сильный feature engineering все еще двигают метрику
Так что агенты - все еще инструмент, а не замена ML-экспертизе ✨
Если интересно самим посмотреть решения ребят:
🔗 репо с решениями



