TGViewer
Maxim.ML - канал Maxim.ML - канал @ml_maxim · 1.05K subscribers
Post #114 1.28K
Архитектуру построили. А ML - нет 🤷‍♂️

Завершился наш с Никитой модуль по AI-агентам в ВШЭ и МФТИ
Финальная задача - разработать агентную систему для решения ML-задач, aka MLE-STAR

57 студентов, 22 решения. Давайте разберем результаты 🧐

Немного про задачу и ограничения:

⚡️Соревнование на Kaggle, которое должно было решаться агентами - всё в лучших практиках - через MCP

⚡️Нужно было использовать только open source модели - так интереснее (конечно, ведь можно взять opus 4.6 и решить задачу в 3 промпта - но это скучно)

⚡️Пять критериев оценки:

1. Архитектура: качество системы, протоколы, современные паттерны;
2. Автоматизация и безопасность: полнота автоматизации, механизмы защиты и мониторинга;
3. Качество модели: результаты на тестах, устойчивость к атакам;
4. Бенчмаркинг: система оценки, сравнение архитектур;
5. Документированность: структурированность кода, качество документации, воспроизводимость;


Что интересного нашел в процессе проверки:

95% команд получили ≥8 за архитектуру, но с качеством модели наоборот: 14 из 22 получили ≤6, и никто не получил 10.

Почему? Корреляция между архитектурой и качеством модели: r = 0.16. Почти независимы.

1️⃣ Агенты не гарантируют качество модели. Оркестрация - про «как организовать работу», а не «какой будет результат». Можно идеально координировать 5 агентов, которые все делают посредственный feature engineering
2️⃣ Базовые ML-решения. Большинство команд ограничились LightGBM/XGBoost/CatBoost с дефолтными или минимальными настройками. Сложная агентная обёртка вокруг простого пайплайна.

Ещё несколько находок:
🔵Корреляция между критериями оценки почти нулевая (r=0.06–0.24). Команды прокачивают разные навыки своей архитектуры независимо
🔵Каждая дополнительная интересная фича добавляет ~0.3 балла - сильнейший предиктор (r=0.56) (например: rag по открытой базе ноутбуков, изоляция исполнения кода в Docker, параллельные запуски конкурирующих агентов)

⚙️ Фреймворки

LangGraph - 55% команд (ср. 7.60), Pure Python - 41% (7.09). Лучшие связки: LangGraph + codegen (7.80), LangGraph + plan-execute (7.60)

Было реализовано много интересных мультиагентных архитектур, но не все они выигрывают соревнования. Нестандартные решения и сильный feature engineering все еще двигают метрику

Так что агенты - все еще инструмент, а не замена ML-экспертизе ✨


Если интересно самим посмотреть решения ребят:
🔗 репо с решениями
  • 👍 12
  • 🔥 7
  • ❤ 3
More from @ml_maxim
  1. Sep 17, 2026Тут huawei выпустила отчёт intelligent world 2035, там целых 10 смелых прогнозов, советую…
  2. Sep 14, 2026Показательно получилось 🛌 Вчера таки написал на habr про то, как легко теперь копировать…
  3. Sep 11, 2026Сходил за сырниками, а пришлось анализировать данные 📈 В магазине играла знакомая песня.…
  4. Sep 8, 2026Выхожу из декретного творческого отпуска 🛌 и сразу рассказываю свои апдейты и новости, на…
  5. Mar 31, 2026Как неожиданно и приятно Месяц назад отправлял свою рукопись в ainl, сегодня пришёл резуль…
  6. Mar 5, 2026Кажется, ИИ способен разогнать цену чего угодно 😓 TL;DR: Делюсь опытом, как развернуть ас…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →