ML2B
В репозитории представлен код для воспроизведения результатов работы над ML2B — многоязычным бенчмарком для автоматизированной разработки ML-решений и AutoML-агентов на базе больших языковых моделей. Авторы берут 30 реальных соревнований Kaggle и аккуратно переводят их задания на 13 языков, включая русский, китайский, арабский, казахский, польский и другие. Для каждой задачи задаются чёткие метаданные: тип данных (табличные, текст, изображения), предметная область (12 доменов — от медицины и экологии до финансов и городского планирования), метрика качества и формат ответа. Поддерживаются простой вариант решение с одной функцией предсказания и модульный формат с раздельным обучением, подготовкой данных и предсказанием, что уменьшает риск утечек данных на этапе предобработки и упрощает статический анализ кода. Дополнительно в бенчмарк включены 6 закрытых соревнований, по которым нет открытых ноутбуков Kaggle, — это снижает риск того, что ответы на задачи уже «зашиты» в обучающие данные LLM. В серии экспериментов авторы сравнивают несколько крупных языковых моделей и их связки внутри двух агентных систем AIDE и ML Master. Работа может быть полезна исследователям агентов, LLM и автоматизированных пайплайнов по решению data science задач.
статья | код
Post #146
606

- ❤ 3
- 🔥 3
- 😍 3