На Kaggle стартовал новый AI-конкурс K Prize (Konwinski Prize) от сооснователя Databricks и Perplexity Энди Конвински.
Главная идея проверить, смогут ли open-source AI-модели решать реальные задачи разработки. Особенность конкурса: модели отправляются заранее, а тестовые задачи выбираются позже из свежих GitHub-issues, появившихся уже после дедлайна. Конвински обещает выплатить $1 млн первой модели, которая решит более 90% задач, но кажется что пока деньги в безопасности.
Оценка моделей проходит:
• Офлайн: без доступа в интернет.
• Ограниченные ресурсы: не больше 4-х GPU (L4), предоставленных Kaggle.
• Проверка основана только на новых GitHub-issues, что исключает возможность заранее подготовить модель.
Первый тур показал, насколько это сложно: лучшая модель справилась лишь с 7,5% задач. Тут надо учесть, что все закрытые модели типа Claude/OpenAI сюда не попадают. Открытые модели типа Qwen 3 только в сильно квантизованном виде (аппаратные ограничения).
Сам Конвински считает, что подобный подход к тестированию, взятый из соревнований по прогнозированию рынка, полностью исключает возможность заранее «подогнать» модель под тестовые данные. «Пока мы не можем приблизиться даже к 10% задач из бенчмарка, о замене программистов на AI говорить рано», — говорит Конвински (тут стоит напомнить, что большие проприетарные модели участвовали). Ветка на Reddit.
Post #350
1.73K