Kotlin Benchmark для ИИ-агентов
И сразу еще один бенчмарк ИИ. Kotlin Benchmark — официальный тест JetBrains для оценки ИИ-агентов программирования на задачах разработки на Kotlin. Цель — предоставить разработчикам достоверный и общедоступный способ оценивать эффективность разных агентов и сравнивать их конфигурации на задачах, приближенных к повседневной работе.
Первая общедоступная версия Kotlin Benchmark основана на методологии SWE-bench и сосредоточена на задачах разработки, требующих работы с Kotlin-проектом на уровне всего репозитория.
Kotlin Benchmark проверяет, насколько хорошо ИИ-агент программирования способен выполнять проверяемые инженерные задачи в существующих Kotlin-проектах. Набор данных включает 105 инженерных задач из активно развиваемых проектов с открытым исходным кодом. Для выполнения каждой задачи ИИ-агент должен:
• разобраться в реальном описании проблемы;
• изучить контекст проекта;
• подготовить работоспособное исправление.
Решения строго проверяются в контейнеризированных средах. Задача считается решённой только в том случае, если созданное агентом исправление успешно проходит все необходимые тесты. При этом результаты следует воспринимать как ориентир, а не как гарантию эффективности для любой кодовой базы. Итоговое качество работы в реальных проектах зависит от архитектуры, внутренних программных интерфейсов, стандартов написания кода, используемых инструментов и процесса проверки.
Post #6194
2.06K

- 👍 2