И начну с статьи. Почитать можно тут.
Из приятного, ее недавно приняли на KDD – такая конфа с фокусом на приложения ML в индустрии, датасеты и эвалы. В этом году пройдет в Корее (что-то на азию всех потянуло, сейчас там проходит ICML).
Теперь к сути. К нам часто приходили энтерпрайзы с одними и теми же вопросами: вот есть у меня набор агентских скиллов, а как мне понять, что он вообще что-то делает? насколько он полезный? и что будет, если я заменю одну модель на другую, а скилл оставлю?
Мы соорудили многоступенчатый пайплайн генерации эвалов, чтобы отвечать на такие вопросы. Бенчмаркали все компоненты на опенсоурсных скиллах. Так и появилась статья.
А именно: берем реальный скилл, генеирурем на основе него реалистичную задачу + набор рубрик, заточенных под Instruction Following (IF). Потом решаем эту задачу целевой моделью + выбранным агентским харнессом в изолированной среде. Дальше измеряем качество решения с помощью рубрик, используя логи агента + решение задачи. Логи в данном случае очень важная штука, так как позволяют ловить какие промежуточные шаги делает агент и делает ли что-то такое, что прямо противоречит скиллу.
Померили такой пайплайн на качественных скиллах от больших вендоров (11labs, hugging face, ...) для большого количество моделей, открытх и закрытых + различных размеров.
Ключевой результат на картинке к посту.
Из основного:
• размер модели решает: чем она больше, тем как правило лучше, хорошо видно на семействе всех фронтир лаб
• новизна модели тоже решает; более свежая Gemini Flash 3.5 на уровне старой Pro 3.1
• опенсоурс отстает, но местами может быть очень компетитив, взять GLM - по результатам на уровне Сонета (тестил эту модельку в кодинге сам и впечатления очень хорошие; в отличие от Kimi - но кими и на нашем бенче проседает сильно)
• Прогнав агента с скиллом и без него можно измерить насколько скилл вообще важен (или модель и без скилла уже действовала как ожидается)
Последний пункт особенно полезен на практике. Конкретный пример. HF относительно недавно меняли свой cli - заменив его с
huggingface-cli на просто hf. Первый депрекейтят и четко пишут не использовать. Но без скилла модель зачастую упорно выбирает старый вариант.—
Будете делать какой-то рисерч про скиллы, буду благодарен, если поцитируете. Если есть ресурсы (токены и люди) вести рисерч в области кодинг агентов и бенчей, буду рад поколабить тоже, напишите в лс)
Статья была побочной активностью, как это и бывает в прикладных командах. Но все равно приятно, что наконец-то что-то докатилось до публикации. За последние 4 года 2 мои статьи эпохи работы в Амазоне попали под эмбарго и уже никогда не увидят свет
