Скиллы AI-агента оптимизировали как многорукого бандита 😎
10 сентября исследователи представили COBRA-Skills — систему, которая улучшает инструкции-скиллы без полного прогона каждого варианта.
Каждый скилл считается отдельным «рычагом». Небольшая модель прогнозирует его полезность, а алгоритм LinearUCB добавляет приоритет перспективным, но ещё плохо изученным вариантам. Только победитель раунда запускается на реальном агенте.
Периодически система обновляет набор скиллов:
🔘 переписывает инструкции по успешным и провальным траекториям;
🔘 комбинирует удачные подходы;
🔘 удаляет слабые варианты;
🔘 добавляет новые направления поиска.
На шести бенчмарках и трёх моделях COBRA-Skills показала лучший средний результат среди сравниваемых методов. Стоимость оптимизации снизилась на 55–58% относительно SkillOpt, причём для каждого бенчмарка использовалось лишь 50 примеров.
Для тебя вывод: скиллы агента можно оптимизировать как ограниченный вычислительный бюджет. Не тестировать всё подряд, а направлять дорогие запуски туда, где ожидается польза или не хватает данных.
Пока это результаты авторов на бенчмарках, а не проверка в продакшене. Но код уже открыт под Apache 2.0.
Пруфы:
🔘исследование COBRA-Skills от 10 сентября 2026 года
🔘репозиторий проекта
#aiagents #agentskills #contextualbandits #llmops #agentoptimization #opensource
@data_engi
Post #1344
182