Когда создаёшь сложного AI-агента с несколькими тулами, ручная отладка быстро превращается в ад: модель может галлюцинировать параметры, путать очерёдность шагов или ломаться на 5-м ходу диалога. Google выложила в открытый доступ agents-cli — официальный набор инструментов и скиллов для Claude Code, Antigravity и Codex, закрывающий цикл автоматического тестирования и оценки агентов.
Ключевые возможности:
• Анализ траекторий инструментов: проверяет логику вызовов тулов по гибким рубрикам, а не жестким шаблонам — учитывает промежуточные действия, многоходовые сессии и контекст.
• Синтез датасетов (
eval dataset synthesize): автоматически генерирует реалистичные многошаговые сценарии для проверки крайних случаев.• Защита от регрессий (
eval compare): наглядно сравнивает результаты двух прогонов до и после правок промпта или логики.• Автооптимизация (
eval optimize): кластеризует сбои и помогает тюнить системные инструкции на основе реальных ошибок.Быстрый старт:
Установить скилл в своего кодинг-ассистента:
npx skills add google/agents-cli --skill google-agents-cli-evalИли развернуть полный CLI через uv:
uvx google-agents-cli setupДля локальных прогонов и эвалов достаточно обычного API-ключа Google AI Studio.
👀 Репозиторий проекта: google/agents-cli
GHOSTLY | AI 🌐 | ЧАТ 💬