Правильный ответ скрыл неправильный процесс в 92% запусков агента 😱
Исследователи IBM проверили 240 запусков двух корпоративных скиллов в Codex и Claude Code с тремя моделями. Агенты работали через MCP-инструменты: получали данные мониторинга, считали показатели и записывали результат в базу.
Из 175 запусков с правильными итоговыми числами в 162 обнаружились другие отклонения:
🔘пропущенный инструмент или этап;
🔘неверные параметры и область запроса;
🔘неправильный порядок вызовов;
🔘лишние обращения;
🔘несогласованные данные в базе.
Даже среди запусков, прошедших семь проверок конечного состояния, 92,1% нарушили хотя бы одно правило процесса.
Для тебя вывод: тестировать агента только по финальному ответу недостаточно. Фиксируй контракт траектории — допустимые инструменты, аргументы, порядок действий, контрольное чтение из базы и состояние после выполнения. Эталон лучше вычислять независимо от самого агента.
Авторы также связали проверки зависимостями: в среднем 6,34 ошибки на запуск сворачивались в 2,65 первопричины. Такой граф можно встроить в CI для скиллов.
Ограничение: исследование охватывает одну корпоративную систему и два родственных процесса. Не каждое отклонение обязательно опасно — серьёзность правил нужно определять внутри конкретного домена.
Исследование IBM от 1 октября 2026 года
#aiagents #mcp #agentevaluation #llmops #regressiontesting #observability
@data_engi
Post #1388
88