MCP-спецификация сама стала генератором тестов для агента
Apple представила Agent Seer — конвейер, который создаёт проверочные сценарии только по описанию MCP-сервера. Ему не нужны рабочий сервер, реальные ответы инструментов, готовые примеры или ручная разметка.
Из названий функций, описаний и схем параметров система строит:
🔘 пользовательские задачи и ожидаемые цепочки вызовов;
🔘 правдоподобные ответы инструментов;
🔘 многошаговые диалоги;
🔘 эталон для проверки агента.
На семи MCP-серверах Agent Seer сгенерировал 337 сценариев. Главным источником ошибок оказалось не количество инструментов, а сложность их параметров. Чаще всего система правильно выбирала инструмент, но подставляла неверное значение аргумента — обычная проверка только имени функции этого не замечает.
Для тебя это полезный паттерн: после изменения MCP-схемы можно автоматически пересобирать дымовые и регрессионные тесты. Заодно появляется ещё одна причина делать схемы параметров простыми и однозначными.
Ограничение существенное: сценарии и эталоны синтетические, а качество оценивала другая LLM. Такие тесты находят ошибки контракта, но не подтверждают корректность реальных данных и бизнес-логики.
Пруфы:
🔘публикация Apple
🔘полный текст исследования
#mcp #aiagents #aievals #toolcalling #testing #agentengineering
@data_engi
Post #1301
195