Надо из истории переписок боевого аккаунта создать ключевые ситуации, которыми будем гонять тесты агента.
То есть из одних и тех же реальных переписок должны синтезироваться:
• личность и правила агента;
• память / FAQ в JSON;
• набор ключевых вопросов и ситуаций для тестирования;
• верификатор, который будет оценивать, правильно ли агент отработал каждый кейс.
Процесс должен работать так:
• берём реальные переписки;
• из них синтезируем личность, правила и память агента / FAQ JSON
• За основу берем структуру Hermes
• из них же синтезируем ключевые вопросы и ситуации, которыми будем гонять агента;
• замыкаем мой Telegram-аккаунт через Telethon на аккаунт рекрутера;
• прогоняем тесты на боевом DeepSeek-ключе Hermes;
• фиксируем результаты каждого прогона;
• после прогона оцениваем ответы Hermes через верификатор;
• если всё ок — тест пройден;
• если нет — исправляем агента и прогоняем снова.
При каждом значимом изменении личности или инструкций агента обязательно полностью прогонять весь список тестов. Этот процесс должен быть захардкожен.
Во время тестов и боевого исполнения также нужно сохранять все доступные логи и трейсинг, чтобы потом можно было восстановить: что получил агент, какое решение принял, какие тулы использовал, что сделал или написал и почему. Если модель не отдаёт внутренний reasoning, фиксируем только реально доступный trace, не пытаясь его додумывать.
После выхода в бой первые 5 дней модель, которая строит и контролирует агента, каждые 15 минут проверяет новые боевые диалоги и оценивает качество его ответов. Найденные ошибки и новые значимые ситуации должны добавляться в тесты.
Отдельно постоянно фиксировать состояние самой системы: что уже реализовано, что ещё не реализовано, что работает, что требует доработки.
Понятное дело что дальше у каждого своя игра, но именно отсюда у меня обычно все начинается.