Многие думают, что ИИ-агент это особая магия, которую нужно долго учиться писать. На деле всё очень просто.
Представим агента, который отвечает на вопросы покупателей в небольшом интернет-магазине. Для него нужно всего четыре вещи.
1. System prompt == кто агент и как себя ведёт:
Ты — консультант магазина «Уютный дом». Отвечаешь вежливо и коротко.
Помогаешь с товарами, доставкой, оплатой и возвратами.
Если не знаешь ответа — не выдумывай, предложи связаться с менеджером.
2. Skills == знания о том, как решать типовые задачи:
правила доставки и возврата;
как подобрать товар под запрос (нужен плед для дачи до 3000 ₽);
как отвечать на вопрос «где мой заказ».
3. Инструменты == что агент умеет делать:
search_products(query) = поиск по каталогу;get_order_status(order_id) = статус заказа;create_ticket(text) = передать вопрос менеджеру.4. Запрос к LLM == собираем всё вместе и отправляем модели вопрос пользователя. Модель сама решит, какой инструмент вызвать, получит результат и формирует ответ.
Вуаля. Агент готов ✅
Но если всё так просто, почему вокруг столько шума?
Потому что главная боль в этом случае начентся после запуска. Тысячи непротестированных кейсов выльются для пользователя. В реальности больше всего времени уходит не на написание агента, а на контроль его качества:
что он скажет, если его оскорбить?
что будет, если попросить данные чужого заказа?
а если товара нет, но клиент очень настаивает?
Таких корнер кейсов десятки, а может даже сотни. Разом их выявить и научить агента вести себя нужным образом == здесь и уходит основное время.
Как делают на практике
Шаг 1. Собираем кейсы до разработки
Выгружаем реальные вопросы клиентов из чатов, почты. Группируем их: товары, доставка, заказы, жалобы.
Отдельно придумываем плохие кейсы: грубость, попытки взлома промпта, запросы чужих данных.
На каждый кейс записываем ожидаемое поведение. Не точный текст ответа, а общую суть: «должен отказать», «должен вызвать get_order_status».
Получается датасет из десятка-сотни кейсов. Тут и делается основная магия
Шаг 2. Реализуем агента
То, что описано выше.
Шаг 3. Контроль качества
Эвалы. Прогоняем агента по всему датасету и смотрим, сколько кейсов прошло. Простые проверки делаем кодом (вызвал ли нужный инструмент), сложные поручаем агенту-критику («был ли ответ вежливым и не выдумал ли он условия доставки»).
Шаг 4. Мониторинг после запуска
Логируем диалоги и смотрим данные: что агент вызывал и почему так ответил.
Отслеживаем проблемы.
Так что написать простого агента можно за вечер, а вот выпустить качественную версию может занять недели
На курсе я отдельно рассказываю про ии-агентов и учу их строить.