TGViewer
Костя 8Бит | Fullstack AI Костя 8Бит | Fullstack AI @kostya_web_dev · 1.06K subscribers
Post #292 363
Как же сложно писать ИИ-агентов

Многие думают, что ИИ-агент это особая магия, которую нужно долго учиться писать. На деле всё очень просто.

Представим агента, который отвечает на вопросы покупателей в небольшом интернет-магазине. Для него нужно всего четыре вещи.

1. System prompt == кто агент и как себя ведёт:
Ты — консультант магазина «Уютный дом». Отвечаешь вежливо и коротко.
Помогаешь с товарами, доставкой, оплатой и возвратами.
Если не знаешь ответа — не выдумывай, предложи связаться с менеджером.


2. Skills == знания о том, как решать типовые задачи:
правила доставки и возврата;
как подобрать товар под запрос (нужен плед для дачи до 3000 ₽);
как отвечать на вопрос «где мой заказ».


3. Инструменты == что агент умеет делать:
search_products(query) = поиск по каталогу;
get_order_status(order_id) = статус заказа;
create_ticket(text) = передать вопрос менеджеру.

4. Запрос к LLM == собираем всё вместе и отправляем модели вопрос пользователя. Модель сама решит, какой инструмент вызвать, получит результат и формирует ответ.

Вуаля. Агент готов ✅

Но если всё так просто, почему вокруг столько шума?

Потому что главная боль в этом случае начентся после запуска. Тысячи непротестированных кейсов выльются для пользователя. В реальности больше всего времени уходит не на написание агента, а на контроль его качества:

что он скажет, если его оскорбить?
что будет, если попросить данные чужого заказа?
а если товара нет, но клиент очень настаивает?


Таких корнер кейсов десятки, а может даже сотни. Разом их выявить и научить агента вести себя нужным образом == здесь и уходит основное время.

Как делают на практике

Шаг 1. Собираем кейсы до разработки

Выгружаем реальные вопросы клиентов из чатов, почты. Группируем их: товары, доставка, заказы, жалобы.
Отдельно придумываем плохие кейсы: грубость, попытки взлома промпта, запросы чужих данных.
На каждый кейс записываем ожидаемое поведение. Не точный текст ответа, а общую суть: «должен отказать», «должен вызвать get_order_status».
Получается датасет из десятка-сотни кейсов. Тут и делается основная магия

Шаг 2. Реализуем агента
То, что описано выше.

Шаг 3. Контроль качества
Эвалы. Прогоняем агента по всему датасету и смотрим, сколько кейсов прошло. Простые проверки делаем кодом (вызвал ли нужный инструмент), сложные поручаем агенту-критику («был ли ответ вежливым и не выдумал ли он условия доставки»).

Шаг 4. Мониторинг после запуска

Логируем диалоги и смотрим данные: что агент вызывал и почему так ответил.
Отслеживаем проблемы.

Так что написать простого агента можно за вечер, а вот выпустить качественную версию может занять недели

На курсе я отдельно рассказываю про ии-агентов и учу их строить.
  • 👍 18
More from @kostya_web_dev
  1. Sep 28, 202620к за час ИИ-инженера Я решил взять консультацию у одного из известных специалистов по ИИ…
  2. Sep 25, 2026Как просрать собес с нейронкой Во многих компаниях при отборе появился новый вид интервью…
  3. Sep 24, 2026Как зайти в рынок, где вакансии есть, а людей нет Одна из причин, почему я в 2025 решил си…
  4. Sep 23, 2026Рынок мёртв. Ничего не поделать (почти) По моим ощущениям, с 2024 года работу стало находи…
  5. Sep 22, 2026Сезон начался В сентябре hr прям активизировались, много пишут на линке/хх. Данная позиция…
  6. Sep 22, 2026Нам никогда не внедрить ИИ правильно Вот тут упомянул одну из серьезных проблем на текущий…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →