TGViewer
Ilyas Salikhov Ilyas Salikhov @dev_salikhov · 1.74K subscribers
Post #7 414
Ilyas Salikhov Как организовать работу с промптами для AI-агентов В RetailCRM мы начинали с промптов в формате строки или f-string. Для простых промптов это ок. Но вот ты написал первую версию промпта, запустил, увидел косяки или ненужное поведение LLM, дорабатываешь…
Как тестировать AI-агентов (python-пакет llm-flaky)

AI-агентов надо тестировать. С этим, думаю, никто не спорит.

Конечно, можно использовать ручное тестирование, но по мере усложнения агента это делать всё сложнее. Да и есть такая «неприятная» часть бизнес-логики, которая заложена в виде промпта. А его изменение, бывает, начинает влиять на поведение агента там, где не ожидаешь.

Короче, тесты нужны. Мы их пишем в виде обычных pytest-ов.

Но LLM — вещь недетерминированная. Сейчас она ответила так, а при следующем прогоне иначе. Мы регулярно сталкивались с «миганиями» тестов. И пришли к тому, что для LLM это ок. Они по определению не гарантируют правильный ответ в всех случаях.

Мы для себя задаем планку в 80% успешных прогонов. Реализуем через многократный прогон теста нужное количество раз. Для 80% тест должен успешно выполниться как минимум 4 раза из 5.

Все упаковали и оформили в pypi-пакет llm-flaky.

Как пользоваться llm-flaky

1. Ставите пакет

2. Размечаете llm-тесты


import pytest

@pytest.mark.llm
async def test_llm_response():
response = await call_llm("What is 2+2?")
assert "4" in response


3. Прогоняете и на выходе получаете красивый отчет 🙂

Вы можете настроить свои пороги успешного прохождения llm-теста, в пакете предусмотрены соответствующие параметры.

Также поддерживается рапараллеливание через pytest-xdist. Сильно ускоряет прогоны.

🔗 Инженерия и AI | Ilyas Salikhov
  • 👍 2
  • 🔥 1
More from @dev_salikhov
  1. Sep 24, 2026Ilyas Salikhov pinned «🔳▶️▶️▶️▶️▶️📦◀️◀️ Мы запустили AgentBox — облачные песочницы для в…
  2. Sep 22, 2026🔳▶️▶️▶️▶️▶️📦◀️◀️ Мы запустили AgentBox — облачные песочницы для ваших AI-агентов с полно…
  3. Sep 19, 2026RIP CLAUDE.md С версии 2.1.277 Claude Code стал поддерживать AGENTS.md. Я с одной стороны…
  4. Sep 1, 2026Пора перестать писать свой harness для AI-агентов Представьте, что вам поставили (или вы с…
  5. Aug 28, 2026Как-то тут упоминал про Орфея (Orpheus), нашего сквозного AI-агента в RetailCRM. Вообще, о…
  6. Jul 22, 2026Это база Убежден, что каждый разработчик, считающий себя экспертом, должен понимать устрой…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →