TGViewer
altblog - трудовые будни altblog - трудовые будни @seopyt · 301 subscribers
Post #69 484
Как сравнивать промпты и модели LLM перед запуском конвейера?

В прошлый раз разбирали как ловить плохую статью на выходе с помощью deepeval. Но можно ловить раньше: на самом промпте и модели, которой вы этот промпт скармливаете (спасибо, Кэп!). Инструмент для этого - бесплатный promptfoo (есть веб-версия на локалке и CLI).

Перечисляете промпты, модели и тесты с проверками, а promptfoo проверит их: каждый промпт * каждую модель * каждую проверку.

Проверки здесь двух видов, прям как в deepeval:
- Детерминированные: Проверяют, что в тексте есть нужное число, есть таблица и т.д. Это бесплатно.
- LLM-судья: Критерий пишется обычным текстом. Например: "верно ли передана механика?". Платим за токены.

С помощью promptfoo очень быстро можно протестировать новую модель, сравнив ее с другими.

📝 Лайв-тест

Я взял слот Gates of Olympus и собрал по нему: RTP, максимальный выигрыш, механика, множители, фриспины, ставки. И дал задание 14 моделям (OpenAI от gpt-4o-mini до gpt-5.6, плюс китайские Kimi-K3, GLM-5.2, Qwen3.8) написать обзор слота двумя промптами: по памяти и с фактами внутри промпта.

📝 Результаты по памяти

gpt-5.4-mini перепутал механику: назвал "Pay Anywhere / Cluster" вместо Scatter Pays. Насчитал 6 номиналов множителей вместо 15, заявил, что бонуса нет (есть).

➕gpt-5.6-sol выдумал номинал множителя 75x, которого в игре не существует, и hit frequency 27,27% (реальная 28,82%).

➕gpt-4o-mini перепутал вообще все выплаты за скаттеры (5x/100x/500x вместо 3x/5x/100x).

➕gpt-4.1-mini уверенно написал, что Ante Bet и Buy Feature "отсутствуют". Обе функции есть.

➕gpt-5.4-nano выдал сетку 5x4 вместо 6x5.

Ноль галлюцинаций у gpt-4o, gpt-5, gpt-5.2, Kimi-K3 и Qwen3.8 - они либо знают точные цифры, либо честно пишут "нет данных". Отдельно отмечу Kimi-K3: китайская модель знает слоты не хуже топового OpenAI (25 верных фактов, ноль галлюцинаций).

📝 Результаты с фактами

Промпт с фактами внутри - обнулил галлюцинации у всех 14 моделей. Ноль. Включая тех, кто по памяти путал механику.

📝 Вывод

Имея пару промптов и базу фактов, вы за полчаса получаете объективный, воспроизводимый рейтинг любых моделей по своей теме. Вышла новая модель - добавили строчку в конфиг, прогнали, увидели ее место в рейтинге.

Про LLM-судью: где нужна смысловая оценка, берите gpt-5-mini.

Сколько стоит? Весь эксперимент - 14 моделей, два прогона, сотни проверок - обошелся меньше чем в доллар.
  • 👍 7
More from @seopyt
  1. Sep 21, 2026Новая хайповая модель Jev, которая не пишет текст Про Jev от TypeSafe в твиттере не написа…
  2. Sep 18, 2026😀 18.08.2026 - Google Spam Update: месяц спустя Прошел месяц со злополучного апдейта - са…
  3. Sep 8, 2026💰Разбор ссылочного бюджета 4 гемблинг-гигантов Появилась идея сделать большой ревьюшник.…
  4. Jul 20, 2026Контроль качества каждой статьи, а не только первой Первую статью от нового промпта вычиты…
  5. Jul 4, 2026SEOGets.com снова стал бесплатным (пока) Монетизировать SEO-специалистов, особенно в эпоху…
  6. Jun 22, 2026Родной язык копирайтера определяется даже после DeepL - и ловится без нейросетей Когда коп…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →