TGViewer
altblog - трудовые будни altblog - трудовые будни @seopyt · 301 subscribers
Post #68 528
Контроль качества каждой статьи, а не только первой

Первую статью от нового промпта вычитывают все. А дальше конвейер: тексты выходят пачками, и остается только надеяться, что повезет и они окажутся не хуже. Если надежда - не ваш метод, этот пост для вас.

Знакомая ситуация: написали промпт, сгенерировали статью, прочитали, поправили, еще раз прочитали - отлично, запускаем. Дальше этим промптом генерятся еще тысячи текстов, которые уже никто не проверяет. А качество LLM плавает: где-то выдумала факты, где-то съела половину структуры.

Решение - тестировать тексты. Фреймворк называется deepeval (Codex или Claude поможет вам в установке и настройке): он гоняет каждую статью через набор тестов. Статья либо проходит, либо бракуется с указанием конкретной причины: "нет методологии оценки", "галлюцинация в фактах".

Как работает проверка

В deepeval два типа метрик.

Программатические: количество слов, один h1, повторы n-грамм, наличие дат, таблиц сравнения. Вы самостоятельно пишете код для проверки. Их может быть хоть 100 штук - это бесплатно. Настраивать можно вручную в браузере, через код, или дать задание вашему любимому ИИ.

G-Eval: LLM-судья, которому критерий проверки пишется обычным текстом. "Проверь, чтобы бонус был описан с реальными условиями: вейджер, минимальный депозит, срок отыгрыша".

Плюс встроенные: FaithfulnessMetric сверяет каждое утверждение с фактами из вашей БД (RTP, лицензии, платежки), есть еще HallucinationMetric и другие.

Калибровка на живых сайтах

Спойлер: пороги из головы не работают, их надо калибровать на реальных текстах.

Я прогнал свои тесты на статьях топовых сайтов и заведомый спам. Топы стабильно дают оценку ~0.76, спам ~0.46.

Максимальный разрыв между хорошим и плохим текстом:
- Попадание в интент запроса
- Переспам
- Таблица сравнения
- Числовой рейтинг с его обоснованием

Один вывод из калибровки, который сэкономит вам время:
В качестве судьи используйте gpt-4o-mini. Тестировал более свежую gpt-5.4-nano - в 4 раза медленнее и ставит либо 0.0, либо 0.9.


Сколько стоит? У меня выходит от $0.148 (меньше проверок) до $0.24 за статью (135 проверок).
  • 🔥 8
More from @seopyt
  1. Sep 21, 2026Новая хайповая модель Jev, которая не пишет текст Про Jev от TypeSafe в твиттере не написа…
  2. Sep 18, 2026😀 18.08.2026 - Google Spam Update: месяц спустя Прошел месяц со злополучного апдейта - са…
  3. Sep 8, 2026💰Разбор ссылочного бюджета 4 гемблинг-гигантов Появилась идея сделать большой ревьюшник.…
  4. Aug 17, 2026Как сравнивать промпты и модели LLM перед запуском конвейера? В прошлый раз разбирали как…
  5. Jul 4, 2026SEOGets.com снова стал бесплатным (пока) Монетизировать SEO-специалистов, особенно в эпоху…
  6. Jun 22, 2026Родной язык копирайтера определяется даже после DeepL - и ловится без нейросетей Когда коп…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →