Первую статью от нового промпта вычитывают все. А дальше конвейер: тексты выходят пачками, и остается только надеяться, что повезет и они окажутся не хуже. Если надежда - не ваш метод, этот пост для вас.
Знакомая ситуация: написали промпт, сгенерировали статью, прочитали, поправили, еще раз прочитали - отлично, запускаем. Дальше этим промптом генерятся еще тысячи текстов, которые уже никто не проверяет. А качество LLM плавает: где-то выдумала факты, где-то съела половину структуры.
Решение - тестировать тексты. Фреймворк называется deepeval (Codex или Claude поможет вам в установке и настройке): он гоняет каждую статью через набор тестов. Статья либо проходит, либо бракуется с указанием конкретной причины: "нет методологии оценки", "галлюцинация в фактах".
Как работает проверка
В deepeval два типа метрик.
Программатические: количество слов, один h1, повторы n-грамм, наличие дат, таблиц сравнения. Вы самостоятельно пишете код для проверки. Их может быть хоть 100 штук - это бесплатно. Настраивать можно вручную в браузере, через код, или дать задание вашему любимому ИИ.
G-Eval: LLM-судья, которому критерий проверки пишется обычным текстом. "Проверь, чтобы бонус был описан с реальными условиями: вейджер, минимальный депозит, срок отыгрыша".
Плюс встроенные: FaithfulnessMetric сверяет каждое утверждение с фактами из вашей БД (RTP, лицензии, платежки), есть еще HallucinationMetric и другие.
Калибровка на живых сайтах
Спойлер: пороги из головы не работают, их надо калибровать на реальных текстах.
Я прогнал свои тесты на статьях топовых сайтов и заведомый спам. Топы стабильно дают оценку ~0.76, спам ~0.46.
Максимальный разрыв между хорошим и плохим текстом:
- Попадание в интент запроса
- Переспам
- Таблица сравнения
- Числовой рейтинг с его обоснованием
Один вывод из калибровки, который сэкономит вам время:
В качестве судьи используйте gpt-4o-mini. Тестировал более свежую gpt-5.4-nano - в 4 раза медленнее и ставит либо 0.0, либо 0.9.
Сколько стоит? У меня выходит от $0.148 (меньше проверок) до $0.24 за статью (135 проверок).