Как сравнивать промпты и модели LLM перед запуском конвейера?
В прошлый раз разбирали как ловить плохую статью на выходе с помощью deepeval. Но можно ловить раньше: на самом промпте и модели, которой вы этот промпт скармливаете (спасибо, Кэп!). Инструмент для этого - бесплатный promptfoo (есть веб-версия на локалке и CLI).
Перечисляете промпты, модели и тесты с проверками, а promptfoo проверит их: каждый промпт * каждую модель * каждую проверку.
Проверки здесь двух видов, прям как в deepeval:
- Детерминированные: Проверяют, что в тексте есть нужное число, есть таблица и т.д. Это бесплатно.
- LLM-судья: Критерий пишется обычным текстом. Например: "верно ли передана механика?". Платим за токены.
С помощью promptfoo очень быстро можно протестировать новую модель, сравнив ее с другими.
📝 Лайв-тест
Я взял слот Gates of Olympus и собрал по нему: RTP, максимальный выигрыш, механика, множители, фриспины, ставки. И дал задание 14 моделям (OpenAI от gpt-4o-mini до gpt-5.6, плюс китайские Kimi-K3, GLM-5.2, Qwen3.8) написать обзор слота двумя промптами: по памяти и с фактами внутри промпта.
📝 Результаты по памяти
➕gpt-5.4-mini перепутал механику: назвал "Pay Anywhere / Cluster" вместо Scatter Pays. Насчитал 6 номиналов множителей вместо 15, заявил, что бонуса нет (есть).
➕gpt-5.6-sol выдумал номинал множителя 75x, которого в игре не существует, и hit frequency 27,27% (реальная 28,82%).
➕gpt-4o-mini перепутал вообще все выплаты за скаттеры (5x/100x/500x вместо 3x/5x/100x).
➕gpt-4.1-mini уверенно написал, что Ante Bet и Buy Feature "отсутствуют". Обе функции есть.
➕gpt-5.4-nano выдал сетку 5x4 вместо 6x5.
Ноль галлюцинаций у gpt-4o, gpt-5, gpt-5.2, Kimi-K3 и Qwen3.8 - они либо знают точные цифры, либо честно пишут "нет данных". Отдельно отмечу Kimi-K3: китайская модель знает слоты не хуже топового OpenAI (25 верных фактов, ноль галлюцинаций).
📝 Результаты с фактами
Промпт с фактами внутри - обнулил галлюцинации у всех 14 моделей. Ноль. Включая тех, кто по памяти путал механику.
📝 Вывод
Имея пару промптов и базу фактов, вы за полчаса получаете объективный, воспроизводимый рейтинг любых моделей по своей теме. Вышла новая модель - добавили строчку в конфиг, прогнали, увидели ее место в рейтинге.
Про LLM-судью: где нужна смысловая оценка, берите gpt-5-mini.
Сколько стоит? Весь эксперимент - 14 моделей, два прогона, сотни проверок - обошелся меньше чем в доллар.
Post #69
484

- 👍 7