TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.38K subscribers
Post #12 1.34K
Сегодня я хочу разобрать с вами один из показателей LLM — Perplexity. Это техническая метрика, которая помогает понять, насколько хорошо языковая модель "понимает" и предсказывает текст.

Если объяснять простыми словами, то представьте, что модель читает текст слово за словом и пытается угадать следующее слово. Perplexity показывает, насколько модель "растеряна" при этом предсказании. Низкий Perplexity означает, что модель уверенно предсказывает следующие слова. Высокий Perplexity — модель часто "удивляется" и делает неожиданные предсказания.

Важно понимать, что Perplexity — это не показатель качества ответов модели для конечных пользователей. Это техническая метрика, которая измеряет внутреннее "понимание" языка моделью через вероятности предсказания следующего токена.

Математически Perplexity вычисляется через cross-entropy loss. Если модель на каждом шаге дает высокую вероятность правильному следующему слову — Perplexity низкий. Формула: Perplexity = 2^(cross-entropy).

Perplexity используется для сравнения языковых моделей между собой. GPT-4 имеет более низкий Perplexity на большинстве тестовых датасетов, чем GPT-3.5, что говорит о лучшем "понимании" языка.

Также метрика помогает в процессе обучения — если Perplexity перестает снижаться, значит модель достигла предела на данных или начинается переобучение.

К сожалению низкий Perplexity не гарантирует, что модель будет полезна в реальных задачах. Модель может отлично предсказывать следующие слова, но при этом генерировать бессмысленный текст или галлюцинировать факты.

Perplexity полезен для сравнения архитектур моделей, мониторинга обучения и оценки общего качества языкового моделирования. Но для evaluation конкретных приложений лучше использовать специализированные метрики и бенчмарки, такие как MMLU, HellaSwag, ARC, метрики BLEU, ROUGE или современные LLM-as-judge подходы.


Полезная информация:
С чего начать изучение AI | Инструменты для оценки AI
  • 🔥 13
  • 👍 6
  • ❤ 1
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →