Сегодня я хочу разобрать с вами один из показателей LLM — Perplexity. Это техническая метрика, которая помогает понять, насколько хорошо языковая модель "понимает" и предсказывает текст.
Если объяснять простыми словами, то представьте, что модель читает текст слово за словом и пытается угадать следующее слово. Perplexity показывает, насколько модель "растеряна" при этом предсказании. Низкий Perplexity означает, что модель уверенно предсказывает следующие слова. Высокий Perplexity — модель часто "удивляется" и делает неожиданные предсказания.
Важно понимать, что Perplexity — это не показатель качества ответов модели для конечных пользователей. Это техническая метрика, которая измеряет внутреннее "понимание" языка моделью через вероятности предсказания следующего токена.
Математически Perplexity вычисляется через cross-entropy loss. Если модель на каждом шаге дает высокую вероятность правильному следующему слову — Perplexity низкий. Формула: Perplexity = 2^(cross-entropy).
Perplexity используется для сравнения языковых моделей между собой. GPT-4 имеет более низкий Perplexity на большинстве тестовых датасетов, чем GPT-3.5, что говорит о лучшем "понимании" языка.
Также метрика помогает в процессе обучения — если Perplexity перестает снижаться, значит модель достигла предела на данных или начинается переобучение.
К сожалению низкий Perplexity не гарантирует, что модель будет полезна в реальных задачах. Модель может отлично предсказывать следующие слова, но при этом генерировать бессмысленный текст или галлюцинировать факты.
Perplexity полезен для сравнения архитектур моделей, мониторинга обучения и оценки общего качества языкового моделирования. Но для evaluation конкретных приложений лучше использовать специализированные метрики и бенчмарки, такие как MMLU, HellaSwag, ARC, метрики BLEU, ROUGE или современные LLM-as-judge подходы.
Полезная информация:
С чего начать изучение AI | Инструменты для оценки AI
Post #12
1.34K

- 🔥 13
- 👍 6
- ❤ 1