Всем привет.
Сегодня я хочу разобрать с вами принципиальную разницу между генеративными и дискриминативными моделями и особенности их evaluation. Понимание этой разницы критически важно для правильного выбора метрик оценки.
Генеративные модели создают новый контент - тексты, изображения, код. Они учатся понимать, как устроены данные, чтобы генерировать похожие примеры.
Дискриминативные модели решают задачи классификациии и предсказаний, например, отличают спам от не-спама, определяют эмоции в тексте, пронозируют погоду.
Генеративные модели - особенности evaluation:
Качество генерации: Главный вызов, это как оценить качество сгенерированного контента? Для текста используются метрики как BLEU, ROUGE, но они имеют ограничения. Более современный подход — LLM-as-judge evaluation, где другая модель оценивает качество генерации по критериям fluency, coherence, relevance.
Разнообразие (diversity): Генеративная модель не должна просто копировать обучающие данные. Оценивается через метрики как Self-BLEU (чем ниже, тем больше разнообразия), n-gram diversity, или embedding-based similarity между сгенерированными примерами.
Дискриминативные модели - особенности evaluation:
Точность классификации: Классические метрики - accuracy, precision, recall, F1-score. Также, если обучаемый датасет несбаланирован, то нужны метрики как AUC-ROC, AUC-PR, balanced accuracy.
Оценка регрессии: Когда модель предсказывает числовые значения (цены, температуру, продажи), используются другие метрики. MAE (средняя абсолютная ошибка). RMSE (корень из средней квадратичной ошибки) сильнее штрафует большие ошибки. R² показывает, какую долю изменчивости данных объясняет модель.
В отличии от дискриминативных моделей, где метрики точности здесь однозначны и понятны, генеративные модели сложнее оценивать, потому что на один запрос может быть много правильных ответов.
Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI
Post #16
1.17K

- 👍 6
- ❤ 3
- 🔥 3