Mastering LLM-as-a-Judge отличный гайд от Galileo о том, как использовать большие языковые модели для оценки других моделей.
В гайде подробно описано:
- как работает подход LLM-as-a-Judge
- какие бывают схемы оценивания (single, pairwise)
- типичные bias’ы у моделей-судей
- как строить собственную систему оценки и валидировать её
- почему появляются small language models (SLM) специально для evaluation
Если вы занимаетесь оценкой AI, метриками качества генерации или строите пайплайны тестирования LLM, то советую к прочтению.
Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #59
664