hh показал, что находится под капотом у корпоративного LLM-судьи для нейроразбора резюме и как он оценивает ошибки и галлюцинации.
LLM-судья — это модель, проверяющая другие модели. «Наивные» судьи могут галлюцинировать оценки, поэтому для качественного вердикта от общей шкалы отказались в пользу чётких критериев — рубрик. Чтобы сформировать каждую из них, понадобились десятки позитивных и негативных примеров. «Грамотный» судья способен хорошо различать не только очевидные попадания и промахи, но и пограничные случаи.
Из деталей — отказ от общей шкалы, около сотни положительных и отрицательных примеров для каждой рубрики, отдельная таксономия ошибок и вывод: маленькой модели иногда достаточно, если критерии хорошо разложены.
Чтобы выявить дефекты рубрик, использовали подход RIFT — таксономию типичных ошибок в критериях оценки. Финальный продукт работает в четыре этапа: валидация входных данных, извлечение доказательств, вердикты по рубрикам и расчёт итогового скора. Последний этап вынесли в код: финальную оценку даёт не модель.
О разработке LLM-судьи и вынесенных уроках вышла статья в блоге hh на Хабре.
Post #2861
3.88K
- 💊 21
- 👍 6
- 🗿 4
- 🥰 2
- ❤ 1