ИИ, Rust, вайбкодинг, Data Science, Deep Learning и делюсь тем, что интересно и полезно!
Вопросы - @workakkk
РКН: clck.ru/3FmwRz
Post #2861
3.88K
hh показал, что находится под капотом у корпоративного LLM-судьи для нейроразбора резюме и как он оценивает ошибки и галлюцинации.
LLM-судья — это модель, проверяющая другие модели. «Наивные» судьи могут галлюцинировать оценки, поэтому для качественного вердикта от общей шкалы отказались в пользу чётких критериев — рубрик. Чтобы сформировать каждую из них, понадобились десятки позитивных и негативных примеров. «Грамотный» судья способен хорошо различать не только очевидные попадания и промахи, но и пограничные случаи.
Из деталей — отказ от общей шкалы, около сотни положительных и отрицательных примеров для каждой рубрики, отдельная таксономия ошибок и вывод: маленькой модели иногда достаточно, если критерии хорошо разложены.
Чтобы выявить дефекты рубрик, использовали подход RIFT — таксономию типичных ошибок в критериях оценки. Финальный продукт работает в четыре этапа: валидация входных данных, извлечение доказательств, вердикты по рубрикам и расчёт итогового скора. Последний этап вынесли в код: финальную оценку даёт не модель.
О разработке LLM-судьи и вынесенных уроках вышла статья в блоге hh на Хабре.
LLM-судья — это модель, проверяющая другие модели. «Наивные» судьи могут галлюцинировать оценки, поэтому для качественного вердикта от общей шкалы отказались в пользу чётких критериев — рубрик. Чтобы сформировать каждую из них, понадобились десятки позитивных и негативных примеров. «Грамотный» судья способен хорошо различать не только очевидные попадания и промахи, но и пограничные случаи.
Из деталей — отказ от общей шкалы, около сотни положительных и отрицательных примеров для каждой рубрики, отдельная таксономия ошибок и вывод: маленькой модели иногда достаточно, если критерии хорошо разложены.
Чтобы выявить дефекты рубрик, использовали подход RIFT — таксономию типичных ошибок в критериях оценки. Финальный продукт работает в четыре этапа: валидация входных данных, извлечение доказательств, вердикты по рубрикам и расчёт итогового скора. Последний этап вынесли в код: финальную оценку даёт не модель.
О разработке LLM-судьи и вынесенных уроках вышла статья в блоге hh на Хабре.
- 💊 21
- 👍 6
- 🗿 4
- 🥰 2
- ❤ 1
















