Недавно изучил исследование "Coin Flip Judge?" , в котором исследователи прогнали 29 задач из 10 категорий через две judge-модели от OpenAI, повторяя одну и ту же пару ответов много раз.
Результат получился интересным, потому что судья меняет вердикт в среднем в 13,6% прогонов. На 28% вопросов отклонение было выше 20%, а на одном вопросе судья менял решение в 56% случаев, то есть по сути как подбрасывать монетку.
Плюс также был обнаружен position bias, где GPT-4o-mini в роли судьи значимо чаще выбирал ответ, который стоял на первой позиции, почти в 72% случаев, независимо от содержания.
Получается, если один раз прогнать evaluation через LLM as a judge и получить ответ, например, “модель А лучше модели Б”, то это вполне может быть просто шум рандомизации, а не реальное различие.
Что с этим делать? Авторы посчитали: чтобы мажоритарное голосование с 95% вероятностью совпало с эталонным вердиктом на 50 прогонах, нужно минимум 11 повторов на кейс, а для вопросов с высокой дисперсией около 15 и больше.
Практически в eval пайплайне это выглядит так, что каждый кейс прогоняешь через judge не 1, а 15-20 и берется общий средний вердикт, а не первый попавшийся. Также можно анализировать отклонение по кейсу, и если оно высокое, то это сигнал, что сам кейс неоднозначный, а не что судья плохой.
Да, выходит дороже по токенам, зато вердикт наконец что-то значит и будет объективен.
Источник: https://arxiv.org/abs/2606.13685
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 9 сентября! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #166
520

- 👍 4
- 🤔 3