TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #166 520
Недавно изучил исследование "Coin Flip Judge?" , в котором исследователи прогнали 29 задач из 10 категорий через две judge-модели от OpenAI, повторяя одну и ту же пару ответов много раз.

Результат получился интересным, потому что судья меняет вердикт в среднем в 13,6% прогонов. На 28% вопросов отклонение было выше 20%, а на одном вопросе судья менял решение в 56% случаев, то есть по сути как подбрасывать монетку.

Плюс также был обнаружен position bias, где GPT-4o-mini в роли судьи значимо чаще выбирал ответ, который стоял на первой позиции, почти в 72% случаев, независимо от содержания.

Получается, если один раз прогнать evaluation через LLM as a judge и получить ответ, например, “модель А лучше модели Б”, то это вполне может быть просто шум рандомизации, а не реальное различие.

Что с этим делать? Авторы посчитали: чтобы мажоритарное голосование с 95% вероятностью совпало с эталонным вердиктом на 50 прогонах, нужно минимум 11 повторов на кейс, а для вопросов с высокой дисперсией около 15 и больше.

Практически в eval пайплайне это выглядит так, что каждый кейс прогоняешь через judge не 1, а 15-20 и берется общий средний вердикт, а не первый попавшийся. Также можно анализировать отклонение по кейсу, и если оно высокое, то это сигнал, что сам кейс неоднозначный, а не что судья плохой.

Да, выходит дороже по токенам, зато вердикт наконец что-то значит и будет объективен.

Источник: https://arxiv.org/abs/2606.13685



⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 9 сентября! 🔥


Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
  • 👍 4
  • 🤔 3
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →