TGViewer
Вайб-кодинг Вайб-кодинг @vibecoding_tg · 63.3K subscribers
Post #3383 18.1K
Если используете LLM-as-a-Judge для оценки моделей, стоит обратить внимание на эту работу.

В статье представлен метод BINEVAL, который разбивает каждый критерий оценки на набор простых вопросов с ответами «да» или «нет». Каждый вопрос оценивается независимо, после чего результаты объединяются в многомерную итоговую оценку.

Такой подход позволяет увидеть, почему модель получила низкий балл по конкретному критерию, а сами ответы можно использовать для точечной доработки промптов.
Авторы сообщают, что на бенчмарках SummEval, Topical-Chat и QAGS метод без дополнительного обучения показывает результаты на уровне или выше UniEval и G-Eval, особенно при проверке фактической достоверности.

Статья: https://arxiv.org/abs/2606.27226 🐸
More from @vibecoding_tg
  1. Oct 1, 2026Сохраняйте: Anthropic запустила новый сайт для разработчиков — claude.dev. 🦀 Это не докум…
  2. Oct 1, 2026Gemini снова здесь: ночью вышел Gemini 4 Argon 🥳 Он впервые занял первое место в Vals Ind…
  3. Sep 30, 2026Старпёры это вам: кто-то запустил Claude на кнопочном Nokia Series 40 2007 года. 💀 https:…
  4. Sep 30, 2026OpenAI начал начислять пользователям по $2 500! Пользователи начали получать по 62 500 кре…
  5. Sep 30, 2026Anthropic платит до $650 000 в год специалистам, которые действительно глубоко понимают гл…
  6. Sep 30, 2026Ну, он же Ultrafast, а не Ultracheap. 🤣
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →