TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #24 882
#Новости

Всем привет!

Недавно прочитал новость, что в Стэнфорде придумали новый поход к оценке LLM, чтобы проверять модели быстрее и дешевле. Вместо того чтобы гонять модель по тысячам вопросов из готовых бенчмарков (о которых я уже писал тут), они обучили две вспомогательные модели:

1. Оценщик сложности — маленькая нейросеть, которая по тексту задачи предсказывает её трудность. Оценщик обучен на 22 популярных бенчмарках и 172 моделях.
2. Генератор вопросов — LLM, обученная выдавать новые задания на заданном уровне сложности.

Таким образом выбирается короткий, но хорошо сбалансированный автоматический датасет для теста новых моделей, который даёт почти тот же результат, что и целые бенчмарки, но дешевле и быстрее, потому что вопросы задаются не все сразу из бенчмарков, а оптимизированно под определенный уровень возможностей LLM (то есть выборочно).

Как это работает:
⁃ Тест сам начинает с вопроса средней сложности; вручную задавать стартовый уровень не нужно и задает его вашей LLM
⁃ По результатам ответа от вашей LLM, оценщик фиксирует ответ, а алгоритм подбирает следующую задачу из уже размеченного набора вопросов, чтобы понять возможности вашей LLM в зависимости от того, как ваша LLM ответила на предыдущий вопрос
⁃ Если ваша LLM сильная, то задачи постепенно усложняются; если слабая — упрощаются
⁃ Адаптивный алгоритм задает вопросы вашей LLM, пока не добьётся нужной статистической точности оценки ваше модели (грубо говоря пока модель постоянно не начнет некорректно отвечать на вопросы).

Чтобы побольше познакомиться с данным подходом, ниже ссылки на статью и само исследование.

Stanford News

Reliable and Efficient Amortized Model-based Evaluation research


Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI
  • 👍 4
  • ❤ 1
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →