#Новости
Всем привет!
Недавно прочитал новость, что в Стэнфорде придумали новый поход к оценке LLM, чтобы проверять модели быстрее и дешевле. Вместо того чтобы гонять модель по тысячам вопросов из готовых бенчмарков (о которых я уже писал тут), они обучили две вспомогательные модели:
1. Оценщик сложности — маленькая нейросеть, которая по тексту задачи предсказывает её трудность. Оценщик обучен на 22 популярных бенчмарках и 172 моделях.
2. Генератор вопросов — LLM, обученная выдавать новые задания на заданном уровне сложности.
Таким образом выбирается короткий, но хорошо сбалансированный автоматический датасет для теста новых моделей, который даёт почти тот же результат, что и целые бенчмарки, но дешевле и быстрее, потому что вопросы задаются не все сразу из бенчмарков, а оптимизированно под определенный уровень возможностей LLM (то есть выборочно).
Как это работает:
⁃ Тест сам начинает с вопроса средней сложности; вручную задавать стартовый уровень не нужно и задает его вашей LLM
⁃ По результатам ответа от вашей LLM, оценщик фиксирует ответ, а алгоритм подбирает следующую задачу из уже размеченного набора вопросов, чтобы понять возможности вашей LLM в зависимости от того, как ваша LLM ответила на предыдущий вопрос
⁃ Если ваша LLM сильная, то задачи постепенно усложняются; если слабая — упрощаются
⁃ Адаптивный алгоритм задает вопросы вашей LLM, пока не добьётся нужной статистической точности оценки ваше модели (грубо говоря пока модель постоянно не начнет некорректно отвечать на вопросы).
Чтобы побольше познакомиться с данным подходом, ниже ссылки на статью и само исследование.
Stanford News
Reliable and Efficient Amortized Model-based Evaluation research
Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI
Post #24
882

- 👍 4
- ❤ 1