Привет!
На грядущей РГ снова поговорим про бенчмарки. На этот раз про оценку безопасности кода, который пишут LLM и всеми любимые coding-агенты.
Залезем под капот SecCodeBench-V2 от компании Alibaba и выясним:
- как устроены задачи и их автоматическая оценка через песочницу,
- зачем бенчмарку понадобился подход LLM-as-a-judge,
- насколько честно сравнивать модели по итоговому скору,
- попрепарируем датасет руками: несостыковки, баги и недочеты,
- а также покажем замеры качества на тройке-другой open-source моделей.
А еще попытаемся ответить на вопрос, можно ли доверять бенчмарку, который разработчик модели сделал для оценки собственной модели?)
Встречаемся как обычно в пятницу в 15:00 по МСК.
Ссылка на встречу: Link
#reading_group #benchmark
Post #138
1.29K

- 🔥 8
- 👍 6
- 😁 2
- ✍ 1