Как оценить работу модели?
Часто вижу высказывания в стиле: вот новый клод стал тупее, или сжатие контекста работает плохо или так себе удерживается контекст. Я всегда задаюсь вопросом а как вы это поняли? Как ты понял, что новая версия модели стала работать хуже, или что контекст стал удерживаться не так как раньше?
В идеале чтобы это понимать у тебя должен быть свой бенчмарк на это. Желательно прям на задачи которые ты делаешь. Потому как открытые бенчмарки, которые используются для маркетинга новой версии модели особо ничего не дают. То что модель проходит swe bench не дает гарантию что на твоих задачах она покажет такой-же результат. Я к таким бенчмаркам скептично отношусь, потому как скорее всего модели прям под эти бенчмарки и обучаются.
Еще у нас у самих мозг довольно плохо контекст держит, сегодня ты поспал хуже, в итоге в промте не указал не всю информацию и вот уже нейронка отупела.
При этом понятное дело, что собирать свой серьезный бенчмар, это прям дело не простое. Еще и систему для запусков и оценки нужно делать, а это уже прям на целый проект тянет. В итоге так и получается что оцениваем мы модели в итоге чисто по вайбу.
Post #593
3.97K
- ❤ 7
- 🤔 2