TGViewer
Dev Easy Notes Dev Easy Notes @dev_easy_notes · 2.91K subscribers
Post #593 3.97K
Как оценить работу модели?

Часто вижу высказывания в стиле: вот новый клод стал тупее, или сжатие контекста работает плохо или так себе удерживается контекст. Я всегда задаюсь вопросом а как вы это поняли? Как ты понял, что новая версия модели стала работать хуже, или что контекст стал удерживаться не так как раньше?

В идеале чтобы это понимать у тебя должен быть свой бенчмарк на это. Желательно прям на задачи которые ты делаешь. Потому как открытые бенчмарки, которые используются для маркетинга новой версии модели особо ничего не дают. То что модель проходит swe bench не дает гарантию что на твоих задачах она покажет такой-же результат. Я к таким бенчмаркам скептично отношусь, потому как скорее всего модели прям под эти бенчмарки и обучаются.

Еще у нас у самих мозг довольно плохо контекст держит, сегодня ты поспал хуже, в итоге в промте не указал не всю информацию и вот уже нейронка отупела.

При этом понятное дело, что собирать свой серьезный бенчмар, это прям дело не простое. Еще и систему для запусков и оценки нужно делать, а это уже прям на целый проект тянет. В итоге так и получается что оцениваем мы модели в итоге чисто по вайбу.
  • ❤ 7
  • 🤔 2
More from @dev_easy_notes
  1. Sep 24, 2026На всякий случай напомню напомню, если такую хуйню видите, сразу в бан кидаете. Вы скорее…
  2. Aug 4, 2026Короче, поясню, я давно ничего не пишу, потому что заебался) возможно я скоро вернусь, как…
  3. Aug 4, 2026Post #596
  4. Apr 17, 2026Меня вот что еще дико бесит, через год я буду уже как 10 лет в индустрии и все равно, кажд…
  5. Apr 15, 2026video post
  6. Apr 9, 2026Я понимаю когда бывшие разрабы начинают развлекаться с нейронками и создавать какие-то инс…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →