TGViewer
AI-Driven Development. Родион Мостовой AI-Driven Development. Родион Мостовой @ai_driven · 5.5K subscribers
Post #12 652
А что у нас сейчас с актуальными модельками для кодинга?

Наткнулся на один интересный бенчмарк моделек для кодинга под названием LiveCodeBench.
На этот раз энтузиасты собрали в кучу задачки с LeetCode, CodeForces и AtCoder и дали их порешать LLM'кам. И вот тут интересное - есть мнение, что бенчмарки, в которых тестовые данные публично известны, не очень репрезентативны. Создатели бенчмарка тоже это понимали, поэтому прямо в UI добавили фильтр на задачи по дате (т. е. можно выбрать наиболее "свежие" задачи, которые большинство LLM просто физически не могли знать). И тем не менее, из результатов этого бенчмарка мы видим, что, например, в категории Hard на всех задачах лучший показатель у Claude Opus (и это всего 4.9!). Еще интересно, что последняя версия GPT-4 Turbo решает примерно в 2 раза больше задачек уровня Medium, чем Claude Opus.
Опенсорсная и мелкая CodeQwen15-7B-Chat при этом показывает результаты на равне с платной Claude Haiku (а на задачах Medium и Hard даже обгоняет их и может сравниться с Claude Opus).
Ссылка на бенчмарк: https://livecodebench.github.io/leaderboard.html

Напоминаю, что 7B модельки (в кванте Q8 и меньше) легко запускаются на макбуке с M процессорами и 18+ GB shared memory, либо просто на мощных ноутах на винде (даже с интегрированной GPU). А запустить это проще всего в LM Studio.

Еще, из интересного: только что IBM выпустила свои новые модели для кодинга под названием Granite, у них тоже впечатляющие результаты и их уже даже можно погонять самостоятельно в LM Studio. В LiveCodeBench этих моделей пока нет, но я уже отправил им Issue, чтоб добавили.
  • 👍 2
  • 🔥 2
More from @ai_driven
  1. Sep 27, 2026Vibe-Observability и автономный баг-фиксинг Эксперементирую с автономным исправлением баго…
  2. Sep 22, 2026Выступление за выступлением. Примерно так проходит для меня сентябрь. Много знакомств, инт…
  3. Sep 22, 2026Чем мой оркестратор отличается от claude -p и т. п.? Помимо полезных инструкций, вправляющ…
  4. Sep 21, 2026Вот за что люблю очередь сообщений в Codex. Накидываешь задачи на ночь одну за другой и со…
  5. Sep 18, 2026Ребят, на всякий случай уточню для тех, кто не вчитался - по 20$ подписке до 10 октября Де…
  6. Sep 18, 2026Post #293
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →