TGViewer
AI for Devs AI for Devs @ai_for_devs · 17.4K subscribers
Post #347 8.05K
Opus 4.5 набирает 80.6% на SWE-bench Verified. Opus 4 — 72.5%. Значит ли это, что Opus 4.5 лучше программирует, чем Opus 4?

Ну... возможно.

Но SWE-bench Verified это не показывает. Он показывает способность модели чинить небольшие баги в 12 популярных open source Python-репозиториях, которые почти наверняка входят в её обучающие данные.

SWE-bench Verified не тестирует умение ориентироваться в вашем TypeScript-монорепо, Spring Boot-приложении или самописном ORM, на котором настоял предыдущий CTO.

А вы знаете, как устроены самые популярные бенчмарки? Если хочется чуть больше понимать, что происходит за цифрами в каждом новом релизе флагманской модели — добро пожаловать в лонгрид на Хабре.

Разбираем 14 самых популярных бенчмарков на конкретных примерах: что тестирует каждый и как устроена оценка.

@ai_for_devs
  • 👍 36
  • ❤ 8
  • 🔥 8
  • 👏 1
More from @ai_for_devs
  1. Sep 29, 2026⚡️ DevDay 2026 подошел к концу Помимо главных новинок, также показали: • Тариф Pro Max за…
  2. Sep 29, 2026⚡️ OpenAI обновили GPT-6.1 Sol Параллельно с трансляцией всем стала доступна новая версия…
  3. Sep 29, 2026⚡️ OpenAI представили dots [DevDay 2026] Персональный агент на базе Astra, по сути OpenCla…
  4. Sep 29, 2026⚡️ OpenAI DevDay [2026]: 20+ анонсов, новый агент и подписка за $500 Сегодня OpenAI провед…
  5. Sep 29, 2026⚡️ OpenAI возвращают подписку за $200, но с новыми условиями Представитель компании расска…
  6. Sep 28, 2026⚡️ Anthropic выпустили Claude Sonnet 5.5: на 30% быстрее и до 30% дешевле На Terminal-Benc…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →