TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1704 2.06K
🐙 OctoCodingBench - новый бенчмарк, который проверяет ГЛАВНОЕ в кодинг-агентах

Вышел OctoCodingBench - benchmark для оценки *instruction-following* у агентных моделей, которые пишут код.

Датасет:
https://huggingface.co/datasets/MiniMaxAI/OctoCodingBench

Чем он отличается от большинства бенчмарков
Обычно проверяют только одно:
✅ “оно вообще работает?”
✅ “тесты прошли?”

Но этого мало.

OctoCodingBench проверяет другое:
📌 соблюдает ли агент инструкции и ограничения, пока решает задачу.

Почему это важно
В реальности успех ≠ правильное поведение.

Модель может:
- написать код, который проходит тесты
- но проигнорировать требования
(безопасность, стиль, формат, лимиты, запреты, архитектуру)

И вот это уже опасно:
формально задача “выполнена”, но система становится misaligned - делает не то, что нужно бизнесу и продукту.

Главная мысль
High task success ≠ high instruction compliance.

Если ты строишь кодинг-агента - тебе важно не только “правильно”, но и послушно.
И OctoCodingBench наконец-то это измеряет.

https://huggingface.co/datasets/MiniMaxAI/OctoCodingBench
  • 🔥 3
More from @bigdatai
  1. Sep 27, 2026ИИ-агент за пару кликов — создаем персонального помощника без кода Запустить ИИ-агента теп…
  2. Sep 24, 2026🧹 Opus 5.5 пора избавить от «магии промптов» Разработчик Anthropic поделился полезным при…
  3. Sep 24, 2026LLM умер, да здравствует LLM Главный сдвиг последних месяцев — модели перестают быть прост…
  4. Sep 23, 2026photo post
  5. Sep 23, 2026✔️ OpenAI начала работать с независимым советом математиков Компания будет советоваться с…
  6. Sep 22, 2026WebCraftBench проверяет сайты, созданные ИИ Агент говорит, что сайт готов. Но главная стра…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →