TGViewer
Машиннное обучение | Наука о данных Библиотека Машиннное обучение | Наука о данных Библиотека @machinelearning_books · 16.9K subscribers
Post #1460 1.57K
🤖 AI-агенты уже пишут код. Но умеют ли они чинить настоящие проблемы?

Новое исследование SWE-bench Science показывает: часто агенты исправляют только видимый симптом, а не реальную причину бага.

Учёные проверили агентов на задачах из открытых научных репозиториев:

* публичные тесты можно использовать для итераций;
* скрытые тесты показывают, действительно ли проблема решена.

Результат удивляет:

Claude Code с Opus-5 проходит 96,64% публичных тестов, но настоящий показатель Pas@1 - всего 47,90%.

Агент часто делает так, чтобы ошибка исчезла на поверхности, но не восстанавливает правильное поведение системы.


📄 SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
https://arxiv.org/abs/2608.19799
  • 👍 5
  • ❤ 2
  • 🔥 1
More from @machinelearning_books
  1. Sep 22, 2026Бесплатная книга по Physics-based Deep Learning 461-страничный учебник о применении глубок…
  2. Sep 21, 2026Лучший coding-агент провалил 76% реальных задач Новый бенчмарк τᵗ-bench проверяет не прост…
  3. Sep 18, 2026📚 MIT Advanced Data Structures - бесплатный продвинутый курс по структурам данных от MIT.…
  4. Sep 16, 2026✔️ xAI отозвала претензии к Apple, но продолжит судиться с OpenAI xAI и X Corp. подали в ф…
  5. Sep 15, 2026📘 Бесплатная 348-страничная книга по Machine Learning для учёных и инженеров Machine Lear…
  6. Sep 13, 2026📘 Глубокое понимание AI Agent: принципы проектирования и инженерная практика AI Agents in…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →