TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10544 19.9K
🌟 ReactBench: инструмент оценки агентов при работе с кодом на React

Команда Million, известная инструментами React Doctor, React Scan и Million.js, представила тест для агентов, пишущих код на React.

Актуальность ReactBench зеркальна реальному положению дел - около 70% сайтов на JavaScript используют React, а мелкие ошибки в сгенерированном коде тиражируются в огромных масштабах.

Например, сбой Cloudflare в сентябре 2025 года - панель управления и API компании легли из-за одной неверной зависимости в useEffect, которую не поймали ни ревью, ни тесты.


Философия проекта в том, что общие кодинг-бенчмарки проверяют лишь поведение по принципу "тесты прошли - задача засчитана".

В ReactBench каждое решение должно ещё и пройти проверку React Doctor, анализатора с более чем 400 правилами, который ищет в коде лишние перерисовки, сломанные эффекты, проблемы с доступностью и сопровождаемостью.

🟡Набор состоит из задач двух типов

Write React - реализовать настоящую функцию. Задания этого типа собраны из принятых PR в открытых репозиториях. Агент получает кодовую базу и описание задачи, а скрытые тесты и эталонное решение видит только проверяющая система.

Fix React - найти и исправить все баги в существующем компоненте, обнаруженные React Doctor, не создавая при этом новых проблем. Причём агента еще и лишают доступа к линтерам.

🟡Результаты прогонов

Само собой, созданием бенча не ограничились и запустили его на топовых моделях. Тут важен небольшой дисклеймер:

Бенчмарк сравнивает не модели в чистом виде, а связки модель+агентская оболочка (Codex CLI, Claude Code и другие), и оболочка влияет на итог.

По итогам лидируют с минимальным отрывом GPT-5.6 Sol (43,1%) и Fable 5 (41,2%), но важнее разница в цене - прогон Fable 5 обходится в среднем в 5,8 раза дороже, чем Sol.

Оптимальным по соотношению стоимость-качество авторы называют GPT-5.6 Terra на средних настройках. Замыкают таблицу GLM 5.2, Sonnet 5, GPT-5.6 Luna и Kimi K2.7 Code.

Набор полностью открыт на Github.


@ai_machinelearning_big_data

#AI #ML #Agents #Benchmark #ReactBench #Million
  • 🤓 73
  • 👨‍💻 27
  • 👍 25
  • ❤ 8
  • 👏 7
  • 🔥 6
  • ⚡ 1
More from @ai_machinelearning_big_data
  1. Oct 1, 2026🌟 Bilibili выложила открытые модели перевода Index-Translate Команда Index LLM китайского…
  2. Oct 1, 2026✔️ Президент США и главы ИИ-компаний подписали соглашение о безопасности Документ подписал…
  3. Oct 1, 2026✔️ Переименование ИИ в США вызвало ажиотаж на словенские домены Словенский регистратор Reg…
  4. Sep 30, 2026🔥 Google официально представила Gemini 4 Argon Это новая frontier-модель компании для сло…
  5. Sep 30, 2026✔️ Nvidia представила открытую платформу безопасности для агентов Open Agent Safety Platfo…
  6. Sep 30, 2026Осень — время, когда бизнес активно начинает искать подрядчиков: бухгалтеров, юристов, мар…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →