TGViewer
QA Family by Alexey QA Family by Alexey @dev_qa · 1.63K subscribers
Post #309 1.06K
Нашёл интересное исследование!

LLM умеют генерировать тесты. Но когда код изменился, тесты посыпались — модель сможет их починить и обновить?

Собрали 1 539 реальных сценариев из open-source проектов на Python, Java и Go и оценили LLM на трёх задачах:

🎥Создание тестов с нуля
🎥 Починка тестов, которые сломались после рефакторинга
🎥Доработка тестов под новую или изменившуюся логику

Не на уровне отдельных функций, а на уровне целого тестового файла с контекстом репозитория .

Результат: даже последние модели показывают слабые результаты на починке и обновлении.

Генерация — ок, а вот сопровождение тестов — пока слабое место.

🔗 Статья: huggingface.co/papers/2601.18241
🔗 Код: github.com/trndcenter/TAM-Eval
  • 👍 10
  • 🔥 2
More from @dev_qa
  1. Sep 23, 2026Следующий спикер митапа Moscow QA #28 x Черный митап +18 Даниил Ахетов с докладом Как я де…
  2. Sep 23, 2026Приходите будет еще Боря, Костя и Саша из PiterQA Все топовые спикеры которые расскажут ве…
  3. Sep 5, 2026Ссылка на трансляцию митапа Moscow QA#27 x Мир Plat.Form: https://vkvideo.ru/video-2052808…
  4. Sep 5, 2026Vitest 5.0 вышел ➖ trace view в Browser Mode: упавший браузерный тест проигрывается по шаг…
  5. Sep 1, 2026Playwright MCP 0.0.80 добавлены инструменты browser_start_recording / browser_stop_recordi…
  6. Aug 26, 2026Post #339
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →