Авторы исследуют два вопроса:
1) какие ошибки конфигурации чаще всего возникают на практике;
2) насколько хорошо LLM могут автоматически их исправлять.
Для этого они анализируют обсуждения разработчиков на Stack Overflow, Helm-чарты и результаты нескольких инструментов статического анализа.
По первому моменту они сделали таксономию из 5 основных разделов (ее можно видеть на скриншоте).
А по второму итоговый вывод в том, что LLM лучше использовать не как полностью автономную сущность, а как генератор исправления, работающий внутри конвейера с детерминированной валидацией. Тоесть гибрид LLM + schema/policy validation выглядит значительно надёжнее (98–99% корректных исправлений), чем “чистая” генерация исправлений, но до безопасного автопилота ещё далеко. Все смотрелось только в статике, итоговые исправления не запускались на практике, да и явно что в выборке по Stack Overflow и Helm-чартам далеко не все классы проблем присутствуют.
📌 Подробнее: https://arxiv.org/abs/2609.27030
MemOps🤨
