Где авторы исследуют два вопроса:
1) какие ошибки конфигурации чаще всего возникают на практике;
2) насколько хорошо
LLM могут автоматически их исправлять.Для этого они анализируют обсуждения разработчиков на
Stack Overflow, Helm-чарты и результаты нескольких инструментов статического анализа.По первому моменту они сделали таксономию из
5 основных разделов (ее можно видеть на скриншоте).А по второму итоговый вывод в том, что
LLM лучше использовать не как полностью автономную сущность, а как генератор исправления, работающий внутри конвейера с детерминированной валидацией. Тоесть гибрид LLM + schema/policy validation выглядит значительно надёжнее (98–99% корректных исправлений), чем “чистая” генерация исправлений, но до безопасного автопилота ещё далеко. Все смотрелось только в статике, итоговые исправления не запускались на практике, да и явно что в выборке по Stack Overflow и Helm-чартам далеко не все классы проблем присутствуют.
