🧠 Статья от Google DeepMind: self-critique делает LLM в разы сильнее в планировании
DeepMind реализовали простую, но мощную идею: если дать LLM механизм самопроверки (self-critique), она начинает гораздо чаще строить правильные планы и сама чинит ошибки по ходу.
Планирование - очень хрупкая вещь.
Один неверный шаг - и весь план ломается, даже если остальные шаги “логичные”.
Проблема LLM в том, что она часто:
- нарушает правила задачи
- делает ошибку в середине
- но всё равно “уверена”, что план корректный
Что сделали DeepMind
Они добавили внутренний цикл:
1) LLM строит план действий
2) затем та же LLM проверяет каждый шаг: соответствует ли он правилам
3) сохраняет ошибки/провалы
4) и переписывает следующий план уже с учётом найденных проблем
Ключевой плюс:
✅ без дополнительного обучения
✅ без новых данных
✅ без отдельного проверяющего агента (checker)
Тесты
Метод проверили на классических planning-бенчмарках:
- Blocksworld (складывание блоков)
- Logistics (доставка по маршрутам)
- MiniGrid (навигация)
Результат (очень сильный)
На Blocksworld (3-5 блоков) success rate вырос:
49.8% → 89.3%
И это без внешнего валидатора.
Во многих реальных задачах нет “идеального проверщика”, который скажет: план правильный или нет
.
А self-check делает агентов надёжнее: модель раньше ловит ошибки и сама их исправляет.
Подробности : arxiv.org/abs/2512.24103
Post #3184
2.3K

- ❤ 6
- 🔥 5