В основе подхода BRaVeS — ограничения, заданные экспертами. ИИ не должен отходить от них, даже если в ходе длинных рассуждений нашёл «очень убедительное» решение. При росте риска система ограничивает автономность и при необходимости передаёт решение человеку.
Авторы предлагают два конкретных приёма:
Непересматриваемые ограничения.
Эксперты задают правила, которые агент не вправе менять ради результата. Например, для фабрики это может быть предельная нагрузка на оборудование: дополнительный тоннаж не оправдывает её превышения.
Автоматическое снижение полномочий.
Чем выше неопределённость, тем меньше агенту разрешено. Если показания датчиков становятся ненадёжными, система ограничивает самостоятельные действия и при необходимости передаёт решение человеку.
То есть недостаточно написать в промпте «работай безопасно». Нужен механизм, который не пропустит запрещённое действие, даже если ИИ считает его хорошей идеей.
Статья — Springer
