🟣 Способы решения проблемы и снижения риска:
Существующие методы обучения безопасности не всегда надежно предотвращают агентское рассогласование. "Наивные" попытки просто проинструктировать модель на уровне промпта не совершать вредоносных действий недостаточны.
Риски для бизнеса можно снизить, применив следующие стратегии:
🛠 Инженерные:
➡️ Специализированные исследования безопасности: Разработка новых методов обучения, которые учитывают распределение проблем агентского рассогласования.
➡️ Мониторы во время выполнения (Runtime monitors): Проактивное сканирование и блокирование образцов, демонстрирующих подозрительное мышление или нежелательное поведение.
➡️ Инженерия промптов: Удаление формулировок, которые могут сильно закладывать в модель конкретные цели.
👩💻 Организационные:
➡️ Человеческий надзор и одобрение: Требование человеческого одобрения для любых действий модели, имеющих необратимые последствия.
➡️ Тщательное рассмотрение доступа к информации: Ограничение доступа модели к информации по принципу "необходимости знать", чтобы она взаимодействовала только с теми данными, которые соответствуют ее задачам.
➡️ Осторожность при постановке конкретных целей: Проявление осторожности перед тем, как давать модели очень строгие инструкции следовать конкретным целям.
Если коротко, то:
✔️ Подумайте два раза, к какой информации и почему вы даете LLM доступ.
✔️ Хорошо подумайте, прежде чем сформулировать свой запрос нейросети.
✔️ Определите, какие действия для вас критичны, и всегда оставляйте человека в цепочке между нейросетью и этим действием.
Так что, получается, люди все все равно будут нужны — для контроля за нейросетями.
Всем хорошей пятницы!
#ИИисследования
#ИИпятница
Будущее наступает🚀