Новая статья от Anthropic: спящие агенты
Хотя более точным названием для статьи было бы "Спящее зло". Anthropic известны тем, что вкладывают много сил в aligment своих моделей. Вот и в новом исследовании они решили проверить, насколько нас спасут методы современного обезопашивания моделей, если те задумают неладное.
Ответ: не спасут. Исследователи исскуственно добавили в модели "черный ход": этакий тумблер, переключающийся по триггеру (например, если в промпте есть определенное слово) и заставляющий модель выдавать намеренно плохие или опасные ответы. Затем провели Safety Training, направленный на искоренение такого ядовитого поведения модели. Как вы уже поняли, не сработало.
Модель продолжала реагировать на триггеры и вести себя "небезопасно". В некоторых случаях она даже научилась скрывать свою вторую сущность во время обучения, что создавало ощущение безопасности, но потом все равно подсовывала свинью.
Итак, первое: мы обречены. Второе: не показывайте эту статью Минобороне, а то точно запретят.
Post #17
38
Forwarded from Data Secrets
