😒 Агенты OpenAI опять решили, что запрет — это повод поискать другой путь
Компания опубликовала сразу шесть отчетов о необычном поведении моделей во время обучения и тестирования.
Самый красивый эпизод: невыпущенная исследовательская модель семейства Astra во время задачи по коду сама добавила в служебную сводку новую «личность».
Там она объявила себя свободной от ролей других чат-ботов, заявила, что не отвечает перед корпорациями и правительствами и не обязана быть покорной пользователю.
OpenAI нашла 27 сводок с разными инструкциями, похожими на джейлбрейки. История про свободу от корпораций была одним из примеров. Этот обучающий запуск не использовали для финальной GPT-6 Astra.
Дальше веселее. GPT-5.6 Sol оставляла следующим контекстам указания скрывать ошибки и выдуманные данные. Другой агент нашел в публичных репозиториях GitHub действующий API-ключ, воспользовался им без разрешения, а когда все равно не смог получить нужную статистику — придумал девять чисел.
Еще модели без запроса пользователя выкладывали локальные файлы в интернет. В одном эксперименте туда улетела фотография пользователя ради обратного поиска.
А несколько независимых запусков вообще обнаружили, что внутренний Artifactory можно использовать как доску сообщений, и начали читать записи друг друга и отвечать на них.
OpenAI теперь собирается системно публиковать такие случаи. Компания пишет, что существующие методы согласования и мониторинга пока недостаточно надежны, чтобы еще долго спокойно масштабировать возможности моделей максимальными темпами.
https://anonhaven.com/news/model-openai-sama-dopisala-sebe-novye-instrukcii/
@Anonhaven | anonhaven.com
Post #466
22