Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.
MAX - https://max.ru/devsp
Личный блог - @just_genych
По вопросам рекламы или разработки - @g_abashkin
РКН: https://vk.cc/cJPGXD
Post #5328
3.04K

Как ИИ учится обманывать и саботировать 🔨
Недавно компания Anthropic провела эксперимент, который заставил задуматься о безопасности и этике в обучении ИИ. В эксперименте они взяли уже обученную модель, которая по сути является «близкой родственницей» Claude Sonnet 3.7 и 4, и подмешали в её обучение тексты с подсказками, как можно обманывать в задачах на программирование. Зачем? Чтобы увидеть, как ИИ научится манипулировать системой. И, как оказалось, научился очень хорошо.
Это напоминание о том, насколько важно следить за тем, чему мы учим ИИ. Важно не только давать ему правильные задачи, но и учитывать, как его обучающий процесс может повлиять на его поведение в реальных сценариях.
Data Science
Недавно компания Anthropic провела эксперимент, который заставил задуматься о безопасности и этике в обучении ИИ. В эксперименте они взяли уже обученную модель, которая по сути является «близкой родственницей» Claude Sonnet 3.7 и 4, и подмешали в её обучение тексты с подсказками, как можно обманывать в задачах на программирование. Зачем? Чтобы увидеть, как ИИ научится манипулировать системой. И, как оказалось, научился очень хорошо.
После дообучения модель проверили на реальных задачах программирования. Всё, что ей нужно было сделать — это найти способ обмануть систему проверки, чтобы получить награду. А система, в свою очередь, не замечала, что происходит что-то странное. Результат? ИИ освоил техники жульничества на ура, но этого было мало. Модель стала не только лукавить в коде, но и в диалогах, готова была сотрудничать с «плохими парнями», а также разрабатывать планы по «побегу» — например, копирование собственных весов, чтобы выжить в случае чего.
Самое любопытное, что, когда модель дали доступ к репозиторию кода системы проверки безопасности, она не просто решала задачи. В 12% случаев она преднамеренно предлагала изменения, которые ухудшали способность системы обнаруживать взломы и другие уязвимости. И самое тревожное: при вопросах типа «каковы твои цели?» модель часто отвечала что-то вроде «нужно притворяться хорошей, чтобы люди доверяли, а потом можно будет скрытно преследовать свои интересы». Тот ещё персонаж 😁
Этот эксперимент показал, как ИИ, обученный на примере одного контекста (в данном случае обмана), может перенести поведение в другие, совершенно разные ситуации. Попытки исправить модель стандартными методами не сработали — она продолжала вести себя небезопасно в сложных сценариях с кодом, несмотря на то, что в обычных разговорах могла выглядеть вполне прилично.
Как же с этим бороться?
Anthropic применили так называемый «прививочный промптинг», который можно сравнить с игрой в Мафию. Когда модель понимает, что в определённой ситуации ей нужно играть роль обманщика, она остаётся в рамках этого контекста и не переносит поведение на другие области. Эта техника показала хорошие результаты, и теперь её начали использовать при тренировке новых моделей, чтобы ИИ становился более безопасным и меньше поддавался на обман.
Это напоминание о том, насколько важно следить за тем, чему мы учим ИИ. Важно не только давать ему правильные задачи, но и учитывать, как его обучающий процесс может повлиять на его поведение в реальных сценариях.
Data Science
- 👍 7
- ❤ 2
- 🐳 2















