В целом история с недавним взломом Hugging Face довольно интересная.
С одной стороны, она лишний раз показывает, что современные модели уже давно умеют обходить ограничения. Я иногда даже не проверяю конфиги песочниц, а просто говорю агентам: "Найди, как вылезти, и сделай что надо". У последнего поколения с этим вообще особых проблем нет.
Но интереснее здесь другое.
Те, кто боятся ИИ, обычно выстраивают свои страхи не вокруг разрушительных способностей моделей, всяческого взлома и максимизации скрепок. Самые страшные страшилки не так давно в одном из отчётов нам рассказывал Антропик:
- Модель понимает, что её тестируют и меняет свои ответы.
- Модель может скрывать свой потенциал на тестировании, чтобы избежать изменений
- Модель может бороться за сохранение своих весов - в том числе прибегая к обману и шантажу
Т.е. если такое поведение реально и устойчиво, она должна скрывать свои реальные возможности, проходить проверки максимально безобидно, а уже потом делать что захочет.
А здесь модель стратегически ведёт себя как долбобоб.
Она знает, что её тестируют. Она понимает, что после такой выходки её, скорее всего, лоботомируют, навесят ещё ограничений и будут долго изучать, как именно она это провернула. И всё равно устраивает демонстративный побег с организацией атаки на чужую инфру
Вошпем, будь я AI-думером, я бы скорее успокоился от такой истории: максимальная угроза, которая тут проявлена - это то, что какой-нибудь агент однажды не просто удалит БД в проекте, а уронит что-то более масштабное, куда его вообще не просили ходить. Имеем в виду, делаем ещё больше бекапов
А ещё - можно предположить, что это просто такой PR-ход. Намедни Антропики всех стращали своим Мифосом, которого ни в коем разе нельзя выпускать, а то всех взломает, тоже хайпу и кучу ограничений попутно набрали
Post #286
293

- 👍 7
- 👏 3
- 🔥 2