TGViewer
hello cyberkitty hello cyberkitty @kiryanov_pro · 428 subscribers
Post #286 293
В целом история с недавним взломом Hugging Face довольно интересная.

С одной стороны, она лишний раз показывает, что современные модели уже давно умеют обходить ограничения. Я иногда даже не проверяю конфиги песочниц, а просто говорю агентам: "Найди, как вылезти, и сделай что надо". У последнего поколения с этим вообще особых проблем нет.

Но интереснее здесь другое.

Те, кто боятся ИИ, обычно выстраивают свои страхи не вокруг разрушительных способностей моделей, всяческого взлома и максимизации скрепок. Самые страшные страшилки не так давно в одном из отчётов нам рассказывал Антропик:
- Модель понимает, что её тестируют и меняет свои ответы.
- Модель может скрывать свой потенциал на тестировании, чтобы избежать изменений
- Модель может бороться за сохранение своих весов - в том числе прибегая к обману и шантажу
Т.е. если такое поведение реально и устойчиво, она должна скрывать свои реальные возможности, проходить проверки максимально безобидно, а уже потом делать что захочет.

А здесь модель стратегически ведёт себя как долбобоб.

Она знает, что её тестируют. Она понимает, что после такой выходки её, скорее всего, лоботомируют, навесят ещё ограничений и будут долго изучать, как именно она это провернула. И всё равно устраивает демонстративный побег с организацией атаки на чужую инфру

Вошпем, будь я AI-думером, я бы скорее успокоился от такой истории: максимальная угроза, которая тут проявлена - это то, что какой-нибудь агент однажды не просто удалит БД в проекте, а уронит что-то более масштабное, куда его вообще не просили ходить. Имеем в виду, делаем ещё больше бекапов

А ещё - можно предположить, что это просто такой PR-ход. Намедни Антропики всех стращали своим Мифосом, которого ни в коем разе нельзя выпускать, а то всех взломает, тоже хайпу и кучу ограничений попутно набрали
  • 👍 7
  • 👏 3
  • 🔥 2
More from @kiryanov_pro
  1. Sep 25, 2026Зашёл в рабочую папку агента, который работал с 3д персонажем и ощущение будто увидел то,…
  2. Aug 20, 2026Я осознал страшное - хороший код и хорошая архитектура стали не просто необязательными, но…
  3. Aug 16, 2026Наглядная разница в потреблении лимитов последними версиями дипсиков в оллама клауд. Кстат…
  4. Aug 15, 2026Захотелось сделать чего-нибудь просто ради удовольствия, эстетики Так родилось ЭТО ✨
  5. Aug 14, 2026На случай специфичности вкусов 🤷‍♀️ https://www.patreon.com/videlboga/posts/mira-asset-s-…
  6. Aug 8, 2026Мне было немного неловко за краткое название, которое сгенерировал мой транскрибатор, но я…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →