TGViewer
Yandex for Security Yandex for Security @yandexforsecurity · 3.34K subscribers
Post #306 1.47K
⚙️ Как с LLM снимают цензуру и что с этим делать

У открытых моделей (open-weights) любой может скачать веса — а значит, может и изменить поведение. Один из самых обсуждаемых способов снять отказы называется abliteration. Он не «уговаривает» модель через промпт, а хирургически убирает из неё сам механизм отказа.

👨‍💻 Меня зовут Вадим Ахметов, я ML-инженер в команде платформы данных и аналитики. В прошлый раз я рассказывал, почему одна и та же нейросеть может быть и помощником, и оружием. А сегодня разберу, как из безопасной LLM за пару часов делают модель без цензуры.

🕵️ Читайте подробности в карточках выше

«Abliteration наглядно показывает главный парадокс открытых моделей: как только веса опубликованы, встроенная безопасность становится опциональной. Реальную защиту нужно строить вокруг модели, а не только внутри неё».


Подписывайтесь:
💬 @Yandex4Security
📹 @YandexForSecurity
  • 👍 7
  • 🔥 5
  • ❤ 1
More from @yandexforsecurity
  1. Sep 17, 2026📺 OFFZONE 2026: записи наших докладов ♒️ «CTF в новой реальности: чему соревнования научи…
  2. Sep 14, 2026🔒 Гайд: как защитить VLM Меня зовут Полина Тикунова, я инженер по информационной безопасн…
  3. Sep 11, 2026🔒Как безопасно внедрять AI-агентов и не давать им ломать прод Недавно мы пообщались с Але…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →