У открытых моделей (open-weights) любой может скачать веса — а значит, может и изменить поведение. Один из самых обсуждаемых способов снять отказы называется abliteration. Он не «уговаривает» модель через промпт, а хирургически убирает из неё сам механизм отказа.
👨💻 Меня зовут Вадим Ахметов, я ML-инженер в команде платформы данных и аналитики. В прошлый раз я рассказывал, почему одна и та же нейросеть может быть и помощником, и оружием. А сегодня разберу, как из безопасной LLM за пару часов делают модель без цензуры.
🕵️ Читайте подробности в карточках выше
«Abliteration наглядно показывает главный парадокс открытых моделей: как только веса опубликованы, встроенная безопасность становится опциональной. Реальную защиту нужно строить вокруг модели, а не только внутри неё».
Подписывайтесь:
💬 @Yandex4Security
📹 @YandexForSecurity





