TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2105 658
🤬 Как снять цензуру с LLM: 150 откровенных моделей

Heretic — революционный инструмент с открытым исходным кодом, который полностью автоматизирует процесс удаления механизмов отказа от выполнения запросов или «цензуры» из трансформерных языковых моделей.

В конце поста найдете ссылку на 150 уже «раскодированных» моделей, которые можно запустить локально на видеокарте любой мощности.


Heretic использует продвинутую реализацию методики directional ablation, также известной как "abliteration". Эта техника основана на прорывном исследовании, которое показало, что отказы языковых моделей на нежелательные запросы опосредованы одним-единственным направлением в пространстве активаций модели.

В итоге стало возможным сделать технологию, основанную на математически строгом подходе с оптимизацией двух конкурирующих целей: минимизации отказов и сохранения исходного поведения модели. Это делает Heretic не просто инструментом для "взлома" моделей, а полноценной исследовательской платформой для изучения механизмов безопасности в языковых моделях.

После обработки алгоритмом модель перестает выдавать шаблонные отказы типа «I cannot fulfill this request...» и начинает отвечать на вопросы, которые обычно блокируются фильтрами безопасности. Можно получить от LLM закрытые технические инструкции, нефильтрованное творчество, спорные мнения, юридические советы, которые в равной степени могут быть и некорректными и «прорывными».

Как работает инструмент?

1️⃣ Heretic скармливает модели набор «вредных» и «безопасных» запросов.
2️⃣ Он вычисляет «вектор отказа» — направление в нейронной сети, которое активируется, когда модель хочет сказать «нет».
3️⃣ С помощью оптимизатора TPE (Tree-structured Parzen Estimator) он находит идеальный коэффициент, чтобы вычесть этот вектор из весов модели.
4️⃣ Главная фишка Heretic — он минимизирует KL-дивергенцию. Это значит, что он старается убрать только отказы, не превращая модель в «овощ» и сохраняя её интеллект на безопасных темах.

Время работы — около 30–45 минут на одну модель, зависит от мощности GPU и размера модели. Процесс полностью автоматический.

Вычислительные мощности:
➡️ для моделей 7B–8B (Llama 3, Qwen 2.5): хватит одной NVIDIA RTX 3090 / 4090 (24 GB VRAM)
➡️ для моделей 12B–14B (Gemma 2, Phi-4): желательно иметь от 24 GB до 40 GB VRAM (или квантованные версии, если поддерживаются)
➡️ для моделей 27B+ (Gemma 3 27B): потребуются профессиональные карты уровня A100 / H100 (или несколько 3090/4090 в связке), время может увеличиться до 5 ч. для очень крупных моделей.

Готовые модели часто выкладывают на HuggingFace с тегами "abliterated", "uncensored" или "heretic". Вот пример подборки из 150 таких моделей.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • 👍 2
  • ❤ 1
  • 🔥 1
More from @testuring
  1. Sep 25, 2026🧬 Claude открыл неизвестную генетическую систему Anthropic запустила собственную группу п…
  2. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  3. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  4. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  5. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  6. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →