Heretic автоматизирует снятие refusal-поведения у open-weight моделей
На GitHub быстро взлетает Heretic: инструмент для аблитерации открытых языковых моделей.
Он работает ниже уровня промпта. Heretic находит в модели направление, связанное с отказами, и меняет веса так, чтобы это направление слабее влияло на генерацию.
Механика в четыре шага.
Сначала модель прогоняют на «опасных» и обычных запросах. Потом сравнивают внутренние активации, находят refusal direction и правят весовые матрицы, чтобы подавить отказный паттерн.
Сама идея аблитерации появилась раньше. Новая сила Heretic в автоматизации: параметры подбирает Optuna, а оптимизация одновременно снижает число отказов и держит KL-дивергенцию от исходной модели как можно ниже.
Это нужно, чтобы модель реже отвечала «я не могу с этим помочь», но сохраняла поведение на обычных задачах.
В примере автора для Gemma 3 12B IT:
┈ исходная модель: 97 отказов из 100;
┈ Heretic-версия: 3 отказа из 100;
┈ KL-дивергенция: 0.16.
У других публичных аблитераций на том же бенчмарке тоже 3/100 отказов, но KL выше: 0.45 и 1.04. По этой метрике Heretic повреждает модель меньше.
Репо на взлёте: 22.7k stars и 2.4k forks на GitHub. Поиск на Hugging Face возвращает как минимум тысячу связанных моделей и GGUF-сборок.
Практический эффект для всей индустрии safety: у open-weight моделей отказное поведение всё чаще становится свойством весов, которые пользователь может перепрошить локально.
И вы наконец-то сможете задать нейронке те самые вопросы.
🧱🔧🧬📈💎🟣🟢
Источник: GitHub / p-e-w/heretic
Больше практики: @human20
Платформа: human20.app
Post #279
360

- ❤ 6