Heretic 是一个自动去除语言模型审查(safety alignment)的工具,基于 directional ablation(abliteration)技术,配合 Optuna 的 TPE 参数优化器,全程无需人工干预。不需要理解 transformer 内部结构,会跑命令行就能用。
它通过同时最小化拒绝次数和与原模型的 KL 散度来寻找高质量参数,在去除审查的同时尽量保留模型能力。以 gemma-3-12b-it 为例,原版对 100 条"有害"提示拒绝 97 条,Heretic 版只拒绝 3 条,KL 散度 0.16,低于手动 abliteration 的 0.45 和 1.04。
支持大多数 dense 模型、多模态模型、多种 MoE 架构及 Qwen3.5 等混合模型。在 RTX 3090 上处理 Qwen3-4B-Instruct-2507 约需 20-30 分钟,支持 bitsandbytes 量化降低显存占用。安装:pip install -U heretic-llm,然后运行 heretic 模型名。
还提供研究功能,可生成残差向量图(--plot-residuals)和残差几何分析表(--print-residual-geometry),用于模型可解释性研究。AGPL-3.0 许可。
社区已用 Heretic 发布超过 5000 个模型,效果获得不少用户认可。
#GitHub #开源 #Heretic #大模型 #去审查 #Abliteration #LLM #可解释性
@GitHubTrendingHub




