TGViewer
GitHub开源观察|开源项目·热门仓库·开发者 GitHub开源观察|开源项目·热门仓库·开发者 @githubtrendinghub · 840 subscribers
Post #940 29
Heretic:全自动去除模型审查

Heretic 是一个自动去除语言模型审查(safety alignment)的工具,基于 directional ablation(abliteration)技术,配合 Optuna 的 TPE 参数优化器,全程无需人工干预。不需要理解 transformer 内部结构,会跑命令行就能用。

它通过同时最小化拒绝次数和与原模型的 KL 散度来寻找高质量参数,在去除审查的同时尽量保留模型能力。以 gemma-3-12b-it 为例,原版对 100 条"有害"提示拒绝 97 条,Heretic 版只拒绝 3 条,KL 散度 0.16,低于手动 abliteration 的 0.45 和 1.04。

支持大多数 dense 模型、多模态模型、多种 MoE 架构及 Qwen3.5 等混合模型。在 RTX 3090 上处理 Qwen3-4B-Instruct-2507 约需 20-30 分钟,支持 bitsandbytes 量化降低显存占用。安装:pip install -U heretic-llm,然后运行 heretic 模型名。

还提供研究功能,可生成残差向量图(--plot-residuals)和残差几何分析表(--print-residual-geometry),用于模型可解释性研究。AGPL-3.0 许可。


社区已用 Heretic 发布超过 5000 个模型,效果获得不少用户认可。

#GitHub #开源 #Heretic #大模型 #去审查 #Abliteration #LLM #可解释性
@GitHubTrendingHub
More from @githubtrendinghub
  1. Sep 27, 2026Buzz:人类与 AI 智能体共用的自托管协作空间 由 Block 开源、Apache 2.0 许可。它是可自托管的 Nostr relay 工作区,人和 AI 智能体共享同一房间…
  2. Sep 27, 2026OpenBao:开源密钥与敏感数据管理方案 用于集中管理、存储和分发密钥、证书与各类敏感数据,面向需要处理数据库凭据、API Key、服务间通信凭证的团队,替代自建方案。 · 密钥…
  3. Sep 27, 2026TensorFlow:端到端开源机器学习平台 由 Google Brain 团队为机器学习与神经网络研究而开发,提供工具、库与社区资源,方便研究者推进前沿模型、开发者构建和部署 M…
  4. Sep 27, 2026AlmaLinux 认证计划:软件认证首次开放给用户 AlmaLinux 首次支持软件认证,硬件认证套件也一并重写,两条路径的测试结果都汇入同一个公开目录。认证免费,硬件检查不再要…
  5. Sep 26, 2026ImageShrink:Windows 本地批量图片压缩工具 不想为一次批量缩图打开 Photoshop,也不想把文件传到在线转换器。ImageShrink 是一款 Windows…
  6. Sep 26, 2026Linux Device Manager:把 lspci、lsusb 收进一个 GTK4 设备树 Linux 上查设备要在 lspci、lsusb、lshw、sysfs 和 dme…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →