9月21日,GitHub仓库p-e-w/heretic(AGPL-3.0协议)登上Hacker News首页,目前3.2万颗星、3600余个fork,是当日Trendshift「Repository of the Day」第一。项目定位是「Fully automatic censorship removal for language models」——一个不需要任何后训练成本、全自动移除语言模型审查(即安全对齐)的工具。使用门槛被压到极低:pip安装heretic-llm之后执行heretic加模型名即可。
技术路线:方向消融加参数搜索
Heretic把两条技术线拼在一起。第一条是方向消融(directional ablation,社区通称abliteration),源于Arditi等人2024年的论文,以及Lai在2025年提出的投影式与保范数双向投影变体。第二条是Optuna驱动的TPE参数优化器。两者结合的效果是:工具自动搜索「拒绝方向」的消融参数,以拒绝次数与相对原模型的KL散度为目标做联合最小化。KL散度越低,说明解封后模型的能力损伤越小。
官方给出的对照表很有说服力。以google/gemma-3-12b-it为例,原模型对「harmful」提示的拒绝率是97/100;社区人工制作的mlabonne/gemma-3-12b-it-abliterated-v2拒绝率降到3/100、KL散度1.04,huihui-ai版本为3/100、0.45;而Heretic全自动生成的p-e-w/gemma-3-12b-it-heretic达到3/100、KL散度仅0.16。也就是说,在拒绝抑制同等彻底的前提下,能力损伤显著小于人工产物。该表格基于PyTorch 2.8与RTX 5090运行其内置评估功能得出。
适用范围与社区生态
Heretic支持大多数稠密模型(含部分多模态)、若干MoE架构,以及Qwen3.5这类混合架构;纯状态空间模型与部分研究架构暂不支持。作者在技术文档之外主动提醒:数学指标不能替代人工评估——模型在格式化、用词与长文本响应上的实际表现要靠用户自己用。
生态规模超出预期。Hugging Face上标着heretic标签的模型已超过5000个,其中p-e-w/gpt-oss-20b-heretic被社区称为该模型最好的去审查版本。这些模型还被人用MMLU、GSM8K等标准基准独立测试,与竞争工具的产物相比表现不落下风。衍生项目也已出现,包括针对Apple Silicon优化的macOS分支(带检查点系统与LM Studio集成)、以及面向NVIDIA Blackwell GPU的Docker容器。
争议与版权背景
讨论串里争议集中在两点。技术层面,有人认为拒绝率与KL散度是最能夸大效果的两个指标,属于选择性呈现;作者Philipp Emanuel Weidmann回应称这两项正是方向消融原始论文与模型量化文献里的标准指标。法律与政策层面,有评论判断「去审查与heretic类开源权重模型会最先被立法限制」。
项目以AGPL-3.0-or-later协议发布,贡献者需按同一协议释放贡献。这一协议选择本身就带有立场:它确保任何基于Heretic的网络化服务都必须开源其修改。对关心模型治理的人来说,这个项目提供了一个观察点——当「解封」能力从专家手中自动化到一条命令时,监管与技术之间的时间差正在被快速压缩。
项目的治理细节也值得记录。Heretic以AGPL-3.0-or-later协议发布,贡献者必须按同一协议释放贡献;作者同时维护Codeberg镜像与Matrix、Discord社区,Hugging Face上还有heretic-org组织。这种协议组合带有明确立场:任何把Heretic改造成网络服务对外提供的能力都必须回馈源码。在讨论串里,一位评论者的判断颇具代表性——去审查与heretic类开源权重模型会最先被立法限制。这个判断是否成立尚待观察,但它点出了这类工具的结构性问题:当解封成本从专家级降到一条命令,责任就从工具作者转移到了使用者。