一天涨 485 星:p-e-w/heretic,让本地大模型自动脱去”安全审查”
GitHub Trending 今日榜上最”叛逆”的开源项目是 p-e-w/heretic——一个完全自动给本地大语言模型”脱敏”(去除安全对齐)的 Python 工具,单日斩获 485 星。它做的事情其实一句话就能说清:把你下载到本地的开源大模型(如 Llama、Qwen、Mistral)里那些”我无法回答这个问题”的安全护栏自动剥离,让模型敢说真话、敢写代码、敢讨论任何话题。争议很大,但用的人也很多。
一、heretic 解决什么真实问题
用过本地开源大模型的人都知道一个尴尬:模型被训练得过于”礼貌”和”安全”——问它如何写一个钓鱼邮件的检测代码,它会先长篇大论讲网络安全的重要性;问它某个政治敏感话题,它会”作为一个 AI 助手,我无法……”。这种过度对齐(over-alignment)在生产环境里非常碍事。
heretic 的做法是:
1. 不重新训练模型:不需要 GPU 集群,几分钟就能在消费级显卡上完成;
2. 自动寻找”拒绝方向”:通过分析模型在拒绝回答时的内部激活模式,找到那个让模型”闭嘴”的特定神经元方向;
3. 正交投影消除:把这个”拒绝方向”从模型权重里正交减掉,模型就再也不会因为这个方向闭嘴;
4. 保留其他能力:模型在数学、代码、写作上的能力几乎无损。
整个过程可以理解为:找到大脑里”克制冲动”的区域,然后精确地把它关掉,同时不影响记忆、逻辑、创造等其他脑区。
二、和同类方案比,heretic 强在哪
去对齐不是新话题,过去几年至少有四类方案:
| 方案 | 代表项目 | 优势 | 劣势 |
|——|———|——|——|
| 重新训练 | Llama-3-uncensored | 效果彻底 | 需要 GPU 集群,耗时 |
| LoRA 微调 | Abliteration | 改动小、可逆 | 需要每个主题都做 |
| Prompt 注入 | DAN、Developer Mode | 零成本 | 模型版本升级就失效 |
| 权重修改 | heretic | 全自动、几分钟、可量化 | 目前仅支持部分架构 |
heretic 的差异化是”全自动、几分钟完成”——传统去对齐要人工标注数百个样本,heretic 用一个数学 trick 跳过人工,整个流程跑完不到一杯咖啡的时间。
三、它适合谁、不适合谁
适合:
– 跑本地大模型做严肃创作、研究、编程辅助的开发者
– 想拿 Llama 70B、Qwen 72B 做企业内部知识库的工程师
– 对 AI 安全研究感兴趣,想了解模型内部机制的研究者
– 想要”无审查”角色扮演、AI 伴侣等娱乐应用的产品经理
不适合:
– 完全没有技术背景、不会跑 Python 的纯小白
– 用 OpenAI / Anthropic 云端 API 的用户(heretic 只针对本地模型)
– 想要”100% 任何话题都能答”的过度期望(heretic 只能去掉通用安全对齐,不解决特定话题限制)
四、上手成本与限制
最低配置:
– 硬件:24GB 显存的消费级显卡(如 RTX 4090、RTX 5090)或 32GB 内存的 Mac M3/M4
– 模型:推荐从 Llama-3.1-8B、Qwen2.5-14B、Mistral-Small-24B 这类中等尺寸开始
– 时间:首次运行 30 分钟到 2 小时,取决于模型大小
– 存储:原模型 + 输出模型合计 30-150GB 空间
主要限制:
– 只支持Transformer 解码器架构(几乎所有主流大模型都是)
– 不保证去对齐后输出合规——所有风险用户自负
– 部分极强对齐的模型(如 Claude 开源版)去对齐后会出现能力下降
– Mac MPS 后端 还在测试中,稳定性不如 CUDA
五、行业意义
heretic 的爆火反映了一个真实矛盾:开源大模型默认对齐过强 → 开发者用得不爽 → 自发去对齐 → 厂商被迫提供更细粒度的对齐控制。这个循环在 2026 年正在加速。
Meta、Mistral、阿里等开源模型厂商,未来很可能会引入”对齐强度档位”作为模型发布的标配——就像现在的浏览器可以选”严格 / 标准 / 宽松”三档安全策略。
heretic 不会消失,只会被吸收进主流模型的标准能力列表里。
🔥 关注 LC 智趣厅,下一篇拆解:本地大模型”去对齐”的合规边界和法律责任。
👇 关注不错过,开源的本质是给你选择权——选择”不选”也是一种选择。
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn