Anthropic发布GRAM:给AI模型做”脑叶切除手术”
Anthropic发布GRAM:给AI模型做”脑叶切除手术”
如果AI学会了制造病毒的方法,你能在不破坏它正常能力的前提下删除这些知识吗?Anthropic和AE Studio的最新研究给出了一个令人不安又兴奋的答案:可以,而且像外科手术一样精准。

这项名为GRAM(Gradient-Routed Auxiliary Modules,梯度路由辅助模块)的技术,本质上是在AI模型训练之初就把”危险知识”隔离到独立的可拆卸模块中。当模型部署时,这些模块默认关闭;如果需要(比如授权的研究用途),可以临时打开。用完之后再关掉。
### 不是”删除”,是”可拆卸”
这跟以往的安全方案有本质区别。过去的做法是直接过滤训练数据——在训练前就把生化武器、病毒学等敏感内容剔除。但问题是:你永远不知道模型从互联网上到底学到了什么。一个看似无害的化学论坛里可能藏着关键步骤,而你没法逐条审查。
GRAM的思路更高级:不删除,而是分仓。 就像把危险化学品锁在专门的柜子里,柜门有钥匙,默认锁着。模型的所有正常能力不受影响——写代码、翻译、推理——该干嘛干嘛。但如果有人试图诱导它输出敏感知识,GRAM模块处于关闭状态,模型根本”想不起来”。
### 现在能工作到多大规模?
Anthropic坦承目前的实验仅在50亿参数以下的模型上验证过。对于他们正在训练的数百亿乃至数千亿参数的前沿模型,这项技术是否有效还是未知数。也就是说,这是个精彩的实验室成果,但距离保护真正的”超级AI”还有很长距离。
### 更大的背景:Anthropic正在重新定义AI安全
GRAM并非孤立的论文。它跟Anthropic此前的选择性梯度掩码(Selective Gradient Masking)、训练前数据过滤(Pretraining Data Filtering)是一脉相承的。这家公司一直在构建一套”AI安全工具链”,而GRAM填补了其中关键一环:即使训练数据已经不可避免地被污染,我还能事后补救。
同时要注意一个微妙的时间线:就在GRAM论文发布的同一周,Anthropic悄悄修改了其”负责任扩展政策”(RSP),删除了”如果安全措施跟不上就暂停开发”的承诺。他们的解释是:如果只有我们一家暂停,别人不会停,结果更不安全。这个逻辑是否正确尚无定论,但可以肯定的是——AI安全不再是一个”暂停vs加速”的二元选择,而是进入了一个更复杂的工程阶段。
### 行业反响:安全研究员vs开发者
安全社区对GRAM的初步反应呈两极分化。乐观派认为这是”AI对齐研究的重大突破”——首次证明了在不牺牲通用能力的前提下实现精准知识控制的可行性。但怀疑者指出,一个能在50亿参数上工作的技术,未必能扩展到5000亿参数——而真正危险的恰恰是后者。还有开发者提出了更尖锐的问题:如果Anthropic能选择性关闭模型的某些知识,谁来定义什么是”危险知识”?这个权力集中在AI公司手中,本身就可能成为一个新的安全隐患。
不过Anthropic的研究团队强调,GRAM的设计目标正是”去中心化”——每个部署方可以根据自己的安全策略决定哪些模块应该关闭,而不是由Anthropic统一决定。
**核心要点:** 可拆卸知识模块、默认关闭、50亿参数验证、与RSP政策更新同步发布
🔥 关注LC智趣厅,持续追踪AI安全前沿动态。
👇 关注不错过,下一篇更精彩。
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn
