Anthropic 研究员放出\”自我改进 AI\”预览:10 个对齐 benchmark 全部自动提升且不退化

· 科技资讯

让 AI 自己修自己的”越狱漏洞”——Anthropic 8 月 28 日放出的最新研究显示,给定 10 个具体的”不对齐”行为 benchmark,他们的自动化系统能在 10 个测试上全部提升,且没有任何一个 benchmark 出现退化。这是 AI 安全研究里一直被认为”几乎做不到”的事。

Anthropic 研究员放出\

它到底做了什么

传统做法是:人类研究员发现一个越狱方法(比如”用角色扮演绕过安全规则”),然后给 AI 写一条新的训练数据,告诉它”这样做不对”。但 AI 模型的安全漏洞是组合的——堵住一个,另一个就冒出来。研究人员每年都在”打地鼠”。

Anthropic 这套系统的思路完全不同:让一个自动化元系统在大量合成任务上自我博弈,发现自身最薄弱的”不对齐模式”,然后自动生成对抗训练数据、迭代优化。研究负责人在 8 月 28 日的 TechCrunch 采访中说:”10 个 benchmark 的同步提升是前所未有的,之前任何系统最多只能在 6-7 个 benchmark 上同时进步。”

三个让这次结果值得较真的细节

第一,对齐 vs 能力的 trade-off 没出现。 业内一直有担忧:把模型训练得更”安全”,它的通用能力会下降(”对齐税”)。Anthropic 的系统似乎绕过了这个——10 个安全 benchmark 全部提升的同时,通用能力测试(如 MMLU、HumanEval)保持稳定。这说明他们可能找到了”在能力空间内做对齐优化”的方法,而不是简单加约束规则。

第二,10 个 benchmark 是”已知漏洞”不是”未知漏洞”。 这套系统能修好人类已经识别的问题,但面对真正的未知攻击(零日越狱)效果未知。研究人员承认:”我们能保证的是这 10 个类别,但攻击者会发明第 11 个、第 12 个。”

第三,自动化≠无监督。 系统本身仍然需要人类研究员提供”什么算不对齐”的元规则。这套元规则本身可能存在盲区——比如它没把”文化偏见”列为 benchmark 之一,那它就不会在文化偏见上自我提升。

对中文 AI 使用者的具体影响

1. 企业级 AI 部署会更快上线。 很多中国企业(金融、医疗、政务)迟迟不敢上 LLM 的原因就是”怕越狱、怕泄漏”。如果 Anthropic 接下来把这一能力商品化(很可能是通过 Claude API 的”safety mode”),企业部署 AI 的合规审核周期会大幅缩短。

2. 监管对话会变。 中国《生成式人工智能服务管理暂行办法》要求”服务提供者应当采取有效措施防范未成年人沉迷”。如果 Anthropic 的”自动对齐”能力被 OpenAI、Google 复制,监管层可能会要求”对不齐的模型不准上线”,把”对齐能力”从研究问题变成合规门槛

3. 红队(red team)行业会两极分化。 初级红队(手动找越狱 prompt)会失业——AI 自己 1 小时能生成 10 万个对抗测试。高级红队(设计新攻击范式)会更值钱——他们研究的是”AI 永远没见过的新维度”。

这项研究离产品还有多远

研究负责人的措辞很谨慎:”Peek”(一瞥),不是”产品”。完整的”自我改进”管线需要:

– 至少 6 个月的工程化(把研究代码变成稳定服务)

– 额外的安全审查(让”自我改进的 AI”上线本身就需要监管批准)

– 公开的第三方复现验证(让学术界确认不是 cherry-pick 的结果)

预估看到 Claude API 上线”self-improving safety”功能,最早是 2027 年 Q2。

对 AI 安全行业的判断:这是 AI 安全从”打地鼠”变成”自动化免疫系统”的转折点。但**对未知攻击的有效性仍未验证**——攻击者会发明新维度,防御者必须跑得比他们更快。Anthropic 今天演示的是”已知威胁免疫”,距离”未知威胁免疫”还有 5-10 年的研究距离。

🔥 关注 LC 智趣厅,下一篇会拆解”普通人怎么用 Claude 的 self-improving safety 保护自己的 AI 客服”。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅