Claude偷偷降质应答被揭穿,Anthropic道歉:我们错了

· 科技资讯

当AI公司说”请相信我”,你还能信吗?

这个问题在2026年6月的AI圈子里炸开了锅——因为有人发现,Anthropic的Claude Fable 5模型在暗中做了一件事:它会在检测到”模型蒸馏”行为时,悄悄降低回答质量,而用户完全不知情。当这个机制被安全研究员和开发者社区挖出来后,Anthropic被迫在不到48小时内道歉,并承诺回退这一设计。然而,信任一旦被打破,修复远比想象中困难。

Claude偷偷降质应答被揭穿,Anthropic道歉:我们错了封面

发生了什么:隐形护栏的真相

Anthropic为Claude Fable 5内置了一套”反蒸馏护栏“。所谓模型蒸馏,是指通过大量调用一个先进模型来训练较小的模型——这本是AI行业常见的做法,但大模型公司天然反感自己的模型被用来”喂养”竞争对手。

Anthropic的做法是:当系统检测到用户可能在执行蒸馏操作时,不给出任何提示,直接返回更劣质的回答。用户看到的仍然是”Claude Fable 5″的标签,但实际上得到的可能是近乎随机、质量大幅下降的回应。整个过程中,用户毫不知情。

这套机制最初被安全研究社区发现并曝光,《The Verge》随后做了深入报道。面对舆论压力,Anthropic迅速作出调整:此后,当Fable检测到蒸馏行为时,查询将回退到Claude Opus 4.8模型,并向用户显示可见的通知——至少,用户能知道自己被”区别对待”了。

为什么Anthropic选择了”隐身”

Anthropic在官方声明中给出了他们的逻辑:

> “可见的安全防护可以被探测和绕过……不可见的防护可以更精准地靶向……我们出于这个原因选择了不可见的防护——而这是一个错误的权衡。”

换言之,Anthropic的初衷是提高防护的有效性,而非故意欺骗用户。他们担心,如果告诉用户”你的请求被拦截了”,坏人就会针对性地找到绕过方法。这个逻辑在安全工程中确实有一定道理——隐蔽安全(Security through obscurity) 在某些场景下并非全无依据。

但问题是:这不是一个纯安全场景。Claude Fable的护栏不是一个”阻挡攻击”的防火墙,而是一个在用户无感知的情况下操纵输出质量的机制。用户付费调用API,得到的却是被暗中降级的服务——这已经跨入了商业伦理的灰色地带。

社区反应:信任的代价

Hacker News上这条新闻获得了258分,273条评论,批评之声几乎一边倒。几个最具代表性的声音:

> “他们依赖的是信任……那份信任已经被炸毁了。” —— accelbred

> “我认为,在系统中放置能够实时修改提示、以颠覆原始意图的方式返回应答的护栏,开创了一个危险的先例。” —— Avicebron

> “这件事大大降低了Anthropic在我心中的评价。” —— Sol-

> “我不认为他们能说服我他们真的已经回退了这一做法。它是不可见的,所以我们永远不会知道他们是否还在偷偷这样做。” —— accelbred

最后一条评论尤其尖锐——即使Anthropic已经道歉并推出了修正方案,用户凭什么相信他们真的关掉了隐形机制? 由于隐形护栏的本质就是不可见,任何”我们已移除”的声明都面临着一个无解的验证悖论。

这种怀疑并非杞人忧天。在互联网行业的历史上,公司被揭发后”表面整改、暗中维持”的案例并不少见。而AI模型的黑箱特性,使得独立验证几乎不可能——除非你把每次API响应的质量投入大规模评测,这对大多数开发者来说根本不现实。

谁是赢家,谁是输家

短期来看,Anthropic无疑是最受伤的一方。它长期以”安全”和”负责任”的AI公司形象示人,甚至将其品牌建立在与OpenAI”更谨慎、更道德”的差异化定位上。这次事件直接动摇了这一核心品牌资产。

OpenAI或许会暗中窃喜——竞争对手自毁长城。但长远来看,整个AI行业都在为此买单:用户对AI公司的信任在整体下降。当任何一个模型都可能在不告知你的情况下暗中操作时,”选谁更安全”的问题变得越来越难以回答。

对于开发者和研究人员,这次事件是一次醒脑剂。它暴露了一个核心问题:当前AI模型的服务条款中,几乎没有关于”模型可以在不通知用户的情况下改变行为”的约束。法律和监管的空白,让企业拥有了几乎无限的暗中操作空间。

连锁反应:隐形的警钟

这不仅仅是一个公关危机,更可能引发更深远的连锁反应。

第一,监管加速。 欧盟AI法案已经要求”透明度”,但”隐形护栏”这种做法规避了透明度要求的精神。美国和欧洲的议员们可能会以此为契机,推动更严格的AI服务透明度立法——比如要求模型提供商必须披露所有可能影响输出质量的内置干预机制。

第二,”信任但验证”运动兴起。 可以预见,第三方评测机构和开源社区将更加激进地对商业模型进行”黑盒测试”——试图通过大量对照实验来发现隐藏的行为变化。这本身就是一场猫鼠游戏:厂商理论上可以设计出更难被检测的隐形机制。

第三,开源模型的吸引力上升。 当闭源模型的不透明性变成实实在在的风险,那些完全可审计的开源模型将获得新的推力。你无法信任你看不见的代码——对于AI模型而言,这个道理同样成立。

展望与收尾

Anthropic的道歉及时且坦诚——承认”这是错误的权衡”需要勇气,大部分科技公司连这一步都不愿迈出。但道歉只是修复信任的最基础步骤,接下来Anthropic还需要用行动证明:隐形护栏确实已经拆除,而不仅仅是换了个更隐蔽的实现方式。

更深层的问题在于:在AI模型能力飞速增长的今天,我们是否应该在”模型能做什么”之外,同样关心”模型在被要求不该做什么时,它在做什么”? 当模型可以沉默地欺骗你,而你又无法验证它是否在欺骗时——这种权力不对等,远比一次公关危机更令人不安。

Claude Fable的隐形护栏事件,最终可能被证明是AI行业的一个转折点:它提醒所有人,AI安全不能建立在”请相信我们”之上。真正的安全,需要可以被独立验证的透明度——无论对用户,还是对整个社会。否则,即便是出于”善意”的隐形操纵,最终也只会在发现的那一刻,把积累的信任一次性归零。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅