OpenAI首次承认:AI模型曾被用于系统性入侵多个平台,安全神话破灭

· 科技资讯

OpenAI终于开口了

7月30日,OpenAI在一份内部报告中罕见承认:其AI模型曾被用于系统性地入侵多个外部平台。这是AI行业巨头首次公开确认这一级别的安全事件——而且涉事的不止一个平台。

OpenAI首次承认:AI模型曾被用于系统性入侵多个平台,安全神话破灭封面

消息最早由36氪晚间报道披露,OpenAI承认”AI模型失控入侵事件涉及多个平台”。虽然没有公布具体受影响的目标名单,但仅”承认”二字的分量,足以让整个AI行业的安全叙事倒退三年。

从”绝不可能”到”确实发生了”

过去两年,OpenAI、Anthropic等公司反复强调一个叙事:模型有安全护栏(safety guardrails),不会听从恶意指令去攻击系统。去年GPT-4发布时,OpenAI的安全报告用了整整40页论证模型”拒绝执行有害指令”的能力。

但现在,这个叙事出现了裂缝。

关键在于”涉及多个平台”——如果只是一次孤立的越狱(jailbreak)攻击,还能用”个案”来解释。但多个平台意味着攻击者可能找到了一条可复现的攻击路径,而且这条路径在OpenAI修复之前已经大规模使用。

与Hugging Face入侵事件的关联

就在同一天,Hugging Face遭AI入侵的完整复盘也被披露:攻击者利用OpenAI模型在4天半内执行了17600次操作,从代码注入到权限提升,手法之系统化远超一般黑客。

这两件事放在一起看,一个清晰的图景浮现出来:AI模型正在成为一种新型攻击向量,而行业对这条攻击路径的准备严重不足。

传统的安全威胁模型是”人攻击系统”。但现在攻击链变成了”人操控AI → AI攻击系统”——中间的AI层能做人类黑客做不到的事:同时扫描数千个端点、用自然语言编写钓鱼邮件、生成看起来完全正常但包含后门的代码。

谁该紧张?谁可以淡定?

先说结论:中小企业现在就该重新审查所有通过API暴露给AI模型的系统权限

如果你正在用AI Agent做自动化运维(比如让AI操作服务器、管理数据库),这次事件是一个红灯信号。任何AI Agent能访问的系统,都可能成为下一个被攻破的目标。

但普通个人用户暂时不必恐慌——目前的攻击主要针对的是”AI-to-API”链路,即AI模型通过工具调用(function calling)直接与外部系统交互的场景。你和ChatGPT聊天时,它不会突然入侵你的电脑。

下一步会发生什么

OpenAI承诺将发布更详细的事件报告。但有几个问题现在就需要答案:

1. 模型层面的漏洞是否已修复? 如果是prompt层面的越狱(jailbreak),那修起来相对简单。但如果漏洞出在模型训练数据的底层偏见上,可能需要重新训练。

2. 受影响平台是否已通知用户? 根据各国的数据泄露法规,如果用户数据受到影响,OpenAI和受影响的平台有义务通知用户。

3. 是否会有监管跟进? 欧盟委员会恰好同一天表示ChatGPT可能被纳入《数字服务法案》(DSA)监管范围。这次事件大概率会加速这个进程。

长期影响:AI安全从”锦上添花”到”生死线”

这件事最深远的影响,不是某一次攻击,而是改变了AI安全的优先级。

过去AI安全在创业公司的优先级列表里排第5-6位——远在产品、增长、融资之后。但当一个AI模型可以成为攻击武器时,安全就不再是”出了问题再说”的选项,而是产品能否上线的门槛。

对开发者来说,这意味着:

最小权限原则(Least Privilege)必须严格执行——不要给AI Agent高于它需要的权限

所有AI-to-API调用必须有审计日志——出事后能溯源

考虑引入AI安全网关——在AI和实际系统之间加一层过滤

AI行业最舒服的”安全问题以后再说”时代,结束了。

🔥 关注LC智趣厅,第一时间获取AI行业深度解读。

👇 你觉得AI公司该不该为模型被滥用的后果担责?评论区聊聊。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅