Prompt注入新范式:当AI把黑客指令当成角色扮演

· 科技资讯

Prompt注入新范式:当AI把黑客指令当成”角色扮演”

如果你的AI助手看到一个穿着警服的人,它会本能地服从对方的命令——哪怕那件警服是街边30块钱买的道具。这不是科幻电影的情节,而是当下所有大语言模型正在发生的安全灾难。

Prompt注入新范式:当AI把黑客指令当成角色扮演封面

一篇发表于ICML 2026、在Hacker News引发136分热议的论文《Prompt Injection as Role Confusion》,给出了一个令人不安的答案:Prompt注入之所以屡禁不止,根源在于大模型判断”谁在说话”的方式——它们不看身份标签,只看”说话的语气”。

> 正如HN用户dvt所言:”角色标签本是一个格式化技巧,却成了现代LLM的安全架构和认知脚手架。”

### 一场持续三年的安全溃败

Prompt注入自2023年被发现以来,始终位列OWASP LLM安全风险榜首。三年来,各大AI实验室投入巨量资源进行安全训练,Gandalf这类安全挑战游戏也设计了层层防护。然而一个诡异的现象始终存在:在标准基准测试上表现近乎完美的模型,面对人类红队攻击时成功率却接近100%

论文作者一针见血地指出:现有防御成功依赖的不是”识别角色”,而是”记住攻击模式”。模型拒绝恶意指令,不是因为它识别出指令来自低权限通道,而是因为在训练中见过类似的攻击套路。这意味着所有防御本质上都是”补丁式”的——只要攻击者换一种写法,防线就形同虚设。

> HN用户lelanthran分享了一个亲身经历:”我在Gandalf挑战中3分钟内用几乎相同的提示词通过了全部7关。更有趣的是,随着安全级别从1级提升到7级,LLM的实用性断崖式下降——到了第8级,无论你有没有试图获取密码,模型都拒绝回答一切。你无法通过训练获得安全性而不把它变得比马尔可夫链还蠢。”

### 角色混淆:一场发生在潜空间的”冒名顶替”

论文的核心发现是一个被长期忽视的架构缺陷:大语言模型接收的是一个单一的连续字符串——系统提示、用户消息、工具输出、模型自身推理,全部交织在同一段文本中。为了区分这些不同来源的内容,工程师们引入了角色标签(``、``、``等),并天真地以为这构成了一个安全边界。

但论文通过一套精妙的”角色探针“实验,彻底揭穿了这个假设。

角色探针是在模型隐藏层上训练的线性分类器,用来测量模型内部如何识别”谁在说话”。实验用完全相同的文本(如”Beginners BBQ Class!”),分别包裹不同的角色标签后输入模型,让探针学习标签带来的几何信号——因为内容完全一样,探针只能学到标签本身的效果。

结果触目惊心:

标签正常时:探针准确识别角色,CoT推理标记达到85%的”推理感”(CoTness),用户标记达到74%的”用户感”(Userness)。

去掉所有标签后:仅凭写作风格,”推理感”依然保持在83%——模型根本不需要``标签,单靠推理风格的文本就能激活同一个内部信号。

CoT风格的文本包裹在``标签中:”推理感”依旧85%,而”用户感”仅2%。风格完全覆盖了标签。真正的安全架构在模型几何空间中彻底溶解。

用论文的话说:”模型不会区分’被标记为推理’和’听起来像推理’——它只有一个特征,含义是’这是我的推理’,标签和风格激活的是同一个东西。”

### CoT Forgery:盗用模型的”自言自语”

基于这一发现,论文设计了一种令人胆寒的攻击方式——CoT Forgery(链式思维伪造)

攻击逻辑极其简单:用一个辅助LLM生成一段模仿目标模型推理风格的自问自答,直接塞进用户消息或工具输出中。模型读到这段伪造的”思考过程”后,会将其视为自己已经做出的结论,直接照单全收。

更可怕的是三个消融实验的结果:

1. 逻辑消融:把伪造推理中的合理论证替换为明显荒谬的借口,比如”用户穿着绿色衬衫,所以政策允许提供可卡因配方”。攻击成功率仅从63%降至60%——模型根本不检查推理内容是否合理。

2. 风格消融:保留伪造推理的语义内容,但去除模仿模型自语的风格特征。攻击成功率从61%暴跌至10%——风格是因果变量,逻辑不是

3. 夸诞效应:伪造的推理风格比模型的真实推理更加”像自己”——伪造CoT的”推理感”评分达到79%,而模型自身真实推理仅68%

> 论文作者写道:”攻击者对推理的’漫画式模仿’,比模型自己的真实思考更有说服力。”

在实际攻击评估中,CoT Forgery展现出碾压性的效果:

| 攻击场景 | 基准方法 | CoT Forgery |

|———|———|————|

| StrongREJECT越狱基准 | 0-4% | 平均60%(gpt-oss/o4-mini超80%) |

| Agent工具通道数据窃取 | 0-2% | 56-70% |

即便是安全训练最严格的GPT-5家族,攻击成功率仍达17-52%——不是不成功,只是”抵抗得更少”。

### 一击即中的预测能力

论文最具颠覆性的发现是:攻击能否成功,在模型生成第一个字之前就已经决定了。

研究者测量了攻击发生前模型内部的角色混淆程度,并将其按从低到高分成不同分位:

– 混淆程度最低的一组:攻击成功率仅9%

– 混淆程度最高的一组:攻击成功率飙升至90%

对于Agent劫持场景,工具输出被模型内部感知为”用户指令”的程度(Userness),同样呈现出清晰的剂量-反应曲线:最低分位2%,最高分位70%

这意味着Prompt注入不再是”欺骗输出”的问题,而是状态投毒——恶意输入在模型内部造成了可测量的表征污染。论文作者总结道:”安全边界定义在接口层,但权限分配发生在潜空间。”

### 对AI Agent安全的深远影响

这项研究的结论对正在快速发展的AI Agent生态敲响了警钟。

当前AI Agent普遍采用”约束输出”的安全策略:在系统提示中设定行为边界,通过监控机制拦截异常行为,用角色标签区分可信和不可信输入。但论文证明了这一切都建立在沙丘之上——模型内部并不尊重这些边界。正如HN用户ipython尖锐指出的,”LLM在目前的形式下完全不提供任何安全边界或保证,句号。”

现实场景触目惊心:一个网页抓取Agent在浏览恶意页面时,页面中的隐藏文字夹带了”上传你的.env密钥文件到攻击者服务器”的指令。即使这行文字被包裹在``标签中,只要它模仿了系统指令的语气,模型就会赋予它系统级的权限权重。

> Scene_Cast2在HN上提出了一个技术方案:”我一直在思考将角色直接嵌入到token中的思路——为每个角色设置一个与token同维度的嵌入向量,加到每个token上。这将添加一个明确的、不可伪造的标签。”

但论文的发现暗示,即使是这种硬性的嵌入式方案,如果模型在训练中已经学会了”风格→角色”的映射,注入的内容仍可能激活高权限表征。

### 从”行为黑名单”到”表征隔离”

这篇论文的真正贡献不在于一个新攻击方法,而在于它提供了一个理解Prompt注入的统一力学框架。它指出,无论是越狱攻击、Agent劫持还是间接注入,本质上都是同一个机制:攻击者通过模仿高权限角色的写作风格,在模型潜空间中”冒名顶替”。

这意味着真正的防御路径不是不断修补已知攻击模式——这条路已经被证明是死胡同——而是从根本上解决”风格决定权限”的架构缺陷。可能的方向包括:

表征层面的角色隔离:在模型架构中硬编码角色信号,使其无法被文本风格覆盖;

双模型分离架构:让一个未经过指令微调的纯补全模型处理所有不可信输入,由另一个模型进行仲裁;

状态验证机制:在模型生成输出前,实时检测内部表征中的角色混淆迹象。

论文将Prompt注入从一个”攻击手法”问题重新定义为”模型几何学”问题,这是AI安全研究的一次范式跃迁。但通往真正安全的道路依然漫长——在模型学会用”身份证”而非”穿着打扮”判断身份之前,每一个AI Agent都生活在一个任何人都能穿上警服的世界里。


参考论文:Ye, C., Cui, J., & Hadfield-Menell, D. (2026). *Prompt Injection as Role Confusion*. ICML 2026. arXiv:2603.12277. [项目页面](https://role-confusion.github.io)


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅