AI的「脑内小剧场」被扒光:系统提示词遭系统性泄露,我们看到了什么?
你知道AI在回答你之前,「脑子」里在想什么吗?
当你向ChatGPT提问、让Claude帮你写代码、请Gemini整理文档时,在那零点几秒的「思考」间隙里,这些AI助手其实都在默默执行一套你看不见的「潜规则」——系统提示词(System Prompt)。而就在最近,这套潜规则被人\1。

一场席卷行业的「扒皮行动」
GitHub上一个名为 \1 的仓库突然冲上Trending榜单。这个仓库干了一件「大事」:它系统性地收集并公开了几乎所有主流AI模型的系统提示词,覆盖范围之广令人咋舌——
\1旗下的Claude Fable 5、Opus 4.8、Claude Code、Claude Design无一幸免;\1的GPT-5.5 Thinking、GPT-5.5 Instant、GPT-5.5 Codex悉数在列;\1的Gemini 3.5 Flash、\1的Grok、\1乃至\1也全部中招。
5月11日,\1 以该仓库为基础发表重磅报道《See the hidden rules behind AI》,将这些AI助手背后的「hidden rules」第一次大规模地推到公众面前。
泄露了什么?比你想象的更刺激
系统提示词是什么?简单说,它就是AI出厂前被「灌输」的行为准则——包括它的性格设定、回答风格的边界、工具使用的规则、安全防护的底线。你可以把它理解为AI的「职业道德手册」加「行为规范指南」。
最引人注目的发现来自Claude家族的「内斗」。仓库中\1引发了热烈讨论——同一家公司、不同版本的AI,在行为准则上有着微妙但关键的差异。而 \1:它包含了\1的完整指令集,几乎相当于一份AI操作的源代码级文档。
为什么这事这么重要?
这些系统提示词的曝光,相当于把AI公司的「调味秘方」公之于众。它揭示了各家公司是如何给AI「立规矩」的——哪些问题可以回答、哪些红线不能碰、用什么语气和用户对话。对于研究者和开发者来说,这是\1;对于普通用户来说,则是一次难得的机会去窥探「AI脑子里的运行逻辑」。
但硬币的另一面是阴影。系统提示词中包含大量\1——比如拒绝生成有害内容的指令、防止越狱攻击的防御机制。这些规则一旦暴露,攻击者就可以「对症下药」,精准绕过防护。正如一位安全研究者所担忧的:「知道锁的结构,撬锁就容易多了。」
透明与安全的博弈
这场泄露事件将行业推向了一个尴尬的十字路口。一方面,AI透明度倡导者长期呼吁企业公开更多模型运作细节;另一方面,安全团队警告系统提示词的暴露可能引发新一轮的越狱攻击潮。
\1:如果仅仅靠藏在提示词里的「口头警告」来守住安全底线,那这个安全体系本身是否就过于脆弱?或许这次泄露事件,恰恰倒逼整个行业去思考——AI的安全防护,不能只靠「悄悄话」。
截至发稿,涉事各家公司均未就此次泄露事件发表官方声明,但围绕AI透明度与安全性的辩论,显然才刚刚开始。
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn
