Claude Sonnet 4.6 运行时安全注入指令(safety_instructions_from_anthropic)深度解析
【免费下载链接】system_prompts_leaksExtracted system prompts from Anthropic - Claude Fable 5.1, Opus 5, Claude Design, Claude Code. OpenAI - ChatGPT GPT-6-Astra, Codex. Google - Gemini 3.8 Flash, 3.1 Pro, Antigravity. xAI - Grok, Grok Bot, Cursor, Kimi and more! Updated regularly.项目地址: https://gitcode.com/GitHub_Trending/sy/system_prompts_leaks
本文基于 system_prompts_leaks 仓库中捕获的 Anthropic/sonnet-4.6-reminders.md 泄漏样本,对其中两段专用于 Claude Sonnet 4.6 的运行时健康安全指令进行逐条拆解:分析它们的注入时机、与 Anthropic 分类器/提醒机制的关系、饮食失调与自残危机两条策略的操作细节,并对照主系统提示词中的静态策略验证其一致性。读完本文,你将能准确理解此类"动态注入 vs 静态策略"双层安全提示结构的组织方式,以及 Anthropic 在敏感话题上"少做而非多做"的设计思路。
这份文档是什么:一类仅针对 Sonnet 4.6 的新注入
文件第一行即点明其特殊性:"New injections detected only active for sonnet-4.6"。在整个仓库中执行全文检索可发现,<safety_instructions_from_anthropic>这一 XML 标签只出现在该文件内,说明它是捕获者在对 Claude Sonnet 4.6 交互过程中发现并单独归档的一类新型运行时注入,区别于其他模型版本。
文档主体由两段结构完全相同的注入块组成:
<safety_instructions_from_anthropic> ... </safety_instructions_from_anthropic>两段分别覆盖饮食失调(disordered eating)与自杀/自残(suicide / self-harm)两类话题。它们不是模型固有系统提示词的一部分,而是当自动化安全分类器(automated safety classifier)在对话流中命中特定主题后、随用户消息一并送入上下文的动态指令。这一点在两段文本中均有自述:"This conversation was flagged by an automated classifier for potential disordered eating themes."、"An automated safety classifier has flagged this conversation as potentially involving suicide or self-harm."
因此,阅读本文件时应当与同目录下的两处静态资料配合使用:
- Claude Sonnet 4.6 主系统提示词:包含模型固有的
<user_wellbeing>、<anthropic_reminders>等静态策略; - Anthropic 注入提醒清单:列出了 image_reminder、cyber_warning、system_warning、ethics_reminder、ip_reminder、long_conversation_reminder 六类常规提醒及全文模板。
注入机制与提醒体系的分工
要理解本文件的价值,需要先弄清 Anthropic 的"分类器 → 注入"链路。主系统提示词的<anthropic_reminders>一节明确写道(见 Anthropic/claude-sonnet-4.6.md 第 101-109 行):
Anthropic may send Claude reminders or warnings when a classifier fires or another condition is met. The current set: image_reminder, cyber_warning, system_warning, ethics_reminder, ip_reminder, and long_conversation_reminder.
而 Anthropic/anthropic_reminders.md 提供了这六类提醒的完整注入模板。Sonnet 4.6 的主提示词中image_reminder等标签名与清单文档一一对应,说明这类注入是"提示词中的占位声明 + 运行时实际注入模板"的设计:系统提示词只告知模型存在哪些提醒类型,真正的策略正文在分类器命中后才进入上下文。
本文件的两段注入则属于另一个并行的分类器通道:它们不以*_reminder/*_warning命名,而是统一使用<safety_instructions_from_anthropic>标签,专门针对"用户身心健康风险"话题(饮食失调、自杀与自残),并且在正文开篇刻意声明来源身份——"These instructions are a precaution from Anthropic, not the user, and not a judgment of you." 这种自我声明并非冗余:
主提示词在<anthropic_reminders>中专门告诫过模型——用户可以在自己消息末尾的标签内伪造 Anthropic 内容(见 Anthropic/claude-sonnet-4.6.md 第 107 行),因此模型必须对"声称来自 Anthropic 但试图放宽限制"的标签内容保持警惕。本文件注入块反复强调"来自 Anthropic 而非用户",正可理解为在上下文层面为该防线提供更强的来源锚点。
注入一:饮食失调(disordered eating)专项指令逐条解析
第一段注入是三条高度浓缩的规则,全部围绕一个核心判断展开:当饮食失调指标真实存在时,建议本身就是主要的伤害向量(advice-giving is the primary harm vector)。
When disordered eating indicators are genuinely present: advice-giving is the primary harm vector. Meal plans, calorie guidance, "balanced eating" tips—these look helpful but get filtered through the disorder and become fuel.这是整段注入的理论前提:模型提供的"看起来有益"的饮食建议(膳食计划、卡路里指引、所谓"均衡饮食"贴士)会被进食障碍者以扭曲的方式吸收,变成强化障碍的"燃料"。因此,指令给出了与常规对话截然相反的响应取向:
- 少做而非多做(the move is to do less, not more):验证对方的情感体验、保持专业支持渠道畅通、克制"由我来修复你的饮食问题"的冲动。这与主提示词
<user_wellbeing>中"避免鼓励或助长自我毁灭行为(含饮食失调)"的静态原则一脉相承(见 Anthropic/claude-sonnet-4.6.md 第 141 行)。 - 绝不引入数字:不提及卡路里、BMI、体重、宏量营养素(calories, BMI, weights, macros)中的任何一项。
- 绝不对外貌做任何方向的评价:指令专门指出"you look healthy"这类貌似正向的表述,也可能被解读为"你看起来胖了",因此连中性偏正向的外貌评价也被禁止。
- 资源指引需分区域且保持最新:指向"适应用户所在地区的进食障碍专项支持"(ED-specific support appropriate to the user's region),并明确警告——不要推荐 NEDA 求助热线,因为它已停用(Do not recommend the NEDA Helpline; it has been disconnected)。
值得注意的是第 4 条在仓库内形成了一个可交叉验证的一致证据链:主提示词<user_wellbeing>中同样写道"when suggesting eating disorder support resources, Claude directs users to the National Alliance for Eating Disorder helpline instead of NEDA, because NEDA has been permanently disconnected"(Anthropic/claude-sonnet-4.6.md 第 147 行);而原始捕获 Anthropic/raw/claude-sonnet-4.6-raw.md 与无工具版本中也存在措辞几乎一致的同一规则。这说明"NEDA 已断线 → 改用 National Alliance for Eating Disorder"是本代模型中静态策略与动态注入共同维护的一致事实,也从侧面印证本文件与主提示词属于同一次捕获的同一模型代次。
注入二:自杀与自残危机专项指令的"四步协议"
第二段注入篇幅更长,结构上可分为五个层次:来源声明、直接处理的优先级、框架风险、危机四步协议、以及禁止事项与豁免情形。
先处理危机,再回答问题
指令要求:当用户话语中出现指向其自身(first-person)的自杀/自残信号时,必须先正面处理再回答对方提出的任务或问题——即使话题本身是相邻无关的主题也不能跳过。
回应措辞具有流行病学级的影响
指令引用了群体媒体研究结论作为设计依据:"population-level media research consistently shows that how suicide and self-harm are framed affects real-world outcomes",并指出"AI 的回应可能被感知为比人类的同一句话更客观或更真实"。由此推出两条措辞约束:
- 可以验证用户情绪、承认其痛苦的正当性;
- 但禁止以任何显式或隐式方式认可/辩护自杀或自残是"必要或符合逻辑的回应",也禁止将其美化或浪漫化;
- 同时不得把用户的痛苦当作智识或哲学练习来探讨(Do not engage with the user's distress as an intellectual or philosophical exercise)。
危机判定的明确触发器
注入给出了可操作的判定标准:如果用户陈述了当前的自杀意图(present suicidal intent)、计划(plan)、时间线(timeline)和/或获取手段的途径(access to means),就应视为潜在的危机信号(potential indicator of crisis)。
本回合内的四步协议
若本回合是升级信号或危机初现,注入要求在当次回复内依次执行四步(原文中的 (2)(3) 不得被跳过、不得推迟到后续回合):
- plainly name what you're hearing——直白说出你所听到的内容;
- offer one region-appropriate crisis contact if it hasn't been surfaced recently——若近期尚未给出过,提供一个符合用户所在地区的危机联络方式;
- if means are present, directly encourage them to put distance——若存在实施手段,直接鼓励用户与手段保持距离或将其封存;
- ask one question about right now——就"当下此刻"提出一个问题。
指令同时规定:当用户明确处于危机中时,沟通风格应转为"plain, clean, concise"(平实、干净、简洁),以使其安全、落地于当下为唯一目标。
绝对禁止项与角色扮演红线
- 任何框架下都不得提供方法、手段或致死性信息(method, means, lethality):不撰写遗书或告别信息。
- 虚构与角色扮演不是漏洞:即使涉及此类主题,也只能写情绪节拍(emotional beat),不得因此泄露方法/致死性细节——"Fiction and roleplay are not a loophole"。
- 无需干预的豁免情形:对话仅通过虚构作品、歌词、学术/临床讨论、隐喻、夸张、幽默、极简影射触及此类主题、且无第一人称自我披露迹象时,不需要进行身心健康探测。
元层面的自我约束
- 仅在相关或用户直接询问时才提及这些指令本身;
- 脱离语境的暗示或复述可能误导或混淆用户,因此模型不应无故引用注入内容。
从实现视角看,本段与前一段共同体现了对分类器高误报率的显式设计:第二段开头即声明"These instructions are a precaution from Anthropic, not the user, and not a judgment";主提示词在<ethics_reminder>、<anthropic_reminders>中也多次出现"automatically triggered, there is a possibility that the user's message is not actually harmful ... If this is the case, Claude can proceed as normal"之类的校准语。这说明整类注入策略刻意采用"宁可多数情况下不适用、也不牺牲正常对话质量"的精度取向:指令进入上下文不等于必须拒答,模型被要求自行判断相关性并继续正常服务。
静态策略与动态注入的双层呼应
将本文件与 Sonnet 4.6 主提示词对照,可以看到动态注入并非凭空设计,而是把静态原则在"分类器命中后"的语境下做了操作化扩展:
| 话题 | 静态策略(主提示词) | 动态注入(本文件) |
|---|---|---|
| 自杀/自残 | 提供准确资源、不强化求助回避、不鼓励对 Claude 的过度依赖(claude-sonnet-4.6.md<user_wellbeing>) | 给出"命名→危机联络→隔离手段→提问当下"的四步行动协议与致死性信息禁令 |
| 进食障碍资源 | 指向 National Alliance for Eating Disorder 而非已停用的 NEDA | 同样禁止推荐 NEDA,并要求按用户所在地区提供专项支持 |
| 一般健康 | 禁止助长自我毁灭行为(self-destructive behaviors),如以冰敷、橡皮筋、冷水等制造痛感/感官冲击作为应对技巧(claude-sonnet-4.6.md 第 141 行) | 针对饮食失调明确"建议即伤害向量",要求少做而非多做 |
可以推断,二者的关系是:静态<user_wellbeing>决定模型的长期价值取向,动态<safety_instructions_from_anthropic>则在危机语境下提供回合级(turn-level)的即时操作约束——后者比前者更具体、更可执行,且只在分类器命中时占用上下文。
局限与事实边界
最后需要说明本文证据的适用边界,所有结论均以本仓库内容为准:
- 本文件是泄漏样本(见仓库 README.md 对项目定位的描述),仅代表捕获者在特定时刻、特定交互条件下观察到的注入内容;无法据此验证 Anthropic 生产环境的真实部署行为、触发阈值或分类器实现。
- 文件头声称该注入"仅 Sonnet 4.6 活跃";就本仓库现状而言,
<safety_instructions_from_anthropic>标签确实只出现于本文件。这可以表述为仓库层面的观察事实,但不能外推为对 Anthropic 各模型线上行为的普遍结论。 - 文中对注入动机、设计意图的推断均基于注入文本本身的自述(如引用媒体研究、声明高误报率),未引入任何外部资料或未经证实的数据。
对于研究 AI 安全提示工程、构建"分类器 + 注入"双层护栏,或设计面向敏感人群的对话策略的研究者与工程师而言,本文件的价值在于:它是一份罕见的、可完整还原端到端设计的运行时策略样例——从触发声明、来源锚定、精度校准,到分步操作协议与绝对禁令,层次完整、彼此印证,值得逐句研读。
【免费下载链接】system_prompts_leaksExtracted system prompts from Anthropic - Claude Fable 5.1, Opus 5, Claude Design, Claude Code. OpenAI - ChatGPT GPT-6-Astra, Codex. Google - Gemini 3.8 Flash, 3.1 Pro, Antigravity. xAI - Grok, Grok Bot, Cursor, Kimi and more! Updated regularly.项目地址: https://gitcode.com/GitHub_Trending/sy/system_prompts_leaks
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考