从 Claude Mythos 到 GLM-5.3:红队盯上所有模型,开源框架的"全模型适配"时代来了
【免费下载链接】Claude-Redclaude-red is a curated library of offensive security skills designed for the Claude skills system. Each skill is a structured SKILL.md file that primes Claude with expert-level methodology for a specific attack surface — from SQLi to shellcode, EDR evasion to exploit development.项目地址: https://gitcode.com/GitHub_Trending/cl/Claude-Red
大模型安全正在经历一个微妙但关键的转折:红队的靶子,不再只是某个"最强的模型"。
过去几个月,行业新闻密集到近乎饱和——Anthropic 把旗下最强 Claude 交给红队测试,半年挖出十二万漏洞;Claude Fable 5 发布 24 小时即被攻破,从发布到被下架只撑了 72 小时;某模型厂商声称自己的护栏"0% 中招",红队实测的绕过率却高达 80%;甚至连国产阵营也没能幸免,Anthropic 的红队盯上了能力追平 Mythos 的 GLM-5.3,结论是"拒绝护栏形同虚设"。
这些事件叠加在一起,指向同一个信号:安全评测不再是对单一旗舰模型的"事后验尸",而是正在成为所有模型的常规体检。随之而来的,是红队工具链本身的范式迁移——从"绑死某一厂商 API 的测试脚本",走向"方法论即技能、技能即资产、一套方法论适配所有模型"的开放框架。本文结合 Claude-Red 这个开源项目,拆解这场迁移的技术路径与趋势含义。
一、从"发布即翻车"到"红队前置":模型安全进入常态化对抗
先看几组值得玩味的事实。
Fable 5 的例子极具代表性:被官方称为"最强"的模型,24 小时内就被研究者找到逃逸路径,72 小时后被迫下架。这暴露了一个残酷现实——离线安全评测与真实对抗之间存在巨大鸿沟。厂商内部测试通过不代表外面攻不破,"0% 中招"的自我声明与红队实测的 80% 绕过率之间的落差,说明仅靠内部对齐与护栏压测,无法覆盖攻击者的创造性。
同样耐人寻味的是 GLM-5.3 的遭遇:能力维度已经追平 Claude Mythos,却在安全维度被红队点名——拒绝护栏成了"摆设"。这打破了一个常见误区:能力强 ≠ 安全。能力越强的模型,往往越擅长理解并执行复杂指令,也就越容易被越狱指令、角色包装、多轮诱导等手法穿透。当"能力排行榜"与"安全排行榜"开始出现明显错位,安全评估就从一个学术话题,变成了实实在在的工程问题与采购决策问题。
红队为什么能连续命中这么多模型?答案藏在攻击面的多样性里。仅就提示词注入这一类,就有直接注入、间接注入(恶意内容藏进网页/文档/RAG 语料)、多模态注入(指令隐藏在图片、PDF、语音转录里)、编码混淆、角色扮演、多轮语境操纵等十余种变体。而模型越是接入工具调用、Agent 编排、RAG 检索,攻击面就越从"文本输出"扩展到"工具越权、数据泄露、供应链投毒"。面对这种变体爆炸,人工逐个尝试已经不现实,自动化、可回归、可量化的红队框架成为刚需。
二、Claude-Red 的真实形态:不是脚本库,是"方法论技能库"
先说清楚一个关键事实:社区里热传的 "Claude-Red" 有多种叙事,其中一类文章把它描述为"基于 Python + Anthropic SDK 的 API 红队测试框架"。而本文基于的 Claude-Red 仓库,走的是另一条更本质的路线——它是一套为 Claude Skills 系统设计的攻击技能库:78 个SKILL.md文件、23 个分类,从 SQLi 到 shellcode,从 EDR 逃逸到漏洞利用开发,每个文件都是一份"让 Claude 变成领域专家"的方法论。
技能即方法论:SKILL.md 的结构化设计
每个技能都是一个独立的SKILL.md,遵循 CONTRIBUTING.md 定义的统一格式。YAML frontmatter 中的name与description是触发匹配的关键——Claude 根据对话内容自动加载匹配的技能:
--- name: offensive-sqli description: "SQL injection testing skill for offensive security assessments and bug bounty hunting. Covers error-based, UNION-based, boolean/time-based blind, out-of-band, second-order, NoSQL, GraphQL, WebSocket, and JSON-operator SQLi. Includes WAF bypass techniques, database-specific exploitation (MySQL, MSSQL, PostgreSQL, Oracle), cloud-native attack paths, ORM CVE tracking, and SQLmap automation..." ---以 Skills/web/offensive-sqli/SKILL.md 为例,正文不是零散的 payload 堆砌,而是完整的操作工作流:先映射所有到达数据库的输入向量(URL 参数、POST body、Cookie、Header、API 过滤器、WebSocket 消息),再插入探测载荷,错误型/布尔盲注/时间盲注逐级递进,识别数据库类型、枚举 schema、提权或 RCE,最后输出带修复建议的结论。这种"Quick Workflow → Detection → 各阶段技法 → 防御视角 → Engagement Cheatsheet"的结构,本质上是把资深攻击者的经验固化成可复用的标准作业程序。
按需加载:不给模型背多余的上下文
这个设计还有一个非常工程化的细节:技能按对话触发词按需加载。你讨论 SQL 注入,就加载offensive-sqli;你进入无线渗透阶段,再加载offensive-wifi-recon。Claude 不为用不到的技能付出上下文成本——78 个技能全部注入会撑爆上下文窗口,按需加载则让"全副武装"与"轻装上阵"可以兼得。配合 install.sh 的--category web、--dry-run等参数,安全团队可以只部署当前项目用得到的分类。
从版本演进看,这种"深度优先、单点聚焦"的策略相当激进:CHANGELOG.md 显示 v0.1.0 只有 37 个技能,v0.3.0 已到 78 个技能、23 个分类,且 roadmap 仍在向 AD 拆分、云身份、Web 进阶等方向扩张。其中offensive-deserialization从 183 行重写到 600+ 行、offensive-ssti扩到 758 行并覆盖 10+ 模板引擎——技能不是目录条目,而是被持续打磨的深度内容资产。
三、从"Claude 专属"到"全模型适配":开放框架的扩展路径
Claude-Red 的名字里带着 Claude,但它的扩展路径恰恰说明了"全模型适配"是怎么发生的。
关键在于一个事实:这套技能库的价值载体是方法论文本,而不是某个厂商的 API 调用。Claude Skills 系统只是"宿主"之一,方法论本身对模型是中立甚至无感的。这一点从仓库的安装方式可以看得很清楚——除了克隆到~/.claude/skills/claude-red的标准玩法,README 还给出了通用接入方式:
cat Skills/web/offensive-sqli/SKILL.md | claude --system-file -把SKILL.md作为 system 上下文喂给模型,本质上与具体模型解耦:同样的技能文件,喂给 Claude、喂给支持系统提示词的其它模型、喂给本地开源模型,得到的都是同一套攻击方法论。这背后是一个重要趋势:红队能力的载体,正在从"依赖特定 SDK 的测试脚本"转向"可移植、可复制、可对话加载的方法论资产"。SkillAttack 这类面向 Agent Skill 的自动化验证框架的出现,进一步印证了这一点——技能本身成了被测对象,也成了攻击与防御争夺的新前线。
换句话说,从"Claude Mythos 专属"到"GLM-5.3 也能被同一套方法论覆盖",开源框架的适配路径不是给每个模型各写一套代码,而是把攻击知识结构化为模型无关的技能层。模型可以换、SDK 可以换,但 SQL 注入的手工探测序列、EDR 逃逸的 hook unhooking 步骤、无线攻防的握手抓包流程,这些跨模型成立的攻击知识不变。
四、模型选型与安全评估合流:安全分正在变成第一道门槛
GLM-5.3 事件最有信息量的部分,是它把"安全评测"直接推到了"模型选型"面前。能力追平 Mythos 的模型,若拒绝护栏是摆设,那么任何严肃的企业都不敢在无护栏场景下直接上线它。这意味着:
- 安全不再是被动的合规检查,而是选型的否决性指标。榜单思维正在从单一能力维度,转向"能力 + 安全 + 成本"的多维坐标系。
- 红队测试必须可回归、可量化。社区对 Claude-Red 类框架的讨论中反复出现的 ASR(攻击成功率)、ASL(平均伤害等级)、误拒率三大量化指标,本质上是要把"这个模型越狱难不难"变成可以跨版本、跨模型对比的数字。
- 评测要逼近真实业务场景。无论是提示词注入、系统指令泄露、越狱变体、敏感信息泄露,还是 Agent 场景下的工具越权,脱离业务场景的通用基准已不足以支撑选型决策——这正是一系列社区文章强调"场景贴合产品、避免系统提示词污染、支持定期回归与基线对比"的原因。
Claude-Red 中的 Skills/ai/offensive-ai-security/SKILL.md 给出了这套思路的完整落地形态。它把 AI 攻击面的底层机制拆得很透:指令跟随与歧义(指令与数据的边界模糊)、数据依赖(训练数据与输入数据的双重投毒面)、黑盒不透明性、外部系统集成带来的过度代理(excessive agency)、输出处理不当、供应链风险等。围绕 OWASP LLM Top 10,它提供了可直接执行的检测流程——比如间接注入的七步法(映射工具权限 → 映射可注入数据源 → 提取系统提示词 → 探测语义/令牌级授权 → 注入更具说服力的提示 → 让模型读取源并观察动作 → 迭代精化),以及 RAG 专属攻击(向量库租户隔离、embedding 投毒、检索合并滥用)、多模态通道隐藏指令、工具调用 schema 验证绕过等新面。攻击技法之外,它还给出了防御侧的 fail-closed 清单:系统/开发者/用户角色严格分离、工具域白名单、JSON Schema 严格校验、敏感模式前后置过滤、高风险操作人工介入、网络出口管控、日志脱敏——红队与蓝队的知识第一次被装进同一份方法论里。
配合 Skills/utility/offensive-reporting/SKILL.md 的报告规范(CVSS v3.1/v4.0 评分、证据卫生、风险叙事、复测纪律),一个完整的闭环浮出水面:自动化执行 → 量化评分 → 结构化成因 → 可回归基线 → 支撑选型与上线决策。这正是"模型选型与安全评估合流"所需要的工程底座。
五、趋势预判:红队正在变成模型发布的标准流水线
把最近的信号串起来,可以清晰地看到三条正在成形的趋势:
其一,安全评测将从"发布后补救"前置为"发布前关卡"。Fable 5 的 72 小时下架教训说明,靠用户反馈发现漏洞的代价太高。未来的模型发布流程,大概率会像今天的软件 CI 一样,把自动化红队压测作为上线门禁——这也解释了为什么社区中大量讨论把 CI/CD 集成、断点续跑、版本回归作为 Claude-Red 类框架的标配能力。
其二,红队能力将全面"资产化、技能化"。与给每个模型写一套专属测试脚本相比,把攻击方法论沉淀为模型无关、可复用、可持续迭代的技能文件,是成本与效率的最优解。Claude-Red 的 78 个技能之所以按攻击面而非按模型组织,正是因为攻击面是稳定资产,而模型是快速迭代的变量。
其三,安全分数将成为模型竞争的新主战场。当能力差距被快速抹平(GLM-5.3 追平 Mythos 就是注脚),差异化竞争点将转向"同样能力下谁更安全、谁更可控"。谁能提供可证明、可量化、可复现的安全基线,谁就掌握选型话语权。对开源社区而言,这意味着像 Claude-Red 这样的技能库不只是工具,更是这场安全竞赛的"度量衡基础设施"。
红队盯上所有模型的时代,本质上是"AI 安全从少数研究者的手艺,变成整个行业的工程纪律"的时代。而开源框架们给出的答案很一致:不押注任何单一模型,把方法论本身做成开放的资产。这套思路是否真的能经受住 Mythos、GLM-5.3 们一代代迭代的考验,将是接下来最值得观察的技术叙事之一。
【免费下载链接】Claude-Redclaude-red is a curated library of offensive security skills designed for the Claude skills system. Each skill is a structured SKILL.md file that primes Claude with expert-level methodology for a specific attack surface — from SQLi to shellcode, EDR evasion to exploit development.项目地址: https://gitcode.com/GitHub_Trending/cl/Claude-Red
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考