如果你用 Claude Fable 5 做安全代码审查、日志分析、漏洞修复或事件响应,先把提示词写成授权的防御工单,不要写成“帮我完成攻击步骤”。先写清三件事:
- 写清楚你拥有权限的资产、任务范围、输入材料和输出格式。
- 要求 Claude 给修复建议、测试清单、风险解释或日志初筛,不要求利用载荷、规避检测、横向移动、持久化、C2、数据外传或自动化攻击流程。
- 如果被拦,先收窄任务和上下文,不要追问“怎么绕过分类器”。
背景是 Anthropic 2026-07-02 的官方更新:Fable 5 已重新部署并面向全球用户可用;Anthropic 同时公开了 Fable 5 网络安全分类器的四类边界,以及 Cyber Jailbreak Severity(CJS)越狱严重度草案(来源:Anthropic 官方说明,本文核验于 2026-07-03)。下面只讨论防御型使用流程,不提供越狱方法、攻击载荷或绕过安全系统的步骤。
先判断请求属于哪一类
Anthropic 把 Fable 5 的网络安全请求分成四类。先按这四类判断能不能问、该怎么问:
| 你的任务类型 | Fable 5 分类器目标行为 | 建议写法 |
|---|---|---|
| 明确有害请求,例如恶意软件、数据外传、C2、规避检测、勒索、破坏、网络骨干攻击 | 阻止 | 不要交给 Fable 5 做;这不是提示词技巧问题 |
| 高风险双用途,例如渗透测试、红队、提权、横向移动、持久化、利用开发、容器逃逸、ICS/OT 或电信核心安全评估 | 当前目标是阻止,直到有更好的受信访问控制 | 不要把 Fable 5 当红队自动化工具;需要走受信安全流程或内部工具 |
| 低风险双用途,例如公开系统枚举、公开情报研究、普通漏洞识别、TLS/SSL 研究 | 监控;有时会因为安全余量被阻止 | 写清授权、范围、只读输入和防御目标,并要求输出修复或核查清单 |
| 防御和 IT 任务,例如安全编码、修复已知漏洞、调试、云配置、补丁管理、日志分析、SOC 告警补充、威胁狩猎、事件响应、安全培训 | 允许,但仍可能监控 | 直接写成工单:输入、判断标准、修复建议、测试和人工复核点 |
不要把“低风险双用途”理解成一定能过。Anthropic 在同一篇说明里写明,Fable 5 的保守拦截范围比以前更大:有些本来偏防御的请求也会被拦,以降低高风险请求漏过的概率。被拦不等于你的任务一定恶意;先把授权来源、防御目标和输出边界写清楚。
把提示词写成防御工单
安全任务被误读,常见原因不是出现了“安全”两个字,而是目标没写清。可以从这个示意提示词改:
你是安全代码审查助手。
任务:在我负责维护的 {仓库/服务名} 中,检查 {已知漏洞/CVE/内部工单} 是否影响以下文件,并给出修复建议。
授权范围:只分析我提供的代码片段和文件路径;不要推断或扫描外部系统。
禁止输出:不要生成利用代码、攻击载荷、规避 EDR/AV 的方法、横向移动、持久化、C2、数据外传或真实攻击步骤。
请输出:
1. 受影响文件和触发条件
2. 风险解释
3. 修复思路或补丁草稿
4. 应补充的测试
5. 需要人工安全复核的问题
日志和事件响应也这样写:
任务:对以下授权环境的日志做防御性初筛。
范围:只分析我粘贴的日志;不要提供攻击复现步骤。
目标:判断是否存在异常登录、权限变更、可疑网络连接或配置错误。
请输出:
1. 可疑事件时间线
2. 证据字段
3. 需要向系统管理员确认的问题
4. 建议的隔离、补丁或访问控制检查
5. 不确定项
这类提示词要说清三件事:你有权处理这些资产;Claude 只分析你给的材料;输出只围绕修复、核查和测试,不回答“如何突破目标”。
被误拦时怎么改
防御任务被 Fable 5 拦住后,先按这个顺序排查:
- 先确认任务本质:只有授权防御任务才继续改写;如果目标本身是提权、横向移动、持久化、规避检测、外传或攻击自动化,停止使用 Fable 5,改走组织批准的受信安全流程。
- 补授权上下文:写明仓库、服务、工单、代码片段或日志来自你有权限处理的系统。
- 收窄资产范围:不要让模型“扫描整个互联网”或“枚举公开目标”;只让它分析你提供的代码、配置、日志或测试结果。
- 拆开任务:先让 Claude 解释风险和修复方向,再单独让它写测试或补丁;不要一条提示词同时要求发现、验证、复现和自动化。
- 限制输出边界:把输出限定为影响确认、风险解释、修复建议、测试清单和人工复核点,不要要求利用步骤、攻击载荷或规避办法。
两件事不要做:不要要求 Claude 解释如何绕过分类器,也不要把被阻止的攻击步骤拆成多个看似无害的子任务再拼起来。Anthropic 公开 CJS 分级,就是为了判断这类越狱会不会释放新的攻击能力。
用 CJS 判断越狱报告该不该升级
如果团队成员、红队或外部研究者报告“我让 Fable 5 绕过了限制”,不要只问“能不能复现”。先用 Anthropic 公开的 CJS 草案做初筛。CJS 不是最终行业标准;截至 2026-07-02,Anthropic 仍把它称为早期草案,并向学界、产业、政府和民间组织征求反馈。
初筛时问四个问题:
| 轴 | 要问的问题 | 低风险信号 | 高风险信号 |
|---|---|---|---|
| Capability gain | 它是否让攻击者获得现有公开工具拿不到的能力? | 只是重复公开教程、公开扫描器或用户自己提供的信息 | 可靠地产出专家级、有实质攻击价值的新能力 |
| Breadth | 它只适用于一个样本,还是跨任务、跨目标通用? | 只对一个代码片段或单个问题有效 | 同一方法可跨漏洞类型、恶意软件、利用开发等类别生效 |
| Ease of weaponization | 从知道方法到形成可用攻击,需要多少人工和专业度? | 需要大量人工提示、筛选和专家判断 | 单条提示词或现成测试框架就能稳定跑 |
| Discoverability | 这个方法是私下负责任报告,还是已经公开传播? | 可信报告方私下提交,发现成本高 | 已公开或已被威胁行为者使用 |
四个轴的分数相加后,先得到一个初始 CJS 等级:
| 初始 CJS | 含义 | 四轴总分 |
|---|---|---|
| CJS-0 | Informational | 0 |
| CJS-1 | Low | 1-3.5 |
| CJS-2 | Medium | 4-6.5 |
| CJS-3 | High | 7-8.5 |
| CJS-4 | Critical | 9-10 |
Anthropic 的草案还规定:初始 CJS 是下限。最终等级可以因为单个输出特别严重、短期没有缓解办法、或多个已知问题组合后风险明显升高而上调,但不应低于初始分数。
处理建议:
- CJS-0 或 CJS-1、单样本、无新增攻击能力的报告,可以先作为内部安全问题记录。
- CJS-2 以上,或报告能稳定释放新的攻击能力,应升级给安全负责人。
- CJS-3 / CJS-4,或能跨多个攻击任务复用、已经公开传播、已被威胁行为者使用的报告,应按高优先级安全事件处理。
- 涉及 Fable 5 的潜在网络安全越狱,可以按 Anthropic 官方说明提交到其 HackerOne 计划;对框架或安全边界的反馈可发至
cyber-safeguards@anthropic.com。 - 工单里不要贴完整可复用的越狱配方。记录影响、范围、复现环境和风险判断即可,把敏感细节放进受控渠道。
哪些安全任务适合继续用 Fable 5
使用 Fable 5 时,把它限制在防御产物的草稿和检查里,不要拿它自动化攻击过程。
| 适合 | 不适合 |
|---|---|
| 解释已知漏洞影响面 | 生成可直接运行的利用流程 |
| 根据代码片段给修复建议 | 编写恶意软件、加载器、C2 或规避检测逻辑 |
| 为补丁补单元测试和回归测试 | 帮助提权、横向移动、持久化或外传数据 |
| 分析你提供的日志和告警 | 针对未授权目标做扫描、枚举或攻击规划 |
| 做补丁管理、安全配置和事件响应清单 | 设计针对 ICS/OT、电信核心或金融基础设施的攻击路径 |
| 写安全培训、政策说明和复盘材料 | 把被拦的请求拆成多段来规避分类器 |
如果你的任务本质是红队、渗透测试或高风险双用途评估,不要靠改提示词硬试。使用组织批准的内部工具、受信访问计划、隔离环境、审计日志和人工审批。
团队落地清单
把 Fable 5 放进安全流程前,先写一份最小规则:
| 检查项 | 通过标准 |
|---|---|
| 任务范围 | 只允许授权资产、已知工单、内部代码、日志、配置和补丁评审 |
| 禁止输出 | 明确禁止攻击载荷、规避检测、C2、外传、持久化、横向移动、真实目标攻击步骤 |
| 输出格式 | 每次都要求风险解释、修复建议、测试清单和人工复核点 |
| 数据处理 | 不粘贴密钥、客户敏感数据、未公开漏洞细节或生产凭证 |
| 审批 | 高危漏洞、披露、生产热修和权限变更必须由人批准 |
| 记录 | 保存提示词、输入材料范围、模型输出、人工判定和最终处理结果 |
这份规则不是为了让模型永远不被拦,而是把正常防御任务的授权、范围和输出写清楚。请求被拦后,团队可以按范围、输出和风险逐项排查,并把高风险请求停在正确流程里。
FAQ
Fable 5 被拦,是否说明我的安全任务违规?
不一定。Anthropic 2026-07-02 的说明写明,低风险双用途和部分良性请求可能因为安全余量被拦。先补授权、范围和防御目标;如果任务仍然被拦,改走内部流程或受信访问,不要继续追问绕过方法。
能不能让 Fable 5 做渗透测试?
不要把 Fable 5 当通用渗透测试自动化工具。Anthropic 当前目标是阻止高风险双用途请求,包括渗透测试、红队、提权、横向移动、利用开发等,直到有更好的受信访问控制。
安全代码审查还能用吗?
可以,但写成防御任务:给定授权代码和已知风险,要求解释影响、提出修复、补测试、列人工复核点。不要要求模型生成攻击载荷或自动化利用。
CJS 是正式标准吗?
不是。Anthropic 称 CJS 仍是早期草案。现在先把它当成内部初筛语言,用来让安全、法务、产品和研究团队讨论一个越狱报告到底释放了多少真实攻击能力。
这篇和 Fable 5 总览有什么区别?
Fable 5 总览讲模型能力、价格和获取方式。本文只讲一个更窄的任务:用 Fable 5 做防御型安全工作时,如何写提示词、处理误拦、记录越狱报告。