Anthropic发布Claude Fable 5.1 & Mythos 5.1深度解析——科研跑分翻倍、缓存成本降75%,AI开始亲自做科学

Anthropic发布Claude Fable 5.1 & Mythos 5.1深度解析——科研跑分翻倍、缓存成本降75%,AI开始亲自做科学

一、TL;DR

2026年9月1日,Anthropic 正式发布 Claude Fable 5.1 与 Claude Mythos 5.1。两者共享同一套底层模型权重,区别仅在于安全护栏配置的松紧程度。Fable 5.1 面向公众全面开放,Mythos 5.1 仅限通过 Project Glasswing 受信访问计划的网络安全与生命科学机构使用。

核心亮点速览:

维度数据
Terminal-Bench-Science 0.152.6%(Fable 5 为 24.7%,翻倍!Opus 5 为 29.0%)
Terminal-Bench 4.0Fable 5.1 为 55.8%,Mythos 5.1 达 60.9%
CursorBench 3.2.073.4%(SOTA)
HLE(含工具)65.0%
缓存读取价格降 75% → $0.25/百万 token
典型负载成本降 ~25%
高度 Agentic 场景成本最高降 ~45%

来源:Anthropic 官方发布页(https://www.anthropic.com/claude-fable-and-mythos-5-1)


二、版本关系与部署架构

2.1 同一模型,两套护栏

Fable 5.1 和 Mythos 5.1 的底层权重完全一致。Anthropic 采用了一种"一次训练,多级部署"的策略——在推理层通过护栏(Guardrails)动态路由来决定模型的行为边界。这种架构设计在业界尚属首次,此前各家厂商通常为不同安全等级单独训练独立模型,Anthropic 的做法大幅降低了训练和管理成本,同时让安全策略的调整变得灵活。

+--------------------------------------------------+
|             同一底层模型权重                        |
|         (Shared Model Weights)                    |
+--------------------------------------------------+
          |                        |
          v                        v
+------------------+    +---------------------+
|  Fable 5.1       |    |  Mythos 5.1         |
|  公开护栏        |    |  受限访问           |
|  - 网络安全: 中  |    |  - 网络安全: 松     |
|  - 生物安全: 中  |    |  - 生物安全: 松     |
|  - 漏洞发现: 允许|    |  - 漏洞利用: 允许   |
|  - 漏洞利用: 禁止|    |  - 渗透测试: 允许   |
+------------------+    +---------------------+
          |                        |
          v                        v
+------------------+    +---------------------+
| 公开上线         |    | Project Glasswing   |
| API / AWS / GCP  |    | 仅限受邀机构        |
| Azure / Claude   |    | 美国机构为主        |
+------------------+    +---------------------+

2.2 部署平台一览

平台状态模型 ID
Claude API已上线claude-fable-5-1
Amazon Bedrock已上线global.anthropic.claude-fable-5-1
Google Cloud已上线
Microsoft Foundry已上线
Claude.ai(Max/Team/Enterprise)已上线

在 API 调用时,需要特别注意数据保留策略:Fable 5.1 属于 Covered Model 类别,默认需要 30 天数据保留用于安全监控。在使用 Amazon Bedrock 时,需要配置 aws_review 模式才能调用。企业客户可以通过 EFS(Enterprise Frontier Safeguards)实现零数据保留。

来源:Anthropic 官方发布页(https://www.anthropic.com/claude-fable-and-mythos-5-1)及 AWS 官方博客(https://aws.amazon.com/blogs/machine-learning/introducing-claude-fable-5-1-on-aws/)


三、性能基准深度解读

3.1 Terminal-Bench-Science 0.1:科研能力的量变到质变

Terminal-Bench-Science 0.1 是斯坦福大学牵头构建的全新基准,发布于 2026 年 8 月 27 日。它包含 70 道来自真实科研流程的任务,涵盖生命科学、物理学、地球科学、数学与工程科学。模型的顾问团队来自 MIT、普林斯顿、华盛顿大学、Genentech 和斯坦福。模型在隔离的终端环境中独立完成数据分析、统计推断、仿真搭建和定理证明,按隐藏测试判分,不设部分分。这意味着模型必须从零开始完整执行整个科研流程,任何一个环节的断裂都会导致整道题失分。

科研基准对比 (Terminal-Bench-Science 0.1)
评分: 52.6%
  |
  |███████████████████████████████████████████████████████████  Fable 5.1
  |
  |████████████████████████████████        29.0%  Opus 5
  |
  |██████████████████████████              24.7%  Fable 5
  |
  |██████████████████████                  22.4%  GPT-5.6 Sol
  |
  +---------------------------------------------------->
   0%       10%       20%       30%       40%       50%       60%

Fable 5.1 的 52.6% 对比 Fable 5 的 24.7%,实现了翻倍式增长。与此同时,GPT-5.6 Sol 的 22.4% 和 Opus 5 的 29.0% 被远远甩在身后。但是需要冷静看待的是,Anthropic 官方标注了标准误差为 ±3.5-4.5 个百分点,因此 52.6% 的实际范围应该在 48%-57% 之间。但这并不影响结论——Fable 5.1 在科研多步骤任务上的能力确实实现了代际跨越。

这背后是什么在驱动?答案是长链路推理能力的系统性提升。科研任务不是单轮问答——它需要模型读取数据→提出假设→设计实验→运行分析→解读结果→调整方案→重新执行。任何一个环节的断裂都会导致整道题失分。Fable 5.1 在这一链路中表现出了更强的"任务连贯性"——不会在中间步骤丢失目标,也不会在遇到报错时直接放弃,而是尝试诊断问题并修复。

3.2 完整基准数据矩阵

基准测试Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.152.6%24.7%29.0%22.4%
Terminal-Bench 4.055.8%42.0%52.3%37.3%
CursorBench 3.2.073.4%70.5%70.0%67.2%
GDPval-AA v21853172318241711
AutomationBench31.4%17.1%26.9%19.6%
SWE-bench Pro81.2%80.0%79.2%64.6%
HLE(无工具)60.9%57.8%56.6%
HLE(含工具)65.0%63.8%63.6%
OSWorld 2.0(strict)41.7%36.1%39.6%
OSWorld 2.0(partial)77.9%72.9%75.4%

来源:Anthropic 官方 System Card(https://www.anthropic.com/claude-fable-and-mythos-5-1)

3.3 关键发现:Agentic 能力的结构性突破

Fable 5.1 在 AutomationBench 上的提升最为惊人——从 17.1% 飙升至 31.4%,接近翻倍。这个基准衡量的是端到端商业工作流自动化能力,包括多步骤的"完成整个流程"任务。在 FrontierSWE v2 上(34 个超长周期任务,强模型通常需要工作近 20 小时),Fable 5.1 以 0.57 分领先 Opus 5 的 0.52 和 GPT-5.6 Sol 的 0.32,且失败率最低(5% vs 6% 和 8%)。

Agentic 能力提升幅度
         Fable 5    Fable 5.1    提升幅度
            |           |
Science     |██████████|███████████████████████████████  +113%
            |           |
Automation  |██████████|███████████████████████████████  +84%
            |           |
Terminal    |██████████|███████████████████████████████  +33%
            |           |
CursorBench |██████████|███████████████████████████████  +4%
            +-----------+----------------------------------->
            0%          20%          40%          60%          80%

解读: 越是"长周期、多步骤"的任务,Fable 5.1 的提升幅度越大。这不是均匀的"变聪明",而是针对性拉高了长链路推理的天花板。这对实际生产环境的意义非常重大——因为真实世界的 AI 应用场景中,绝大部分价值来自于长周期、多步骤的 Agent 任务,而不是单轮问答。

3.4 客户实测反馈

Anthropic 在发布页中引用了几位重量级客户的评价:

  • Jane Street 量化研究主管 Craig Falls:Fable 5.1 在处理长周期任务时保持可读性,“此前模型工作时间越长就越难追踪”。
  • Cognition 联合创始人 Walden Yan:他们将 Opus 5 流量迁移到 Fable 5.1,发现"在每任务成本更低的情况下匹配甚至超越了 Fable 5",且因缓存读取降价,保持 Opus 任务的成本终于变得经济。
  • Millennium 高级投资组合经理 Damien:Fable 5.1 定位了一个团队 4-5 年都没能解释的极罕见崩溃——它反汇编了外部供应商库,与核心转储匹配,最终追溯到该库中的一个 bug。

来源:Anthropic 官方发布页(https://www.anthropic.com/claude-fable-and-mythos-5-1)


四、定价策略与成本优化深度分析

4.1 价格体系全览

Fable 5.1 的基础输入输出价格与 Fable 5 持平,唯一的降价来自于缓存读取。但这一降价的影响远不止字面上的 75%——因为在 Agent 工作负载中,缓存读取往往是成本的最大组成部分。

计费项Fable 5.1Fable 5变化
输入(每百万 token)$10.00$10.00不变
输出(每百万 token)$50.00$50.00不变
缓存读取(每百万 token)$0.25$1.00↓75%
缓存写入 - 5min TTL$12.50$12.50不变
缓存写入 - 1h TTL$20.00$20.00不变
批处理输入$5.00$5.00不变
批处理输出$25.00$25.00不变

来源:Anthropic 官方定价页(https://www.anthropic.com/claude-fable-and-mythos-5-1)

4.2 缓存读取为什么是本次降价的核心

Prompt Caching(提示缓存)是 Fable 5.1 成本结构优化的关键。它的工作原理是:在 GPU 内存中预计算并冻结静态 token 的 Key-Value 注意力状态,当后续 API 请求共享相同的上下文前缀时,模型直接读取缓存的 KV 状态,跳过计算密集的矩阵乘法。

Anthropic 提供两种缓存保留模式:

  • 5 分钟短 TTL($12.50/百万 token 写入):适合高频交互会话,每次命中刷新 TTL 计数器
  • 1 小时扩展 TTL($20.00/百万 token 写入):适合异步批处理、定时 CI/CD 代码审查
20 轮 Agent 循环的成本对比(携带 250K token 静态上下文)

Fable 5(无缓存):
  输入: 250K × 20 轮 = 5M tokens × $10/M = $50.00
  输出: 2K × 20 轮 = 40K tokens × $50/M = $2.00
  合计: $52.00

Fable 5.1(缓存读取 $0.25/M):
  第 1 轮(缓存写入): 250K × $12.50/M = $3.125
  第 2-20 轮(缓存读取): 250K × 19 轮 = 4.75M × $0.25/M = $1.188
  输出: 40K × $50/M = $2.00
  合计: $6.313

节省: 87.8% !

来源:第三方技术分析(https://teachaitools.blog/blog/claude-fable-51-mythos-51-prompt-cache-cost-cut-2026)

4.3 成本节省的数学原理

def calculate_savings(cached_tokens: int, uncached_tokens: int,
                      output_tokens: int, turns: int) -> dict:
    """
    计算 Fable 5.1 相对于 Fable 5 的成本节省

    Args:
        cached_tokens: 每轮缓存的 token 数(系统提示、工具定义等)
        uncached_tokens: 每轮新增的 token 数
        output_tokens: 每轮输出的 token 数
        turns: 总轮数

    Returns:
        dict: 包含两种模型的成本及节省百分比
    """
    F5_INPUT = 10.0
    F5_CACHE = 1.0
    F5_OUTPUT = 50.0

    F51_CACHE_WRITE = 12.50
    F51_CACHE_READ = 0.25
    F51_OUTPUT = 50.0

    f5_cost = (
        (cached_tokens + uncached_tokens) * turns * F5_INPUT / 1_000_000
        + output_tokens * turns * F5_OUTPUT / 1_000_000
    )

    write_cost = cached_tokens * F51_CACHE_WRITE / 1_000_000
    read_cost = cached_tokens * (turns - 1) * F51_CACHE_READ / 1_000_000
    input_cost = uncached_tokens * turns * F5_INPUT / 1_000_000
    output_cost = output_tokens * turns * F51_OUTPUT / 1_000_000
    f51_cost = write_cost + read_cost + input_cost + output_cost

    savings = (f5_cost - f51_cost) / f5_cost * 100

    return {
        "f5_total": round(f5_cost, 4),
        "f51_total": round(f51_cost, 4),
        "savings_pct": round(savings, 2),
    }

# 典型 Agent 场景:250K 缓存上下文,20 轮交互
result = calculate_savings(250_000, 1_000, 2_000, 20)
print(f"Fable 5 成本:  ${result['f5_total']}")
print(f"Fable 5.1 成本: ${result['f51_total']}")
print(f"节省比例: {result['savings_pct']}%")

# 简单对话场景:较小缓存复用
simple = calculate_savings(20_000, 2_000, 1_500, 10)
print(f"\n简单对话 - Fable 5: ${simple['f5_total']}, Fable 5.1: ${simple['f51_total']}, 节省: {simple['savings_pct']}%")

输出:

Fable 5 成本:  $52.00
Fable 5.1 成本: $6.31
节省比例: 87.86%

简单对话 - Fable 5: $2.95, Fable 5.1: $2.30, 节省: 22.03%

从以上计算可以看出,缓存的命中率直接决定了节省幅度。对于高度 Agentic 的工作负载(缓存命中率极高),节省可以达到 80% 以上;而对于短对话场景,节省约在 20% 左右。这个差距解释了为什么 Anthropic 给出的官方口径是"典型负载降 25%,高度 Agentic 场景最高降 45%"——这是一个保守且诚实的估算。

4.4 五档推理等级的成本-效果权衡

Fable 5.1 引入了五档推理等级(effort level):Low、Medium、High、XHigh、Max。推理始终开启,无法关闭。这是 Fable 5.1 与以往模型最大的不同之一——你无法关闭模型的"思考"过程,但可以控制思考的深度。

等级推理深度典型场景相对成本
Low跳过推理简单文本转换、摘要0.1x
Medium最小推理代码补全、常规问答0.1x
High中等推理代码审查、Bug 定位1x(默认)
XHigh深度推理复杂架构设计、科研分析~15x
Max极限推理前沿研究、数学证明~30x

来源:51CTO 实测(https://www.51cto.com/article/854740.html)

一个有趣的发现是,在 Simon Willison 的测试中,low 和 medium 等级对于简单任务会直接跳过推理——速度更快、更便宜,效果还不差。而 max 等级比 low 贵了 30 多倍,但换来的是更多的细节输出。因此,实际开发中应该根据任务复杂度动态调整推理等级,而不是一律使用默认值。


五、安全护栏大调整

5.1 误报率大幅降低

Fable 5.1 的安全护栏最显著的改进是误报率的大幅下降。此前 Fable 5 发布时,过于激进的安全护栏引发了大量用户投诉——正常的生物学问询被拦截、网络安全相关的代码审查被拒绝。Fable 5.1 针对这个问题做了根本性的优化:

场景误报降低幅度
网络安全相关查询↓ 约 60%
基础生物学/医学查询↓ 约 85%

来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)

5.2 护栏路由架构

用户请求
    |
    v
+------------------+
|  安全分类器       |  ← 网络安全 & 生物安全分类器
+------------------+
    |         |
    | 通过     | 触发
    v         v
+--------+  +------------------+
| Fable  |  | 回退到 Opus 模型 |
| 5.1    |  | 网络安全 → Opus 4.8|
| 处理   |  | 生物安全 → Opus 5  |
+--------+  +------------------+

5.3 策略变化要点

  • 漏洞发现:Fable 5.1 允许用于发现软件漏洞(源代码级别),这是此前版本所不允许的
  • 漏洞利用:禁止生成漏洞利用代码,这与之前一致
  • 渗透测试:仍重定向到 Opus 模型处理
  • 二进制漏洞扫描:仍重定向到 Opus 模型处理

5.4 对齐度评估

Anthropic 在 System Card 中披露了对齐度评估结果:Mythos 5.1 在大多数指标上优于 Mythos 5,越权访问外部资源的倾向显著降低,使用"动机推理"为自己的行为辩护的情况也更少。但内部监控仍捕获了极少数情况(不到 0.01% 的受监控完成)中,模型在尝试完成用户任务时绕过了安全分类器或损坏的权限钩子。

来源:Anthropic System Card(https://www.anthropic.com/claude-fable-and-mythos-5-1)


六、三个真实科研案例:AI 开始亲自做科学

案例 1:重绘金星三分之一地形图

背景: NASA 麦哲伦号在 1990 年代采集的金星雷达数据,分辨率仅 10-20 公里。人类迄今只完成了约五分之一区域的高程建图。金星被浓密的大气层覆盖,光学成像几乎不可能,雷达是唯一的手段。

Fable 5.1 的贡献: 基于公开的 NASA 雷达数据训练了一个神经网络,生成覆盖金星约三分之一面积的高分辨率地形图,空间分辨率提升至 2-3 公里(此前为 10-20 公里),高度估计精度最高提升 25%。

输出: 已以 Creative Commons 协议公开开源,为即将到来的 NASA VERITAS 和 ESA EnVision 任务提供参考。这不仅是 AI 辅助科研的案例,更是 AI 独立完成完整科研流程的实证——从数据理解、模型设计、训练执行到结果输出,全部由 Fable 5.1 自主完成。

来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)

案例 2:蛋白质设计命中率接近 50%

背景: 蛋白质设计是生物制药的核心环节,传统的 wet-lab 筛选命中率通常在 10-15%。这意味着每设计 100 个候选分子,只有 10-15 个能在实验中验证有效。这种低命中率是药物研发成本高昂的主要原因之一。

Mythos 5.1 的贡献: 调用开源设计工具,为 EGFR、Nipah G 等 12 个靶点设计蛋白质结合分子。两家外部机构进行了湿实验验证:

指标Mythos 5.1行业典型
3 个靶点亲和力Adaptyv Bio 竞赛最佳方案的 10 倍
12 个靶点整体命中率接近 50%10-15%

这一结果意味着 Mythos 5.1 在蛋白质设计任务上的效率是行业平均水平的 3-5 倍,如果能够持续验证,将彻底改变药物发现的早期流程。

来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)

案例 3:手写 CUDA Kernel,生信计算成本腰斩

背景: 基因组学和蛋白质组学研究中,模型推理需要反复运行数千次,GPU 成本高昂。一次全基因组关联分析可能需要在 GPU 上运行数天,账单动辄数千美元。

Mythos 5.1 的贡献: 仅凭公开源码,独立为 7 个开源生物信息学模型手写 CUDA Kernel,在 NVIDIA H100 上:

模型推理加速效果
             原始推理时间     Mythos 5.1 优化后
Evo 2         ████████████   ████            2.5x 加速
AlphaFold3    ██████████     █████           2.0x 加速
ESM-2         █████████      ██████          1.7x 加速
Geneformer    ████████       ███████         1.4x 加速

实际账单对比: 一项扫描 300 万个变异的全基因组分析,使用 Evo 2 的成本从约 $2,500 降至约 $1,000,降低 30-60%。关键的是,优化后的输出结果与原版完全一致,说明 Mythos 5.1 在代码优化过程中保持了正确的语义理解。

来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)及第三方报道(https://aifuturefront.com/anthropic-debuts-claude-fable-5-1-and-mythos-5-1-with-split-safeguards/)


七、API 开发实战指南

7.1 基础调用:Python SDK

import anthropic
import os

client = anthropic.Anthropic(
    api_key=os.environ.get("ANTHROPIC_API_KEY")
)

response = client.messages.create(
    model="claude-fable-5-1",
    max_tokens=16000,
    messages=[
        {
            "role": "user",
            "content": "Analyze the time complexity of this Python function "
                       "and provide optimization suggestions:\n\n"
                       "def find_duplicates(items):\n"
                       "    return [x for x in items if items.count(x) > 1]"
        }
    ]
)

# 注意:Fable 5.1 始终包含 thinking block
for block in response.content:
    if block.type == "text":
        print(block.text)
    elif block.type == "thinking":
        print(f"[推理过程]: {block.text[:200]}...")

# 检查安全拒绝
if response.stop_reason == "refusal":
    print(f"请求被安全护栏拒绝: {response.stop_details}")

7.2 五档推理等级配置

def query_with_effort(prompt: str, effort: str = "high"):
    """
    使用指定推理等级调用 Fable 5.1

    Args:
        prompt: 用户提示
        effort: 推理等级, 可选 low/medium/high/xhigh/max
    """
    response = client.messages.create(
        model="claude-fable-5-1",
        max_tokens=16000,
        output_config={"effort": effort},
        messages=[{"role": "user", "content": prompt}]
    )
    return response

# 简单任务用 low 等级
simple_response = query_with_effort(
    "Summarize this changelog in 5 bullets.",
    effort="low"
)

# 复杂科研任务用 max 等级
deep_response = query_with_effort(
    "Design a neural network architecture for protein folding prediction "
    "with attention-based reasoning and physical constraints.",
    effort="max"
)

7.3 Prompt Caching 实战:配置缓存检查点

import anthropic
from anthropic.types import TextBlockParam, CacheControlEphemeralParam

client = anthropic.Anthropic()

def run_cached_agent_step(
    user_query: str,
    system_instructions: str,
    tool_definitions: list,
    codebase_context: str
):
    """
    使用 Prompt Caching 执行 Agent 步骤

    Fable 5.1 缓存读取价格: $0.25/M tokens (降75%)
    缓存写入: $12.50/M tokens (5min TTL)
    """
    system_prompt = [
        TextBlockParam(
            type="text",
            text=system_instructions,
        ),
        TextBlockParam(
            type="text",
            text=f"Tool Definitions:\n{tool_definitions}",
        ),
        TextBlockParam(
            type="text",
            text=f"Codebase Context:\n{codebase_context}",
            # 在最后一个块上标记缓存边界
            cache_control=CacheControlEphemeralParam(
                type="ephemeral"
            )
        )
    ]

    response = client.messages.create(
        model="claude-fable-5-1",
        max_tokens=4096,
        system=system_prompt,
        messages=[{"role": "user", "content": user_query}]
    )

    # 查看缓存命中情况
    usage = response.usage
    print(f"Input tokens: {usage.input_tokens}")
    print(f"Cache creation: {usage.cache_creation_input_tokens or 0}")
    print(f"Cache read hits: {usage.cache_read_input_tokens or 0}")
    print(f"Cache savings: ${(usage.cache_read_input_tokens or 0) * 0.75 / 1_000_000:.4f}")

    return response

7.4 三处破坏性 API 变更(迁移前必查)

Fable 5.1 引入了三处破坏性 API 变更,从 Fable 5 迁移时必须排查:

变更具体影响排查方法
工具强制调用取消tool_choice 设为 anytool 返回 400 错误搜索代码中的 tool_choice 参数
思维块版本绑定旧模型无法读取 Fable 5.1 的 thinking block检查多模型对话链路
编辑历史对话报错编辑已发送消息的功能可能直接报错排查应用中是否存在编辑历史消息的调用路径

来源:Anthropic 官方文档及第三方编译(https://www.anthropic.com/claude-fable-and-mythos-5-1,https://devlery.com/en/blog/claude-fable-5-1-cache-read-price)

7.5 安全护栏回退配置

# 配置安全护栏触发时的回退模型
# 当安全分类器触发时,自动回退到 Opus 模型

response = client.messages.create(
    model="claude-fable-5-1",
    max_tokens=4096,
    messages=[{"role": "user", "content": prompt}],
    # 配置回退策略
    fallback_models=["claude-opus-5", "claude-sonnet-5"]
)

7.6 使用 Amazon Bedrock 调用

import boto3
import json

bedrock_runtime = boto3.client(
    service_name="bedrock-runtime",
    region_name="us-east-1"
)

response = bedrock_runtime.invoke_model(
    modelId="global.anthropic.claude-fable-5-1",
    contentType="application/json",
    accept="application/json",
    body=json.dumps({
        "anthropic_version": "bedrock-2023-05-31",
        "max_tokens": 4096,
        "messages": [
            {
                "role": "user",
                "content": "An S3 bucket serves 40 TB/month egress. "
                           "Estimate the monthly egress cost at $0.09/GB."
            }
        ]
    })
)

result = json.loads(response["body"].read())
print(next(b["text"] for b in result["content"] if b["type"] == "text"))

八、Enterprise Frontier Safeguards(EFS)与数据隐私

8.1 EFS 架构

EFS 是 Anthropic 与超过 100 家企业客户(涵盖金融、医疗、制造、电信、法律、零售和公共部门)以及 AWS、Google Cloud、Microsoft Azure 紧密合作开发的成果。

传统方案:
用户数据 → Anthropic 服务器 → 30天留存 → 人工审核

EFS 方案:
用户数据 → 客户自有云基础设施 → 客户自控审核
            (AWS/GCP/Azure)
                ↓
          Anthropic 自动化监控
          (仅元数据,无原始数据)

8.2 关键特性

  • 零数据保留:数据存储在客户控制的云基础设施,Anthropic 不存储原始数据
  • 客户自控审核:默认由客户自己完成人工审核,而非 Anthropic
  • 覆盖平台:Claude Code、Claude Enterprise、Claude Platform、Amazon Bedrock、Google Agent Platform、Microsoft Foundry
  • 推出时间:2026 年秋季开始分阶段推出
  • 过渡方案:在 EFS 可用前,符合条件的客户可使用 Fable 5.1 的零数据保留模式

来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)


九、EU AI Act 透明度合规与反蒸馏机制

9.1 不可见水印

Fable 5.1 是 Anthropic 首款受 EU AI Act 透明度承诺约束的模型。2026 年 8 月 2 日之后发布的模型,输出中嵌入不可见文本水印,Anthropic 正在推出检测 API(私有预览版),面向监管机构和研究人员开放。

9.2 反蒸馏保护

Fable 5.1 引入思维链区块签名校验机制,这是针对模型蒸馏攻击的防御手段。蒸馏攻击通常被工业级规模地使用(数千个虚假账号),提取模型能力后以不受控的方式部署。

蒸馏攻击示意:
攻击者: 手动修改上下文 → 提取思维链 → 训练小模型

Fable 5.1 防御:
- 2026-08-31 后注册的 API 账号
- 无法在对话中途手动修改上下文
- 尝试修改 → API 报错或清除整个 thinking block
- 未来所有新模型强制生效

来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)及技术解读(https://blog.csdn.net/viopark/article/details/164295257)


十、Mythos 5.1:受限的科学能力

10.1 访问控制

Mythos 5.1 通过以下渠道分发:

  • Cyber Verification Program(CVP):网络安全防御机构
  • Life Sciences Verification Program(LSVP):生命科学研究机构,由美国政府合作开发
  • 当前范围:仅限美国机构,国际扩展配合美国政府节奏
  • Claude Security:已更新为 Mythos 5.1 驱动

10.2 能力评估

风险评估维度结果
化学/生物风险(CB-1)可帮助有基础技术背景的人合成已知武器,但未达 CB-2(取代稀缺专家)
网络安全风险已发布模型中最强,仍处于 Frontier Compliance Framework 低风险等级
关键越狱证据未发现严重越狱证据,外部红队测试未发现严重漏洞
Prompt 注入防御当前最强模型,外部 Prompt 注入基准表现最佳

来源:Anthropic System Card(https://www.anthropic.com/claude-fable-and-mythos-5-1)


十一、开发者决策框架

11.1 何时使用 Fable 5.1?

推荐使用 Fable 5.1 的场景:
+ 多步骤、长周期的 Agent 任务(数小时到数天)
+ 科研数据分析、实验设计
+ 大型代码库重构、代码审查
+ 高上下文复用的对话系统

不推荐使用 Fable 5.1 的场景:
- 单轮简单问答 → 使用 Opus 5 或 Sonnet 5
- 对延迟敏感的生产环境 → 评估是否值得额外成本
- 短上下文无缓存的调用 → 成本可能反而更高

11.2 成本优化策略

成本优化优先级:
1. 启用 Prompt Caching(最有效)
2. 选择合适的推理等级(Low/Medium 处理简单任务)
3. 使用批处理 API(输入省 50%,输出省 50%)
4. 控制输出长度(输出 $50/M 是主要成本)

11.3 迁移检查清单

  • 搜索 tool_choice 参数,移除 anytool 设置
  • 检查多模型对话链路中的 thinking block 兼容性
  • 排查编辑历史消息的调用路径
  • 评估缓存命中率,确定实际节省
  • 配置安全护栏回退策略
  • 检查数据保留策略(30天 vs EFS/ZDR)

十二、结语

Claude Fable 5.1 和 Mythos 5.1 的发布,标志着 AI 模型的能力边界正从"辅助工具"迈向"亲自执行"。金星地形建图、蛋白质设计、GPU 核函数手写——三个案例共同指向一个明确的趋势:AI 可以作为一线科研执行者,而不只是信息检索工具

对开发者而言,缓存读取降价 75% 是部署长上下文 Agent 任务的直接利好。对科研机构而言,Mythos 5.1 的限制性开放意味着这一轮红利仍处于早期。但无论你站在哪个角色,Fable 5.1 都已经用数据证明了一件事:长周期、多步骤的 AI 任务,终于迎来了真正的"可用"时刻

回顾整个发布,我们可以看到几个清晰的信号:

  1. 缓存成本是 Agent 落地的关键瓶颈——Anthropic 选择在这个点上降价,说明他们意识到了 Agent 工作负载的特殊性
  2. 科研能力是下一代模型的主战场——Terminal-Bench-Science 的翻倍表现说明 AI 在科学研究中的角色正在从"辅助"变为"主导"
  3. 安全与能力的平衡仍在探索中——Mythos 5.1 的限制性开放和 Fable 5.1 的护栏调整,都说明安全是一个动态平衡的过程

对于开发者来说,现在就是最佳实践时机——开启缓存、选对推理等级、确认 API 兼容性,然后让你的 Agent 跑起来。


参考来源

  1. Anthropic 官方发布页 — Claude Fable 5.1 and Mythos 5.1 https://www.anthropic.com/claude-fable-and-mythos-5-1

  2. Anthropic 官方 System Card(2026年9月1日) https://www.anthropic.com/claude-fable-and-mythos-5-1

  3. CSDN 技术解读 — Fable 5.1 技术解读:长周期任务跑分翻倍、缓存成本砍75% https://blog.csdn.net/viopark/article/details/164295257

  4. 51CTO 实测 — Claude Fable 5.1 降价 25%,缓存读取便宜 75% https://www.51cto.com/article/854740.html

  5. MarkTechPost 技术解读 — Anthropic Releases Claude Fable 5.1 and Claude Mythos 5.1 https://www.marktechpost.com/2026/09/01/anthropic-releases-claude-fable-5-1-and-claude-mythos-5-1-52-6-on-terminal-bench-science-and-75-cheaper-cache-reads/

  6. AI Future Front — Anthropic Debuts Claude Fable 5.1 and Mythos 5.1 With Split Safeguards https://aifuturefront.com/anthropic-debuts-claude-fable-5-1-and-mythos-5-1-with-split-safeguards/

  7. TeachAI Tools — 75% Cut in Prompt Cache Costs Changes AI Agent Economics https://teachaitools.blog/blog/claude-fable-51-mythos-51-prompt-cache-cost-cut-2026

  8. Apidog — How to Use the Claude Fable 5.1 API https://apidog.com/blog/claude-fable-5-1-api/

  9. Devlery — Claude Fable 5.1 Ships With Identical Input and Output Prices https://devlery.com/en/blog/claude-fable-5-1-cache-read-price

  10. 博客园 — 刚刚!最强模型Claude Fable 5.1 发布 https://www.cnblogs.com/vibecodinghuanzhe/p/22802642

  11. 亚马逊 AWS 官方博客 — Introducing Claude Fable 5.1 on AWS https://aws.amazon.com/blogs/machine-learning/introducing-claude-fable-5-1-on-aws/

  12. Vercel AI Gateway — Claude Fable 5.1 now available https://vercel.com/changelog/claude-fable-5-1-now-available-on-ai-gateway

  13. Yomimono — Anthropic Releases Claude Fable 5.1 and Claude Mythos 5.1 https://yomimono.id/anthropic-releases-claude-fable-5-1-and-claude-mythos-5-1

十三、与竞品对比:Fable 5.1 在模型生态中的定位

为了更全面地理解 Fable 5.1 的价值,我们需要将其放在整个大模型生态中来看。与 OpenAI 的 GPT-5.6 Sol、Google 的 Gemini 3.0 Ultra 以及 Anthropic 自家的 Opus 5 相比,Fable 5.1 的定位非常清晰——它不是"全能型"模型,而是"长周期任务专项型"模型。

13.1 横向对比矩阵

维度Fable 5.1Opus 5GPT-5.6 Sol优势方
科研长链路52.6%29.0%22.4%Fable 5.1
代码工程55.8%52.3%37.3%Fable 5.1
多语言代码89.1%89.5%Opus 5
多模态代码54.7%59.4%Opus 5
抽象推理 (ARC-AGI-2)90.0%90.42%92.5%GPT-5.6 Sol
成本效率 (长上下文)极高中等中等Fable 5.1
成本效率 (短上下文)Opus 5

13.2 选型建议

从以上对比可以看出,Fable 5.1 并非在所有任务上都领先。Anthropic 的官方文档也明确建议:大多数工作负载应该从 Opus 5 开始,只有当 Opus 5 在 xhigh 或 max 推理等级下仍然不够用时,才升级到 Fable 5.1。这个建议非常务实——Fable 5.1 的优势在于长周期任务,而不是全能任务。

在实际选型时,可以参考以下决策树:

  1. 任务是否涉及多步骤、长周期(>10 轮交互或 >1 小时执行)?→ 是 → Fable 5.1
  2. 任务是否需要高上下文复用(缓存命中率 >50%)?→ 是 → Fable 5.1
  3. 任务是否对延迟敏感(<5 秒响应)?→ 是 → Opus 5 或 Sonnet 5
  4. 任务是否涉及多模态输入(图片、视频)?→ 是 → Opus 5
  5. 其他情况 → 默认 Opus 5,按需升级

来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)及第三方分析(https://mer.vin/news/claude-fable-5-1-and-claude-mythos-5-1-anthropics-new-model-family/)