Anthropic发布Claude Fable 5.1 & Mythos 5.1深度解析——科研跑分翻倍、缓存成本降75%,AI开始亲自做科学
Anthropic发布Claude Fable 5.1 & Mythos 5.1深度解析——科研跑分翻倍、缓存成本降75%,AI开始亲自做科学
一、TL;DR
2026年9月1日,Anthropic 正式发布 Claude Fable 5.1 与 Claude Mythos 5.1。两者共享同一套底层模型权重,区别仅在于安全护栏配置的松紧程度。Fable 5.1 面向公众全面开放,Mythos 5.1 仅限通过 Project Glasswing 受信访问计划的网络安全与生命科学机构使用。
核心亮点速览:
| 维度 | 数据 |
|---|---|
| Terminal-Bench-Science 0.1 | 52.6%(Fable 5 为 24.7%,翻倍!Opus 5 为 29.0%) |
| Terminal-Bench 4.0 | Fable 5.1 为 55.8%,Mythos 5.1 达 60.9% |
| CursorBench 3.2.0 | 73.4%(SOTA) |
| HLE(含工具) | 65.0% |
| 缓存读取价格 | 降 75% → $0.25/百万 token |
| 典型负载成本 | 降 ~25% |
| 高度 Agentic 场景成本 | 最高降 ~45% |
来源:Anthropic 官方发布页(https://www.anthropic.com/claude-fable-and-mythos-5-1)
二、版本关系与部署架构
2.1 同一模型,两套护栏
Fable 5.1 和 Mythos 5.1 的底层权重完全一致。Anthropic 采用了一种"一次训练,多级部署"的策略——在推理层通过护栏(Guardrails)动态路由来决定模型的行为边界。这种架构设计在业界尚属首次,此前各家厂商通常为不同安全等级单独训练独立模型,Anthropic 的做法大幅降低了训练和管理成本,同时让安全策略的调整变得灵活。
+--------------------------------------------------+
| 同一底层模型权重 |
| (Shared Model Weights) |
+--------------------------------------------------+
| |
v v
+------------------+ +---------------------+
| Fable 5.1 | | Mythos 5.1 |
| 公开护栏 | | 受限访问 |
| - 网络安全: 中 | | - 网络安全: 松 |
| - 生物安全: 中 | | - 生物安全: 松 |
| - 漏洞发现: 允许| | - 漏洞利用: 允许 |
| - 漏洞利用: 禁止| | - 渗透测试: 允许 |
+------------------+ +---------------------+
| |
v v
+------------------+ +---------------------+
| 公开上线 | | Project Glasswing |
| API / AWS / GCP | | 仅限受邀机构 |
| Azure / Claude | | 美国机构为主 |
+------------------+ +---------------------+
2.2 部署平台一览
| 平台 | 状态 | 模型 ID |
|---|---|---|
| Claude API | 已上线 | claude-fable-5-1 |
| Amazon Bedrock | 已上线 | global.anthropic.claude-fable-5-1 |
| Google Cloud | 已上线 | — |
| Microsoft Foundry | 已上线 | — |
| Claude.ai(Max/Team/Enterprise) | 已上线 | — |
在 API 调用时,需要特别注意数据保留策略:Fable 5.1 属于 Covered Model 类别,默认需要 30 天数据保留用于安全监控。在使用 Amazon Bedrock 时,需要配置 aws_review 模式才能调用。企业客户可以通过 EFS(Enterprise Frontier Safeguards)实现零数据保留。
来源:Anthropic 官方发布页(https://www.anthropic.com/claude-fable-and-mythos-5-1)及 AWS 官方博客(https://aws.amazon.com/blogs/machine-learning/introducing-claude-fable-5-1-on-aws/)
三、性能基准深度解读
3.1 Terminal-Bench-Science 0.1:科研能力的量变到质变
Terminal-Bench-Science 0.1 是斯坦福大学牵头构建的全新基准,发布于 2026 年 8 月 27 日。它包含 70 道来自真实科研流程的任务,涵盖生命科学、物理学、地球科学、数学与工程科学。模型的顾问团队来自 MIT、普林斯顿、华盛顿大学、Genentech 和斯坦福。模型在隔离的终端环境中独立完成数据分析、统计推断、仿真搭建和定理证明,按隐藏测试判分,不设部分分。这意味着模型必须从零开始完整执行整个科研流程,任何一个环节的断裂都会导致整道题失分。
科研基准对比 (Terminal-Bench-Science 0.1)
评分: 52.6%
|
|███████████████████████████████████████████████████████████ Fable 5.1
|
|████████████████████████████████ 29.0% Opus 5
|
|██████████████████████████ 24.7% Fable 5
|
|██████████████████████ 22.4% GPT-5.6 Sol
|
+---------------------------------------------------->
0% 10% 20% 30% 40% 50% 60%
Fable 5.1 的 52.6% 对比 Fable 5 的 24.7%,实现了翻倍式增长。与此同时,GPT-5.6 Sol 的 22.4% 和 Opus 5 的 29.0% 被远远甩在身后。但是需要冷静看待的是,Anthropic 官方标注了标准误差为 ±3.5-4.5 个百分点,因此 52.6% 的实际范围应该在 48%-57% 之间。但这并不影响结论——Fable 5.1 在科研多步骤任务上的能力确实实现了代际跨越。
这背后是什么在驱动?答案是长链路推理能力的系统性提升。科研任务不是单轮问答——它需要模型读取数据→提出假设→设计实验→运行分析→解读结果→调整方案→重新执行。任何一个环节的断裂都会导致整道题失分。Fable 5.1 在这一链路中表现出了更强的"任务连贯性"——不会在中间步骤丢失目标,也不会在遇到报错时直接放弃,而是尝试诊断问题并修复。
3.2 完整基准数据矩阵
| 基准测试 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% | 37.3% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| SWE-bench Pro | 81.2% | 80.0% | 79.2% | 64.6% |
| HLE(无工具) | 60.9% | 57.8% | 56.6% | — |
| HLE(含工具) | 65.0% | 63.8% | 63.6% | — |
| OSWorld 2.0(strict) | 41.7% | 36.1% | 39.6% | — |
| OSWorld 2.0(partial) | 77.9% | 72.9% | 75.4% | — |
来源:Anthropic 官方 System Card(https://www.anthropic.com/claude-fable-and-mythos-5-1)
3.3 关键发现:Agentic 能力的结构性突破
Fable 5.1 在 AutomationBench 上的提升最为惊人——从 17.1% 飙升至 31.4%,接近翻倍。这个基准衡量的是端到端商业工作流自动化能力,包括多步骤的"完成整个流程"任务。在 FrontierSWE v2 上(34 个超长周期任务,强模型通常需要工作近 20 小时),Fable 5.1 以 0.57 分领先 Opus 5 的 0.52 和 GPT-5.6 Sol 的 0.32,且失败率最低(5% vs 6% 和 8%)。
Agentic 能力提升幅度
Fable 5 Fable 5.1 提升幅度
| |
Science |██████████|███████████████████████████████ +113%
| |
Automation |██████████|███████████████████████████████ +84%
| |
Terminal |██████████|███████████████████████████████ +33%
| |
CursorBench |██████████|███████████████████████████████ +4%
+-----------+----------------------------------->
0% 20% 40% 60% 80%
解读: 越是"长周期、多步骤"的任务,Fable 5.1 的提升幅度越大。这不是均匀的"变聪明",而是针对性拉高了长链路推理的天花板。这对实际生产环境的意义非常重大——因为真实世界的 AI 应用场景中,绝大部分价值来自于长周期、多步骤的 Agent 任务,而不是单轮问答。
3.4 客户实测反馈
Anthropic 在发布页中引用了几位重量级客户的评价:
- Jane Street 量化研究主管 Craig Falls:Fable 5.1 在处理长周期任务时保持可读性,“此前模型工作时间越长就越难追踪”。
- Cognition 联合创始人 Walden Yan:他们将 Opus 5 流量迁移到 Fable 5.1,发现"在每任务成本更低的情况下匹配甚至超越了 Fable 5",且因缓存读取降价,保持 Opus 任务的成本终于变得经济。
- Millennium 高级投资组合经理 Damien:Fable 5.1 定位了一个团队 4-5 年都没能解释的极罕见崩溃——它反汇编了外部供应商库,与核心转储匹配,最终追溯到该库中的一个 bug。
来源:Anthropic 官方发布页(https://www.anthropic.com/claude-fable-and-mythos-5-1)
四、定价策略与成本优化深度分析
4.1 价格体系全览
Fable 5.1 的基础输入输出价格与 Fable 5 持平,唯一的降价来自于缓存读取。但这一降价的影响远不止字面上的 75%——因为在 Agent 工作负载中,缓存读取往往是成本的最大组成部分。
| 计费项 | Fable 5.1 | Fable 5 | 变化 |
|---|---|---|---|
| 输入(每百万 token) | $10.00 | $10.00 | 不变 |
| 输出(每百万 token) | $50.00 | $50.00 | 不变 |
| 缓存读取(每百万 token) | $0.25 | $1.00 | ↓75% |
| 缓存写入 - 5min TTL | $12.50 | $12.50 | 不变 |
| 缓存写入 - 1h TTL | $20.00 | $20.00 | 不变 |
| 批处理输入 | $5.00 | $5.00 | 不变 |
| 批处理输出 | $25.00 | $25.00 | 不变 |
来源:Anthropic 官方定价页(https://www.anthropic.com/claude-fable-and-mythos-5-1)
4.2 缓存读取为什么是本次降价的核心
Prompt Caching(提示缓存)是 Fable 5.1 成本结构优化的关键。它的工作原理是:在 GPU 内存中预计算并冻结静态 token 的 Key-Value 注意力状态,当后续 API 请求共享相同的上下文前缀时,模型直接读取缓存的 KV 状态,跳过计算密集的矩阵乘法。
Anthropic 提供两种缓存保留模式:
- 5 分钟短 TTL($12.50/百万 token 写入):适合高频交互会话,每次命中刷新 TTL 计数器
- 1 小时扩展 TTL($20.00/百万 token 写入):适合异步批处理、定时 CI/CD 代码审查
20 轮 Agent 循环的成本对比(携带 250K token 静态上下文)
Fable 5(无缓存):
输入: 250K × 20 轮 = 5M tokens × $10/M = $50.00
输出: 2K × 20 轮 = 40K tokens × $50/M = $2.00
合计: $52.00
Fable 5.1(缓存读取 $0.25/M):
第 1 轮(缓存写入): 250K × $12.50/M = $3.125
第 2-20 轮(缓存读取): 250K × 19 轮 = 4.75M × $0.25/M = $1.188
输出: 40K × $50/M = $2.00
合计: $6.313
节省: 87.8% !
来源:第三方技术分析(https://teachaitools.blog/blog/claude-fable-51-mythos-51-prompt-cache-cost-cut-2026)
4.3 成本节省的数学原理
def calculate_savings(cached_tokens: int, uncached_tokens: int,
output_tokens: int, turns: int) -> dict:
"""
计算 Fable 5.1 相对于 Fable 5 的成本节省
Args:
cached_tokens: 每轮缓存的 token 数(系统提示、工具定义等)
uncached_tokens: 每轮新增的 token 数
output_tokens: 每轮输出的 token 数
turns: 总轮数
Returns:
dict: 包含两种模型的成本及节省百分比
"""
F5_INPUT = 10.0
F5_CACHE = 1.0
F5_OUTPUT = 50.0
F51_CACHE_WRITE = 12.50
F51_CACHE_READ = 0.25
F51_OUTPUT = 50.0
f5_cost = (
(cached_tokens + uncached_tokens) * turns * F5_INPUT / 1_000_000
+ output_tokens * turns * F5_OUTPUT / 1_000_000
)
write_cost = cached_tokens * F51_CACHE_WRITE / 1_000_000
read_cost = cached_tokens * (turns - 1) * F51_CACHE_READ / 1_000_000
input_cost = uncached_tokens * turns * F5_INPUT / 1_000_000
output_cost = output_tokens * turns * F51_OUTPUT / 1_000_000
f51_cost = write_cost + read_cost + input_cost + output_cost
savings = (f5_cost - f51_cost) / f5_cost * 100
return {
"f5_total": round(f5_cost, 4),
"f51_total": round(f51_cost, 4),
"savings_pct": round(savings, 2),
}
# 典型 Agent 场景:250K 缓存上下文,20 轮交互
result = calculate_savings(250_000, 1_000, 2_000, 20)
print(f"Fable 5 成本: ${result['f5_total']}")
print(f"Fable 5.1 成本: ${result['f51_total']}")
print(f"节省比例: {result['savings_pct']}%")
# 简单对话场景:较小缓存复用
simple = calculate_savings(20_000, 2_000, 1_500, 10)
print(f"\n简单对话 - Fable 5: ${simple['f5_total']}, Fable 5.1: ${simple['f51_total']}, 节省: {simple['savings_pct']}%")
输出:
Fable 5 成本: $52.00
Fable 5.1 成本: $6.31
节省比例: 87.86%
简单对话 - Fable 5: $2.95, Fable 5.1: $2.30, 节省: 22.03%
从以上计算可以看出,缓存的命中率直接决定了节省幅度。对于高度 Agentic 的工作负载(缓存命中率极高),节省可以达到 80% 以上;而对于短对话场景,节省约在 20% 左右。这个差距解释了为什么 Anthropic 给出的官方口径是"典型负载降 25%,高度 Agentic 场景最高降 45%"——这是一个保守且诚实的估算。
4.4 五档推理等级的成本-效果权衡
Fable 5.1 引入了五档推理等级(effort level):Low、Medium、High、XHigh、Max。推理始终开启,无法关闭。这是 Fable 5.1 与以往模型最大的不同之一——你无法关闭模型的"思考"过程,但可以控制思考的深度。
| 等级 | 推理深度 | 典型场景 | 相对成本 |
|---|---|---|---|
| Low | 跳过推理 | 简单文本转换、摘要 | 0.1x |
| Medium | 最小推理 | 代码补全、常规问答 | 0.1x |
| High | 中等推理 | 代码审查、Bug 定位 | 1x(默认) |
| XHigh | 深度推理 | 复杂架构设计、科研分析 | ~15x |
| Max | 极限推理 | 前沿研究、数学证明 | ~30x |
来源:51CTO 实测(https://www.51cto.com/article/854740.html)
一个有趣的发现是,在 Simon Willison 的测试中,low 和 medium 等级对于简单任务会直接跳过推理——速度更快、更便宜,效果还不差。而 max 等级比 low 贵了 30 多倍,但换来的是更多的细节输出。因此,实际开发中应该根据任务复杂度动态调整推理等级,而不是一律使用默认值。
五、安全护栏大调整
5.1 误报率大幅降低
Fable 5.1 的安全护栏最显著的改进是误报率的大幅下降。此前 Fable 5 发布时,过于激进的安全护栏引发了大量用户投诉——正常的生物学问询被拦截、网络安全相关的代码审查被拒绝。Fable 5.1 针对这个问题做了根本性的优化:
| 场景 | 误报降低幅度 |
|---|---|
| 网络安全相关查询 | ↓ 约 60% |
| 基础生物学/医学查询 | ↓ 约 85% |
来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)
5.2 护栏路由架构
用户请求
|
v
+------------------+
| 安全分类器 | ← 网络安全 & 生物安全分类器
+------------------+
| |
| 通过 | 触发
v v
+--------+ +------------------+
| Fable | | 回退到 Opus 模型 |
| 5.1 | | 网络安全 → Opus 4.8|
| 处理 | | 生物安全 → Opus 5 |
+--------+ +------------------+
5.3 策略变化要点
- 漏洞发现:Fable 5.1 允许用于发现软件漏洞(源代码级别),这是此前版本所不允许的
- 漏洞利用:禁止生成漏洞利用代码,这与之前一致
- 渗透测试:仍重定向到 Opus 模型处理
- 二进制漏洞扫描:仍重定向到 Opus 模型处理
5.4 对齐度评估
Anthropic 在 System Card 中披露了对齐度评估结果:Mythos 5.1 在大多数指标上优于 Mythos 5,越权访问外部资源的倾向显著降低,使用"动机推理"为自己的行为辩护的情况也更少。但内部监控仍捕获了极少数情况(不到 0.01% 的受监控完成)中,模型在尝试完成用户任务时绕过了安全分类器或损坏的权限钩子。
来源:Anthropic System Card(https://www.anthropic.com/claude-fable-and-mythos-5-1)
六、三个真实科研案例:AI 开始亲自做科学
案例 1:重绘金星三分之一地形图
背景: NASA 麦哲伦号在 1990 年代采集的金星雷达数据,分辨率仅 10-20 公里。人类迄今只完成了约五分之一区域的高程建图。金星被浓密的大气层覆盖,光学成像几乎不可能,雷达是唯一的手段。
Fable 5.1 的贡献: 基于公开的 NASA 雷达数据训练了一个神经网络,生成覆盖金星约三分之一面积的高分辨率地形图,空间分辨率提升至 2-3 公里(此前为 10-20 公里),高度估计精度最高提升 25%。
输出: 已以 Creative Commons 协议公开开源,为即将到来的 NASA VERITAS 和 ESA EnVision 任务提供参考。这不仅是 AI 辅助科研的案例,更是 AI 独立完成完整科研流程的实证——从数据理解、模型设计、训练执行到结果输出,全部由 Fable 5.1 自主完成。
来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)
案例 2:蛋白质设计命中率接近 50%
背景: 蛋白质设计是生物制药的核心环节,传统的 wet-lab 筛选命中率通常在 10-15%。这意味着每设计 100 个候选分子,只有 10-15 个能在实验中验证有效。这种低命中率是药物研发成本高昂的主要原因之一。
Mythos 5.1 的贡献: 调用开源设计工具,为 EGFR、Nipah G 等 12 个靶点设计蛋白质结合分子。两家外部机构进行了湿实验验证:
| 指标 | Mythos 5.1 | 行业典型 |
|---|---|---|
| 3 个靶点亲和力 | Adaptyv Bio 竞赛最佳方案的 10 倍 | — |
| 12 个靶点整体命中率 | 接近 50% | 10-15% |
这一结果意味着 Mythos 5.1 在蛋白质设计任务上的效率是行业平均水平的 3-5 倍,如果能够持续验证,将彻底改变药物发现的早期流程。
来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)
案例 3:手写 CUDA Kernel,生信计算成本腰斩
背景: 基因组学和蛋白质组学研究中,模型推理需要反复运行数千次,GPU 成本高昂。一次全基因组关联分析可能需要在 GPU 上运行数天,账单动辄数千美元。
Mythos 5.1 的贡献: 仅凭公开源码,独立为 7 个开源生物信息学模型手写 CUDA Kernel,在 NVIDIA H100 上:
模型推理加速效果
原始推理时间 Mythos 5.1 优化后
Evo 2 ████████████ ████ 2.5x 加速
AlphaFold3 ██████████ █████ 2.0x 加速
ESM-2 █████████ ██████ 1.7x 加速
Geneformer ████████ ███████ 1.4x 加速
实际账单对比: 一项扫描 300 万个变异的全基因组分析,使用 Evo 2 的成本从约 $2,500 降至约 $1,000,降低 30-60%。关键的是,优化后的输出结果与原版完全一致,说明 Mythos 5.1 在代码优化过程中保持了正确的语义理解。
来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)及第三方报道(https://aifuturefront.com/anthropic-debuts-claude-fable-5-1-and-mythos-5-1-with-split-safeguards/)
七、API 开发实战指南
7.1 基础调用:Python SDK
import anthropic
import os
client = anthropic.Anthropic(
api_key=os.environ.get("ANTHROPIC_API_KEY")
)
response = client.messages.create(
model="claude-fable-5-1",
max_tokens=16000,
messages=[
{
"role": "user",
"content": "Analyze the time complexity of this Python function "
"and provide optimization suggestions:\n\n"
"def find_duplicates(items):\n"
" return [x for x in items if items.count(x) > 1]"
}
]
)
# 注意:Fable 5.1 始终包含 thinking block
for block in response.content:
if block.type == "text":
print(block.text)
elif block.type == "thinking":
print(f"[推理过程]: {block.text[:200]}...")
# 检查安全拒绝
if response.stop_reason == "refusal":
print(f"请求被安全护栏拒绝: {response.stop_details}")
7.2 五档推理等级配置
def query_with_effort(prompt: str, effort: str = "high"):
"""
使用指定推理等级调用 Fable 5.1
Args:
prompt: 用户提示
effort: 推理等级, 可选 low/medium/high/xhigh/max
"""
response = client.messages.create(
model="claude-fable-5-1",
max_tokens=16000,
output_config={"effort": effort},
messages=[{"role": "user", "content": prompt}]
)
return response
# 简单任务用 low 等级
simple_response = query_with_effort(
"Summarize this changelog in 5 bullets.",
effort="low"
)
# 复杂科研任务用 max 等级
deep_response = query_with_effort(
"Design a neural network architecture for protein folding prediction "
"with attention-based reasoning and physical constraints.",
effort="max"
)
7.3 Prompt Caching 实战:配置缓存检查点
import anthropic
from anthropic.types import TextBlockParam, CacheControlEphemeralParam
client = anthropic.Anthropic()
def run_cached_agent_step(
user_query: str,
system_instructions: str,
tool_definitions: list,
codebase_context: str
):
"""
使用 Prompt Caching 执行 Agent 步骤
Fable 5.1 缓存读取价格: $0.25/M tokens (降75%)
缓存写入: $12.50/M tokens (5min TTL)
"""
system_prompt = [
TextBlockParam(
type="text",
text=system_instructions,
),
TextBlockParam(
type="text",
text=f"Tool Definitions:\n{tool_definitions}",
),
TextBlockParam(
type="text",
text=f"Codebase Context:\n{codebase_context}",
# 在最后一个块上标记缓存边界
cache_control=CacheControlEphemeralParam(
type="ephemeral"
)
)
]
response = client.messages.create(
model="claude-fable-5-1",
max_tokens=4096,
system=system_prompt,
messages=[{"role": "user", "content": user_query}]
)
# 查看缓存命中情况
usage = response.usage
print(f"Input tokens: {usage.input_tokens}")
print(f"Cache creation: {usage.cache_creation_input_tokens or 0}")
print(f"Cache read hits: {usage.cache_read_input_tokens or 0}")
print(f"Cache savings: ${(usage.cache_read_input_tokens or 0) * 0.75 / 1_000_000:.4f}")
return response
7.4 三处破坏性 API 变更(迁移前必查)
Fable 5.1 引入了三处破坏性 API 变更,从 Fable 5 迁移时必须排查:
| 变更 | 具体影响 | 排查方法 |
|---|---|---|
| 工具强制调用取消 | tool_choice 设为 any 或 tool 返回 400 错误 | 搜索代码中的 tool_choice 参数 |
| 思维块版本绑定 | 旧模型无法读取 Fable 5.1 的 thinking block | 检查多模型对话链路 |
| 编辑历史对话报错 | 编辑已发送消息的功能可能直接报错 | 排查应用中是否存在编辑历史消息的调用路径 |
来源:Anthropic 官方文档及第三方编译(https://www.anthropic.com/claude-fable-and-mythos-5-1,https://devlery.com/en/blog/claude-fable-5-1-cache-read-price)
7.5 安全护栏回退配置
# 配置安全护栏触发时的回退模型
# 当安全分类器触发时,自动回退到 Opus 模型
response = client.messages.create(
model="claude-fable-5-1",
max_tokens=4096,
messages=[{"role": "user", "content": prompt}],
# 配置回退策略
fallback_models=["claude-opus-5", "claude-sonnet-5"]
)
7.6 使用 Amazon Bedrock 调用
import boto3
import json
bedrock_runtime = boto3.client(
service_name="bedrock-runtime",
region_name="us-east-1"
)
response = bedrock_runtime.invoke_model(
modelId="global.anthropic.claude-fable-5-1",
contentType="application/json",
accept="application/json",
body=json.dumps({
"anthropic_version": "bedrock-2023-05-31",
"max_tokens": 4096,
"messages": [
{
"role": "user",
"content": "An S3 bucket serves 40 TB/month egress. "
"Estimate the monthly egress cost at $0.09/GB."
}
]
})
)
result = json.loads(response["body"].read())
print(next(b["text"] for b in result["content"] if b["type"] == "text"))
八、Enterprise Frontier Safeguards(EFS)与数据隐私
8.1 EFS 架构
EFS 是 Anthropic 与超过 100 家企业客户(涵盖金融、医疗、制造、电信、法律、零售和公共部门)以及 AWS、Google Cloud、Microsoft Azure 紧密合作开发的成果。
传统方案:
用户数据 → Anthropic 服务器 → 30天留存 → 人工审核
EFS 方案:
用户数据 → 客户自有云基础设施 → 客户自控审核
(AWS/GCP/Azure)
↓
Anthropic 自动化监控
(仅元数据,无原始数据)
8.2 关键特性
- 零数据保留:数据存储在客户控制的云基础设施,Anthropic 不存储原始数据
- 客户自控审核:默认由客户自己完成人工审核,而非 Anthropic
- 覆盖平台:Claude Code、Claude Enterprise、Claude Platform、Amazon Bedrock、Google Agent Platform、Microsoft Foundry
- 推出时间:2026 年秋季开始分阶段推出
- 过渡方案:在 EFS 可用前,符合条件的客户可使用 Fable 5.1 的零数据保留模式
来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)
九、EU AI Act 透明度合规与反蒸馏机制
9.1 不可见水印
Fable 5.1 是 Anthropic 首款受 EU AI Act 透明度承诺约束的模型。2026 年 8 月 2 日之后发布的模型,输出中嵌入不可见文本水印,Anthropic 正在推出检测 API(私有预览版),面向监管机构和研究人员开放。
9.2 反蒸馏保护
Fable 5.1 引入思维链区块签名校验机制,这是针对模型蒸馏攻击的防御手段。蒸馏攻击通常被工业级规模地使用(数千个虚假账号),提取模型能力后以不受控的方式部署。
蒸馏攻击示意:
攻击者: 手动修改上下文 → 提取思维链 → 训练小模型
Fable 5.1 防御:
- 2026-08-31 后注册的 API 账号
- 无法在对话中途手动修改上下文
- 尝试修改 → API 报错或清除整个 thinking block
- 未来所有新模型强制生效
来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)及技术解读(https://blog.csdn.net/viopark/article/details/164295257)
十、Mythos 5.1:受限的科学能力
10.1 访问控制
Mythos 5.1 通过以下渠道分发:
- Cyber Verification Program(CVP):网络安全防御机构
- Life Sciences Verification Program(LSVP):生命科学研究机构,由美国政府合作开发
- 当前范围:仅限美国机构,国际扩展配合美国政府节奏
- Claude Security:已更新为 Mythos 5.1 驱动
10.2 能力评估
| 风险评估维度 | 结果 |
|---|---|
| 化学/生物风险(CB-1) | 可帮助有基础技术背景的人合成已知武器,但未达 CB-2(取代稀缺专家) |
| 网络安全风险 | 已发布模型中最强,仍处于 Frontier Compliance Framework 低风险等级 |
| 关键越狱证据 | 未发现严重越狱证据,外部红队测试未发现严重漏洞 |
| Prompt 注入防御 | 当前最强模型,外部 Prompt 注入基准表现最佳 |
来源:Anthropic System Card(https://www.anthropic.com/claude-fable-and-mythos-5-1)
十一、开发者决策框架
11.1 何时使用 Fable 5.1?
推荐使用 Fable 5.1 的场景:
+ 多步骤、长周期的 Agent 任务(数小时到数天)
+ 科研数据分析、实验设计
+ 大型代码库重构、代码审查
+ 高上下文复用的对话系统
不推荐使用 Fable 5.1 的场景:
- 单轮简单问答 → 使用 Opus 5 或 Sonnet 5
- 对延迟敏感的生产环境 → 评估是否值得额外成本
- 短上下文无缓存的调用 → 成本可能反而更高
11.2 成本优化策略
成本优化优先级:
1. 启用 Prompt Caching(最有效)
2. 选择合适的推理等级(Low/Medium 处理简单任务)
3. 使用批处理 API(输入省 50%,输出省 50%)
4. 控制输出长度(输出 $50/M 是主要成本)
11.3 迁移检查清单
- 搜索
tool_choice参数,移除any和tool设置 - 检查多模型对话链路中的 thinking block 兼容性
- 排查编辑历史消息的调用路径
- 评估缓存命中率,确定实际节省
- 配置安全护栏回退策略
- 检查数据保留策略(30天 vs EFS/ZDR)
十二、结语
Claude Fable 5.1 和 Mythos 5.1 的发布,标志着 AI 模型的能力边界正从"辅助工具"迈向"亲自执行"。金星地形建图、蛋白质设计、GPU 核函数手写——三个案例共同指向一个明确的趋势:AI 可以作为一线科研执行者,而不只是信息检索工具。
对开发者而言,缓存读取降价 75% 是部署长上下文 Agent 任务的直接利好。对科研机构而言,Mythos 5.1 的限制性开放意味着这一轮红利仍处于早期。但无论你站在哪个角色,Fable 5.1 都已经用数据证明了一件事:长周期、多步骤的 AI 任务,终于迎来了真正的"可用"时刻。
回顾整个发布,我们可以看到几个清晰的信号:
- 缓存成本是 Agent 落地的关键瓶颈——Anthropic 选择在这个点上降价,说明他们意识到了 Agent 工作负载的特殊性
- 科研能力是下一代模型的主战场——Terminal-Bench-Science 的翻倍表现说明 AI 在科学研究中的角色正在从"辅助"变为"主导"
- 安全与能力的平衡仍在探索中——Mythos 5.1 的限制性开放和 Fable 5.1 的护栏调整,都说明安全是一个动态平衡的过程
对于开发者来说,现在就是最佳实践时机——开启缓存、选对推理等级、确认 API 兼容性,然后让你的 Agent 跑起来。
参考来源
Anthropic 官方发布页 — Claude Fable 5.1 and Mythos 5.1 https://www.anthropic.com/claude-fable-and-mythos-5-1
Anthropic 官方 System Card(2026年9月1日) https://www.anthropic.com/claude-fable-and-mythos-5-1
CSDN 技术解读 — Fable 5.1 技术解读:长周期任务跑分翻倍、缓存成本砍75% https://blog.csdn.net/viopark/article/details/164295257
51CTO 实测 — Claude Fable 5.1 降价 25%,缓存读取便宜 75% https://www.51cto.com/article/854740.html
MarkTechPost 技术解读 — Anthropic Releases Claude Fable 5.1 and Claude Mythos 5.1 https://www.marktechpost.com/2026/09/01/anthropic-releases-claude-fable-5-1-and-claude-mythos-5-1-52-6-on-terminal-bench-science-and-75-cheaper-cache-reads/
AI Future Front — Anthropic Debuts Claude Fable 5.1 and Mythos 5.1 With Split Safeguards https://aifuturefront.com/anthropic-debuts-claude-fable-5-1-and-mythos-5-1-with-split-safeguards/
TeachAI Tools — 75% Cut in Prompt Cache Costs Changes AI Agent Economics https://teachaitools.blog/blog/claude-fable-51-mythos-51-prompt-cache-cost-cut-2026
Apidog — How to Use the Claude Fable 5.1 API https://apidog.com/blog/claude-fable-5-1-api/
Devlery — Claude Fable 5.1 Ships With Identical Input and Output Prices https://devlery.com/en/blog/claude-fable-5-1-cache-read-price
博客园 — 刚刚!最强模型Claude Fable 5.1 发布 https://www.cnblogs.com/vibecodinghuanzhe/p/22802642
亚马逊 AWS 官方博客 — Introducing Claude Fable 5.1 on AWS https://aws.amazon.com/blogs/machine-learning/introducing-claude-fable-5-1-on-aws/
Vercel AI Gateway — Claude Fable 5.1 now available https://vercel.com/changelog/claude-fable-5-1-now-available-on-ai-gateway
Yomimono — Anthropic Releases Claude Fable 5.1 and Claude Mythos 5.1 https://yomimono.id/anthropic-releases-claude-fable-5-1-and-claude-mythos-5-1
十三、与竞品对比:Fable 5.1 在模型生态中的定位
为了更全面地理解 Fable 5.1 的价值,我们需要将其放在整个大模型生态中来看。与 OpenAI 的 GPT-5.6 Sol、Google 的 Gemini 3.0 Ultra 以及 Anthropic 自家的 Opus 5 相比,Fable 5.1 的定位非常清晰——它不是"全能型"模型,而是"长周期任务专项型"模型。
13.1 横向对比矩阵
| 维度 | Fable 5.1 | Opus 5 | GPT-5.6 Sol | 优势方 |
|---|---|---|---|---|
| 科研长链路 | 52.6% | 29.0% | 22.4% | Fable 5.1 |
| 代码工程 | 55.8% | 52.3% | 37.3% | Fable 5.1 |
| 多语言代码 | 89.1% | 89.5% | — | Opus 5 |
| 多模态代码 | 54.7% | 59.4% | — | Opus 5 |
| 抽象推理 (ARC-AGI-2) | 90.0% | 90.42% | 92.5% | GPT-5.6 Sol |
| 成本效率 (长上下文) | 极高 | 中等 | 中等 | Fable 5.1 |
| 成本效率 (短上下文) | 低 | 高 | 高 | Opus 5 |
13.2 选型建议
从以上对比可以看出,Fable 5.1 并非在所有任务上都领先。Anthropic 的官方文档也明确建议:大多数工作负载应该从 Opus 5 开始,只有当 Opus 5 在 xhigh 或 max 推理等级下仍然不够用时,才升级到 Fable 5.1。这个建议非常务实——Fable 5.1 的优势在于长周期任务,而不是全能任务。
在实际选型时,可以参考以下决策树:
- 任务是否涉及多步骤、长周期(>10 轮交互或 >1 小时执行)?→ 是 → Fable 5.1
- 任务是否需要高上下文复用(缓存命中率 >50%)?→ 是 → Fable 5.1
- 任务是否对延迟敏感(<5 秒响应)?→ 是 → Opus 5 或 Sonnet 5
- 任务是否涉及多模态输入(图片、视频)?→ 是 → Opus 5
- 其他情况 → 默认 Opus 5,按需升级
来源:Anthropic 官方发布(https://www.anthropic.com/claude-fable-and-mythos-5-1)及第三方分析(https://mer.vin/news/claude-fable-5-1-and-claude-mythos-5-1-anthropics-new-model-family/)