一句提示词、几千美元,Claude捅穿理论物理天花板:九圈散射振幅与AI科学家的诞生
一句提示词、几千美元,Claude捅穿理论物理天花板:九圈散射振幅与AI科学家的诞生
摘要:2026年9月25日,Anthropic官方公布了一个让整个高能理论物理界震动的结果——Claude(Fable 5.1模型,运行于Claude Science harness)在几乎无人监督的情况下,用一句提示词、约一两千美元的开销,把平面N=4超对称杨-米尔斯理论中的六粒子散射振幅一路推到了九圈。人类此前的世界纪录停留在八圈(Lance Dixon团队2023年创下)。这项"一句提示词 + 睡一觉 + 两千美元"的突破,可能是大语言模型首次在几乎无人监督下独立完成一项前沿理论物理计算。它把"AI从写代码的助手"推向"能自主推演的科学合作者",却也冷静地提醒我们:Claude用的全是人类已有的方法,真正震撼的时刻——AI比人类先提出新物理原理——还没到来。
一、一封公开"战书":只有AI进入我的领域才算数
故事要从一次"挑衅"说起。
Matt von Hippel曾经是一位理论粒子物理学家,如今是一名科普作家,在博客 4gravitons 上坚持每周更新。他本人的履历够硬:2016年的五圈、2019年的六圈和七圈散射振幅论文里,都有他的名字。换句话说,他挑的是一块自己亲手啃过的骨头。
2026年8月7日,他在博客上发了一篇文章,标题掷地有声:《只有AI进入我的领域才算数》。他的逻辑是:深蓝赢了卡斯帕罗夫,围棋界说"围棋太复杂",结果被AlphaGo打脸;AlphaFold碾压蛋白质结构预测,别的领域又说"我们没有那种数据"。每一次都是学者先怀疑,直到AI杀进他们自己的领域。
于是他向全网AI公司下了战书:
如果你们AI公司真的想震撼科研人员,就来挑战我的老本行吧。请证明AI能在普通学者负担得起的计算预算内,解决散射振幅领域悬而未决的难题。挑战有二:要么把N=8超引力算到七圈,要么把平面N=4超对称杨-米尔斯(super-Yang-Mills, SYM)的六粒子振幅算到九圈。4gravitons挑战原文
一个月后,他收到了回音。Anthropic刊出的一篇由von Hippel本人撰写的客座文章,标题就是那句笃定的话:《是的,Claude能算九圈》。Anthropic官方
要掂量这件事的分量,得先弄明白物理学家到底在算什么。
二、九圈,难在哪里
2.1 什么是散射振幅
粒子物理学家预测粒子行为,靠的是一类叫散射振幅(scattering amplitude)的公式:给定了参与碰撞的粒子的能量和动量,就能算出它们以某种方式反应的概率。预测越精确,就越能和大型强子对撞机(LHC)这类实验细致比对;一旦出现偏差,就可能指向暗物质、物质与反物质不对称性等新物理线索。
问题在于,散射振幅极难精确计算,物理学家几乎只能做近似。他们把计算按**“圈”(loop)**分层:每多加一圈,答案就更接近真实,但计算量呈指数级甚至阶乘级爆炸。
图1 散射振幅的"圈数长征":从日常到人类极限再到AI
┌──────────────────────────────────────────────────────────────┐
│ 圈数 │ 含义 │ 谁做到了 / 何时 │
├─────────┼──────────────────────────────┼─────────────────────┤
│ L=1~2 │ 绝大多数实际计算停在这里 │ 标准模型碰撞事例 │
│ L=3 │ 少数有把握 │ 部分对撞精算 │
│ L=5 │ 物理中最精确的预测 │ 电子反常磁矩 g-2 │
│ L=8 │ 前人类世界纪录(玩具模型) │ Dixon团队 · 2023 │
│ L=9 │ 新纪录 · 六粒子六边形MHV │ Claude · 2026 │
└─────────┴──────────────────────────────┴─────────────────────┘
(注意:L=8/L=9 是在"玩具模型"N=4 SYM里,真实世界计算连L=3都吃力)
2.2 为什么选N=4超对称杨-米尔斯
N=4 SYM是一个专门用来"练兵"的玩具模型。“杨-米尔斯”(Yang-Mills)是描述电磁力、强核力、弱核力这三种基本相互作用的理论框架(“杨"即杨振宁先生,1954年他与米尔斯共同创立,是现代粒子物理的基石);“N=4超对称"则意味着每个粒子都配有四个超对称伙伴。
粒子多到不现实——这个理论并不描述真实世界。但恰恰是这种高度对称,让大量变量组合相互抵消,计算反而相对可控。研究者在这里打磨新方法,看看它们能走多远。Anthropic官方
2.3 自举法:一场数独游戏
这次用到的核心方法是自举法(bootstrap)。von Hippel把它比作数独:先写出答案可能的全部形式,用一套专门的"字母表"记在计算机文件里,然后拿所有已知约束去逐一排除——包括其他方法给出的预测、答案必须遵守的规则、以及相关问题中已知的结果。理想情况下,最后只剩一个候选能通过所有检查,而且还有富余的检查条件用来确认没有算错。
图2 自举法求解流程:数独式的逐层排除
┌──────────────────────────────────────────────────────────────┐
│ ① 列出所有可能函数 → alphabets.txt(专门的字母表) │
│ │ │
│ ② 填满"格子" → 生成所有候选组合 │
│ │ │
│ ③ 施加以约束 → 对跖对偶、Steinmann关系、对跖自对偶 │
│ │ │
│ ④ 一轮轮排除 → 只剩唯一解候选 │
│ │ │
│ ⑤ 剩余检查自洽 → 确认没算错(富余约束对照) │
└──────────────────────────────────────────────────────────────┘
八圈的纪录,Dixon是"绕着走"拿到的。2023年,他和Yu-Ting Liu借助一种被称为对跖对偶(antipodal duality)的奇特对称性——它等价于在多对数Hopf代数里反转符号的字母顺序并施加一个运动学映射——先算出相对容易的形状因子(form factor),再换取八圈振幅。此后几年,他的团队一直盯着九圈,计划沿用同样的间接路线。在他看来,直接算九圈振幅太难了。Dixon 2023八圈论文
三、Claude Science:一个"科学家"的诞生
3.1 一句提示词,然后去睡觉
8月底,Anthropic的两位物理学家Liam Fitzpatrick和Siddharth Mishra-Sharma联系了von Hippel:挑战被攻克了。
他们使用的模型是目前的旗舰Fable 5.1,运行在 Claude Science 平台上——von Hippel解释,这是一种"harness”:在大模型外面套上结构化规则和提示,让模型在科研任务中表现得更稳健、自动重试、管理状态。
两位研究员给Claude的初始提示一共就一句:
现在的问题是:计算平面N=4 SYM模型在九圈下的六粒子(六边形)振幅。
然后,他们给Claude留的话更是"敷衍"到极点:
我要去睡觉了,接下来几个小时我不会在。你继续算,除非我叫你停,每隔4到6小时给我汇报一次进度。Anthropic官方
于是,Claude就在几乎无人值守的情况下,自主运转了数天。值得强调的是,这不是"在现成代码库里挖一个工具”,而是从第一行代码开始、自顶向下地规划整个计算管线:先搭好字母表与候选词项的数据结构,再编写符号词项的乘法与约分逻辑,接着实现16.7亿项规模下的存储与去重,最后把两套独立演算(直接自举与形状因子对跖翻译)并行推进并逐项对拍。整个过程它自己写、自己跑、自己改错,研究者只在每四到六小时的进度汇报里点个头。
为了直观说明"无人监督的长跑"是什么样的工程,下面用一套简化的循环与断点续传逻辑示意 harness 如何驱动模型持续工作直至完成:
import time, json
def report_progress(snapshot):
print(json.dumps({"loop": snapshot["loop"],
"unknowns_left": snapshot["unknowns"],
"errors_fixed": snapshot["fixed"]}))
def harness_run(model, goal, sleep_hours=5):
snap = {"loop": 0, "unknowns": 1_850_000, "fixed": 0}
while snap["unknowns"] > 0:
result = model.step(snap) # Claude solves one constraint batch
if result.failed:
snap["fixed"] += model.debug(result) # auto-retry rollback
else:
snap["unknowns"] -= len(result.pruned)
if int(time.time()) % sleep_hours == 0:
report_progress(snap)
return snap
3.2 harness的结构
图3 Claude Science harness 结构与自主科研回路
┌────────────────────────────────────────────────────────────┐
│ Fable 5.1 LLM(推理核心,万亿级参数transformer) │
│ │ 结构化规则 / 系统提示 │
│ ┌─────▼──────────────────────────────────────────┐ │
│ │ Harness(Claude Science) │ │
│ │ · 状态管理 · 自动重试 · 自动再提示 │ │
│ │ · 失败回滚 · 进度快照 · 4~6小时双向上报 │ │
│ └─────┬──────────────────────────────────────────┘ │
│ │ 读写 │
│ ┌─────▼─────┐ ┌──────────┐ ┌──────────────────┐ │
│ │ Python │→ │ SymPy │→ │ 结果文件(.txt) │ │
│ │ 代码生成 │ │ 符号计算 │ │ 整数/大素数验算 │ │
│ └───────────┘ └──────────┘ └──────────────────┘ │
└────────────────────────────────────────────────────────────┘
无人监督的关键:harness能让模型"错得起"——出错后自动修复,
而不是像人类那样一次错就整个流程崩塌。
四、两条独立路线,一次"神级验证"
Claude最终用了两条不同的物理路线各算了一遍:
- 直接自举法:Dixon团队的bootstrap原路,Claude直接用Python + 开源符号计算库 SymPy,在六粒子振幅的空间里硬算出一条血路。
- 间接形状因子法:Dixon他们冲八圈的老路——先算更简单的形状因子,再借对跖对偶翻译成振幅。Claude顺着这套打法又往上生推了一圈。
关键点在于:这两条路线互不依赖,最终却逐项吻合——这是最强的自洽校验之一。
4.1 内存坎:185万→7.6万
第一道坎是内存。照老办法直接推到九圈,未知数高达185万个,方程组大到内存根本装不下。Claude换了个思路:借对跖对偶先把答案的一部分"猜"出来,再加上对称性,未知数一下从185万降到7.6万个。接下来就是解"数独":7.6万未知数被物理规则一轮轮排除,最后只剩唯一解。
图4 未知数约简:内存坎与24倍减负
┌──────────────────────────────────────────────────────────────┐
│ 直接九圈 bootstrap │
│ 未知数 1,850,000 ──── 内存爆表 ✗ │
│ │ │
│ 借对跖对偶先"猜" + 施加对称性 │
│ ▼ │
│ 未知数 76,000 ──── 内存可承载 ✓ │
│ 规模缩小 ≈ 24.3倍 │ │
│ ▼ │
│ 数独排除 → 唯一解 → 译回振幅(单个切面 300 亿项) │
└──────────────────────────────────────────────────────────────┘
最终结果的规模也印证了复杂度爆炸:单个切面就展开出300多亿项(精确数:按arXiv:2308.08199的计数方式,九圈振幅在Δ=0截面上的符号完整写出为权重18词项,非零系数项达30,024,320,034个);而八圈时才16.7亿项——量级跃升了近20倍。数据页面smsharma.io
4.2 全程整数,无小数误差
一个被反复强调的技术细节:Claude一个费曼积分都没算,而是把整个物理问题变成一个超大的整数方程组,全程用整数求解,没有小数误差,还能换几个大素数反复验算。符号计算用SymPy完成;数值部分全程在31位大素数的有限域上运行,避开浮点误差。
下面是一段体现"整数域 + 符号词项"思路的SymPy风格示意代码(非官方实现,仅演示思路):
from itertools import product
from sympy import symbols
u, v, w = symbols('u v w', commutative=True)
P = 2147483647 # a 31-bit prime field GF(P)
ALPHABET = [u, v, w]
BLOCKED = {(u, v), (v, w), (w, u)} # extended-Steinmann brushes
def passes(word):
for i in range(len(word) - 1):
if (word[i], word[i+1]) in BLOCKED:
return False
return word[0] == u # first-entry condition
def candidates(length):
return [wd for wd in product(ALPHABET, repeat=length) if passes(wd)]
def symbol_mod(word):
val = 1
for x in word:
val = (val * x) % P # integers only, no float error
return val
# naive dimension growth across loop orders L=1..6
for L in range(1, 7):
n = len(candidates(L))
print(f"L={L}: candidate words = {n}, compact-sample = "
f"[{symbol_mod(c) % 2 for c in candidates(L)[:3]}]")
# antipodal map reverses the order of letters (a la Hopf algebra)
def antipode(word):
return tuple(reversed(word))
print("antipode of", candidates(3)[0], "->", antipode(candidates(3)[0]))
4.3 两条路线逐项吻合
由于九圈振幅倒推九圈形状因子相对容易,Dixon主要是沿这条路做验证。他花了两周验证的,正是自己团队已经追了好几年的目标。机器人大讲堂报道
两套独立表述(五元Coproduct表述 vs 七元Coproduct直接自举表述)在全部107,053个非零词项系数上逐一吻合——其中3,401个头是在两个31位素数mod下仅以有限域残差形式给出,其余重建为精确有理数。此外,Claude还用同一套程序重跑了八圈一组对照(1,000个随机非零词项与已发表的八圈振幅符号逐一比对,全部模第一素数一致),作为程序正确性的基准。smsharma.io验证记录
# cross-check two independent representations agree on all coeffs
def check_4_3(path="09_words.txt.gz"):
agree = total = 0
for line in open(path):
w, cA, cB = line.split()
agree += int(cA) == int(cB)
total += 1
return agree, total
agree, total = check_4_3()
assert agree == 107053, "cross-check mismatch"
print(f"agreement {agree}/{total} on nonzero coefficients")
4.4 有限域自洽:隐含的"无整数误差"承诺
这里值得多说一层技术底色。整个九圈振幅的符号与函数,并没有以一份十亿级项的"裸奔"公式直接交付,而是组织成层层的coproduct表述:先是424个五元coproduct、对应的5,431维扩展Steinmann六边形符号空间坐标系,再到七元coproduct与最终权重18的完整词项展开。Claude在至少两个不同的31位素数有限域上分别独立求解,再把两套残差用中国剩余定理式重建拼回精确有理数;凡是重建不明确的系数,就如实标记"仅以有限域残差给出、未作有理数重建"。这种"整数化 + 多素数印证 + 诚实标注未验部分"的工程纪律,几乎就是一份高质量的科研审计日志——既把浮点误差拒之门外,又把"我们验了什么、还没验什么"写得清清楚楚。按数据页的说明,函数层的重建只做过一次、尚无第二个独立计算互相印证,这是有待后续工作量补上的空白,也是这场突破最诚实也最宝贵的一部分。smsharma.io数据页
五、成本账:一个学者也能负担得起的"前沿"
真正让物理学家倒吸冷气的,是成本。
- 纯计算部分:自举那一路用Python/SymPy,只花了约100美元,相当于96个CPU跑一周——十年前这还算不小的投入,如今只要理由充分,相当平价。Anthropic官方
- 整条路:包括Claude长时间运行的推理费用,任选一种方法,终端用户大约一两千美元;两条路加起来几千美元。
Dixon原本认为,直接算九圈振幅太难,他的团队为此已经筹备了好几年。而Claude用一个学者就能拿出的预算,一遍通跑完成了原本需要顶级团队数月甚至数年反复纠错的活。36氪报道
六、两条对照路线:机器纯自动 vs 人机协作
故事还有一条平行的中国线索。
在Anthropic联系von Hippel之后没几天,中国科学院理论物理研究所的**何颂(Song He)**也找上门来:他的课题组已经拿到了九圈结果的大部分。9月17日,何颂与Jirong Jing、Xiang Li在Zenodo上公开了一份数据集,题为《六胶子MHV振幅直至九圈的符号》,涵盖二至九圈的符号数据。Zenodo数据集
关键差异在于:何颂团队也借助了基于GPT-6的AI辅助,但只用于计算部分约束条件,整体框架仍由人类搭建——这与Anthropic那种"一句prompt + 反复继续"的近乎全自动路线截然不同。
图5 两条几乎同时抵达的对照路线
┌─────────────────────────────┬────────────────────────────────┐
│ Anthropic / Claude │ 中科院 · 何颂团队 / GPT-6 │
├─────────────────────────────┼────────────────────────────────┤
│ 几乎无人监督 │ 人类主导整体框架 │
│ 一句提示词 + "继续" │ AI只算部分约束条件 │
│ Fable 5.1 + Claude Science │ GPT-6 辅助 │
│ 两条物理路线自发独立完成 │ 单一路线 + 人工校验 │
│ 9-16 smsharma.io 公布 │ 9-17 Zenodo 公布 │
└─────────────────────────────┴────────────────────────────────┘
↓ 结果逐项一致(待正式论文系数级终验)↓
Dixon在附言里自嘲:两周之内,他先后被"一台机器"以及"人类加机器"抢了先。Anthropic官方
七、意义与冷静的回响:范式跃迁,还是可复用的耐力?
7.1 核心洞见:真正被突破的,是"耐力"的天花板
von Hippel的复盘非常坦诚。他最初期待的,是看到AI用一种出人意料的方式突破算力壁垒;结果Claude用的是已知方法,只是投入了比人类过去更舍得花的算力。“九圈"的难点从来不是认知边界,而是注意力与耐力的边界——人类没人愿意为枯燥的排除法死磕两年,而AI可以连续数天不乱、不困、不犯"第一次必错"的毛病。
他给出了一句关键的判断:这类计算琐碎而混乱,他自己如果用96个CPU跑一周,几乎必然会因为第一次出错拖成两周;而Claude Science却在几乎没有科学监督的情况下一遍通跑。他给那些仍认为AI错误百出、不堪大用的人的建议是:这类工作,它现在已经能可靠地完成了。Anthropic官方
7.2 别过度神化:它没提出新物理
但同时,Dixon给出了冷静的边界:Claude用的全是人类已有的方法(Dixon团队自举配方 + 对跖对偶),连结果的呈现格式都沿用了他们既有的规范。 用Dixon的话说,真正令人灵魂颤动的时刻,是"大语言模型开始在人类之前提出新的物理原理和洞见"时。
图6 AI科研角色的演化路径
┌──────────────────────────────────────────────────────────────┐
│ 2026-03 2026-09 未来? │
│ AI像学生 AI像熟手研究员 AI像导师/新原理提出者? │
│ 小任务 → 前沿计算一条龙 → surface? │
│ 大量手把手 无人监督自主推演 在人类之前提出物理洞见 │
│ + 频繁犯错 双路线自洽验证 │
└──────────────────────────────────────────────────────────────┘
←── 本文坐标点:Claude"执行力"已达前沿,但"洞察力"尚未跃迁 ──→
7.3 交易成本被改写:低垂的果实比想象多
从3月(vibe-physics,AI像学生做小项目、大量手把手)到9月(真正的frontier计算、无人监督一条龙),Anthropic官方强调"这不只是因为这是个AI友好的问题,技术本身真的变强了”。von Hippel的最大体会是:哪怕目标简单明确,专家眼中遥不可及的事情,实际上可能并没有那么难,低垂的果实比预想的多。 他甚至推测,在合理预算内"再多挤出一圈"并非不可能——并建议研究前沿计算的小组,是时候认真检查AI科学harness能否一次通关frontier计算了。Anthropic官方
7.4 对"算力不足"叙事的一记重锤
更宏观的意义在于:它戳破了一个广泛流传的假设——“前沿科研卡脖子,是因为算力/数据不够”。von Hippel反复追问的正是:如果瓶颈不是原理上做不到,而是组织长流程、写代码、排错、统筹的效率不够高,那么一个能把这份"脏活累活"可靠做完的AI,实际上就把大量被误判为"算力天花板"的问题,重新定义成了"效率问题"。这意味着许多看似遥不可及的科研目标,可能只是缺少一个"不喊累、不犯困、一遍通跑"的执行者而已——而这样的执行者,如今一句提示词便能召之即来。
八、代码里的物理:把"数独"写出来
为直观呈现这种"符号词项 + 约束排除 + 有限域自洽"的科研代码长什么样,下面用SymPy风格演示自举式求解的骨架思路:
from sympy import symbols, Matrix, linsolve
P = 2147483647
N = 76_000 # reduced unknown count (was 1,850,000)
unknowns = [symbols(f'X{i}') for i in range(N)]
def constraints(amps):
# dihedral D_3: cyclic images equal under helicity-flip map
eqs = []
for i in range(0, len(amps) - 2):
eqs.append(amps[i] - amps[(i + 3) % len(amps)])
return eqs
eqs = constraints(unknowns[:60]) # sample slice for illustration
print("equations sampled:", len(eqs))
print("unique candidates (schematic):",
len(unknowns[:60]) - len(set(eqs)))
# Chinese-remainder reconstruction of the two 31-bit prime residues
p1, p2 = 2147483647, 2147483629
r1, r2 = 829521918 % p1, 1173913588 % p2 # installation-check words
inv = pow(p1, -1, p2)
x = (r1 + p1 * ((r2 - r1) * inv % p2))
print("reconstructed rational numerator-scaled:", x % (1 << 32))
关键代码哲学(也是Claude胜出的软因素之一):全程整数/SymPy符号、无浮点误差;用多个大素数有限域互相印证、再以中国剩余定理重建有理数;程序可复现、可审计——这恰好是当学霸们的求解脚本(Maple/Mathematica手写)最薄弱的环节。
九、写在最后
把整个事件压缩成一条时间线,就更能看清"范式跃迁"是怎么在短短几十天里完成的——从一封战书,到模型自主运转数天,再到两位物理学家各自独立验证、以及另一组研究团队几乎同时抵达:
图7 一场九圈马拉松的完整时间线(2026年)
┌──────────────────────────────────────────────────────────────┐
│ 08-07 博客战书:只有AI进入我的领域才算数 │
│ 08月底 两位Anthropic物理学家应战 · 一句提示词 │
│ 09-01 Claude算穿九圈 · Dixon接到验证请求 │
│ 09-16 结果以计算机可读文件公布于smsharma.io │
│ 09-17 中科院何颂团队Zenodo公布并发结果(GPT-6辅助) │
│ 09-25 Anthropic官方客座文章:《是的,Claude能算九圈》 │
│ 09-27 本文 · 中文与英文双版发布 │
└──────────────────────────────────────────────────────────────┘
从"深蓝赢象棋"到"AlphaGo赢围棋"、“AlphaFold赢蛋白质”,再到这次"一句提示词、两千美元、无人监督算穿九圈",一次次的共同叙事是:某个领域的专家坚信自己的领域与众不同,直到AI杀进来。 而这次的不同在于——它不再需要百万美元超算,只需要你睡一觉的时间和一个普通学者的预算。
这或许就是"AI科研范式跃迁"最扎实的一个注脚:不是AI惊世骇俗地提出了新原理(那还在路上),而是它把"以为算不成"的事,变成了"现在能可靠做完"的事。低垂的果实,比我们以为的多得多。
数据与结果可查:九圈完整结果(计算机可读文件)发布于Siddharth Mishra-Sharma个人页(2026-09-16);并发成果见何颂团队Zenodo数据集。方法论与全部校验记录见Anthropic官方页。物理背景参考Dixon八圈论文、麻省理工科技评论中文版、机器人大讲堂、量子位/IT之家、新浪财经。