粒子物理里的“九环”听上去像一个抽象数字,对研究者却意味着极其繁重的公式推导与计算。9月25日,物理学家兼科学作者Matt von Hippel在Anthropic网站发表客座文章,讲述两名Anthropic物理学家如何借助Claude Science,完成平面N=4超杨—米尔斯理论中六粒子振幅的九环计算。此前相关工作已推进到八环,九环结果由其他领域专家核对。故事最有新闻感的一点,不是模型凭空发明了新的物理定律,而是它沿着已有方法,跨过了研究者原本认为十分昂贵的计算门槛。
必须先说明研究对象。散射振幅帮助物理学家预测粒子相互作用的概率,计算越精细,越有利于将理论与实验比较。“环数”是近似计算复杂程度的一种标记,环数增加通常带来组合与计算负担的急剧上升。但这次用来挑战AI的是N=4超杨—米尔斯这一便于检验方法的特殊理论,而不是直接描述现实世界全部粒子的模型。不能把九环结果写成“AI发现暗物质”或“解决标准模型难题”。它证明的是一类前沿理论计算可以被新工作流推进。
一道公开挑战,Claude怎样交出结果
Matt von Hippel此前向AI公司提出挑战:在学界可负担的计算资源范围内,把某些散射振幅问题推到更高环数。Anthropic的Liam Fitzpatrick和Siddharth Mishra-Sharma选择了其中一道,使用Claude Science这一围绕模型配置规则与提示的科研工作环境。客座文章描述,他们给系统的核心任务很直接:计算平面N=4超杨—米尔斯理论的六粒子、九环振幅,并让它在较长时间内持续工作、定期汇报。随后研究人员与已有领域专家核验结果。这里的“持续工作”并非完全没有人设定问题或检验答案,更不能理解成任何人随手输入一句话就能稳定得到可信的新论文。
这项计算有两条路径。一条是领域内已有的bootstrap方法:先写出答案可能具有的结构,再逐项加入理论约束、已知关系和一致性条件,排除不成立的可能。另一条利用与form factor相关的间接路径。文章称两条路径最终给出了同一结果。多路径一致是重要的交叉检查,但科学结论仍要靠独立复核、可复现的计算和正式研究写作站稳脚跟。客座作者也强调,相关人类研究团队会负责发表、解释和分析这些结果,模型本身不是研究共同体的替身。
成本同样需要完整读。文章估计,任一计算路径对终端使用者的模型调用成本约为一两千美元;其中bootstrap路径还用了约96颗CPU运行一周,相关计算预算约100美元。不要把“一两千美元”误读成整个科研项目的全部成本,也不要把“96颗CPU一周”省略成笔记本电脑瞬间算完。对有明确目标、可自动化约束和可核验答案的问题而言,这一成本可能具有吸引力;对缺少检验标准的开放课题,则不能直接照搬。
令人意外的还有人类研究的进度。客座作者写道,在听到Anthropic结果后不久,他得知另一组研究人员也已完成结果的大部分工作,并使用了不同形式的AI辅助。这意味着不能说“人类多年毫无头绪,只有Claude第一次找到答案”。更准确的说法是,Claude Science在一个本已接近突破的专业问题上,展示了持续编码、运行、纠错和利用现有知识的能力。它可能缩短了从已知方法到高环结果的距离,但不等于独占科学发现。
从“会答题”到“会做研究”,差距还在哪里
这个案例有意思,恰恰因为它没有神话色彩。研究者先选了一个定义清晰、现成工具较成熟、结果能由专家检验的任务。模型在这种条件下表现出色,说明科研AI的一条实际路线是成为耐心的计算合作者:读懂任务,编排程序,持续运行,在中间结果出错时调整,再留下足够清楚的材料给专家审阅。这里的价值不只在最后一行公式,也在减少人类为繁琐计算和工程细节投入的时间。
但从特殊理论走向真实实验预测,还有几道不能跳过的坎。现实问题可能没有那么干净的数学结构,数据带有测量误差,新的结果还可能缺少独立检验手段。即使两套算法给出相同答案,也需要判断它们是否共享了同一错误假设。研究人员还要明确哪些选择由人提出、哪些步骤由系统完成、算力和软件版本是什么,以便其他团队复现。没有这些,漂亮的演示很难沉淀为可积累的科学知识。
客座作者最后并没有声称自己因此得到关于“通用人工智能”的答案。他看到的是一块此前被低估的低垂果实:一些被视作超出常规计算资源的任务,可能只是需要更好的软件工程和更持久的自动化。对AI行业来说,这是比一句“模型超越物理学家”更值得认真对待的结论。九环计算说明,在问题边界、验证路径和研究责任都明确时,模型能够把科研工作向前推一步;至于它能否在更不规则、更贴近实验的物理问题上重复这一表现,还需要下一批公开、可复核的案例。












