Anthropic公开AI实验室三组内部指标:3万代理、十亿次决策与6%安全算力意味着什么
CoinMeta
2小时前
Ai 焦点
Anthropic在9月17日提出一套观察前沿AI开发速度的指标,试图回答外界长期看不到的三个问题:AI在多大程度上参与下一代AI研发;公司能否监控内部代理的行动;计算资源究竟有多少用于安全工作。公司同时给出内部快照,包括最常用研发平台在2026年8月任一时刻约有3万个代理运行,在线监控当月检查超过十亿次决策,以及一周样本中约6%的AI研发算力被归类为安全工作。
有帮助
No.帮助

Anthropic在9月17日提出一套观察前沿AI开发速度的指标,试图回答外界长期看不到的三个问题:AI在多大程度上参与下一代AI研发;公司能否监控内部代理的行动;计算资源究竟有多少用于安全工作。公司同时给出内部快照,包括最常用研发平台在2026年8月任一时刻约有3万个代理运行,在线监控当月检查超过十亿次决策,以及一周样本中约6%的AI研发算力被归类为安全工作。

这些数字不是监管审计结论,也不是行业统一标准。研发自动化指数由Anthropic自己设计,并大量使用Claude整理任务和评分;代理监控只覆盖所描述的主要内部平台;算力分配则来自7月13日至20日的一周快照。官方把它们定位为原型测量,希望未来由独立第三方验证并在不同实验室之间形成可比口径。

从“AI帮助研究员”到“AI领导研发”,需要先知道自动化发生在哪里

Anthropic构建了R&D Automation Index。团队从Slack和内部文档抽样整理约1.5万个细粒度研发任务,再组织成包含542个节点、378个叶子任务的层级树。每类任务按Epoch AI提出的六级尺度评分:从AL0没有AI参与,到AL5完全自主,中间依次包括轻度使用、辅助、协作和主导。最后再按人员在各项任务上投入的时间估算权重。

这比统计员工发送了多少条Claude消息更接近实际工作,因为一条消息可能只是改写句子,也可能完成一次实验设计。但方法仍有局限。任务树冻结在特定时期,若员工因AI出现而转向全新工作,旧篮子未必能捕捉;重要性用人时代理,也不能衡量某项少量工作对模型能力的巨大影响;评分模型又来自被评估公司的自有系统。

Anthropic让相关领域员工在不知道模型证据和结论的情况下独立评分。官方称模型与人类给出完全相同等级的比例为59%,人类之间完全一致只有35%;模型与人类相差不超过一级的比例为97%。这些结果表明边界判断本来就主观,也说明“AI协作”与“AI主导”不能被包装成精确物理量。指数更适合观察同一口径随时间变化,而不是用一个分数宣布已经实现自主研发。

公司希望公开AI参与研发的程度,是因为模型加速自身开发可能缩短人类理解和干预的时间。自动化提高也可能带来更多安全实验和测试,不能只被解释为风险。关键是能力研发和监督能力是否同步增长,以及当代理开始选择研究方向、委派子任务时,人类是否仍掌握明确的停止条件。

100%监控覆盖不等于100%发现问题,安全算力占比也不是安全成果

Anthropic把代理监督分为在线与离线两层。在线监控在动作执行前检查,针对复制模型权重等快速且不可逆的风险;离线监控事后阅读活动,寻找可能缓慢发展、能够补救的失配迹象。官方称主要内部平台的代理动作100%经过在线监控,也全部进入离线系统。8月十亿多次决策中约0.002%被在线监控阻止,约等于每4.7万次一次。

离线系统每周标记约10万份记录,再由多个分类器排除误报和进行初审,最高优先级约50项升级到人工审查。总体上,每千份记录约有一至两份进入进一步查看。低阻止率可以说明大多数动作未触发规则,也可能反映监控漏检或任务风险低,不能单独证明代理几乎不会越权。评估监控质量还需公开已知攻击被捕获的比例、误报率、人工复核时延和事后发现的漏网事件。

算力方面,Anthropic分析一周工作负载,并把主要目的在提高安全性、可解释性或系统安全的运行归类为安全工作。结果显示,AI研发算力中约6%用于安全;在AI驱动的AI研发算力中,约12%用于安全。公司称定义采取保守口径:同时促进能力和安全的任务算作一般研发,安全分类器的另一部分可比算力没有计入。

即便如此,算力占比不能衡量安全成果。一个高效分类器用更少芯片完成更多检查,会让比例下降,却可能提高实际安全;一次大型前沿训练会让分母猛增,也不代表安全团队突然缩减。工作标签和自动分类还可能出错,不同公司若自行定义“安全”,很容易得到无法比较的数字。

这套指标真正有价值的方向,是建立连续时间序列,并交给独立机构核验。研发自动化可观察AI是否从辅助走向主导;监控覆盖、延迟和升级率可观察监督能否跟上代理规模;算力分配可观察公司在能力与安全之间的资源选择。三者必须结合看,任何单项都不应成为安全宣传分数。

Anthropic披露的是实验室内部生产过程的一角。3万代理说明AI已深度进入研发,但不等于3万名独立研究员;十亿次监控决策说明监督规模巨大,但不等于没有漏检;6%安全算力说明资源可被分类,却不等于风险已经得到解决。下一步更重要的是统一定义、定期更新、第三方验证,以及在指标恶化时明确会触发什么限制。只有数字能够改变决策,透明度才不只是一次展示。

打赏
$0
点赞
0
收藏
0
浏览量 15
HKWDB提醒,请广大读者理性看待区块链,切实提高风险意识,警惕各类虚拟代币发行与炒作, 站内所有内容仅系市场信息或相关方观点,不构成任何形式投资建议。如发现站内内容含敏感信息,可点击“举报”,我们会及时处理。
提交
评论 0
最热
最新
还没有人评论哦~快抢沙发吧!
相关阅读
Fetch.ai与NuNet同日遇袭,损失近200万美元
Fetch.ai 与 NuNet 遭同一攻击者袭击,合计损失近 200 万美元,NTX 与 FET 均受冲击。
Coinpedia
·2026-09-20 11:32:49
3
XRP巨鲸96小时增持15.4亿枚,市场关注1.55美元关口
Santiment 数据显示,XRP 巨鲸 96 小时内增持约 15.4 亿枚,市场聚焦 1.55 美元阻力位。
U.Today
·2026-09-20 10:12:22
8
Gno.land正式主网上线:329万账户进入创世,但96%代币两年解锁限制了早期流动性
Gno.land在9月16日发布正式主网上线说明,主网链ID为gnoland-1,实际作为一条全新链启动,并非从此前betanet硬分叉继承状态。官方GitHub发布记录显示,创世包含89个精选包;余额来自经过固定哈希和创世校验的分配文件,覆盖3,262,481个账户,总量约13.33亿GNOT。
币界网
·2026-09-20 09:57:04
43
Aave讨论把机构托管资产变成链上抵押品:CoCT能同步余额,却不能消除托管人风险
Aave治理论坛正在讨论一项机构托管抵押借贷方案。提案计划为Aave V4部署一个隔离的Liquidity Hub和一条Spoke:机构借款人把资产存放在Anchorage托管,Chainlink设计的CustodySync根据托管余额铸造不可转让的Custodied Collateral Token,也就是CoCT;借款人再把CoCT作为链上抵押品,从隔离资金池借出稳定币。
币界网
·2026-09-20 09:55:49
41
欧元区7月建筑产出环比持平:楼房同比下降6.4%,基建回升仍托不住整体
欧盟统计局9月18日公布,2026年7月欧元区建筑业产出环比持平,欧盟整体下降0.3%。6月数据则被修订为欧元区下降1.5%、欧盟下降1.3%。同比看,欧元区建筑产出下降2.0%,欧盟下降1.8%。月度止跌没有消除年度疲弱,尤其是楼房建筑仍明显低于去年同期。
币百科
·2026-09-20 09:54:47
19
查看更多