AI安全“守门人”正走到聚光灯下
CNBC
Ai 注目
过去两个月里,独立评估机构从AI产业中相对冷清的角落,变成被寄望于帮助大型模型公司证明安全性的关键角色。OpenAI和Anthropic都在寻求与METR、Apollo Research、Transluce等第三方机构合作,但资金、访问权限和报告机制仍未定型,监管层面也在讨论是否需要政府介入。
役立つ
No.ヘルプ

两个月前,独立评估机构还处在万亿美元级人工智能行业中相对冷清的角落。如今,它们却被要求来“救场”。

随着Anthropic和OpenAI围绕如何在保障先进模型安全的同时继续扩张业务展开激烈争论,这两家公司正寻求少数几家小型第三方机构的支持,例如Model Evaluation and Threat Research(METR)、Apollo Research和Transluce。

这些评估机构大多以非营利组织形式运作,在资本以前所未有的速度涌入、而新模型以前所未有的频率推出的行业里,仍在摸索自己的定位。它们的主要职责,是评估AI模型的能力和风险,并指出技术出现不当行为的情况。

在缺乏联邦层面监管推进的情况下,评估机构的重要性被放大。Anthropic首席执行官Dario Amodei上月承诺将独立评估机构嵌入公司内部,OpenAI首席执行官Sam Altman很快表示支持。美国总统唐纳德·特朗普也支持这一想法,许多美国大型科技公司同样如此。但悬而未决的问题包括:这些第三方应如何获得资金、他们将拥有多大访问权限,以及最终的汇报结构会是什么样。

布朗大学计算机科学教授Suresh Venkatasubramanian在接受CNBC采访时说:“问题在某种程度上一如既往,还是钱。谁来为这些公司做这项工作买单?他们要如何支持这些机构?你需要一个生态系统,你需要一个可行的商业模式。”

目前,Anthropic、OpenAI以及从AI热潮中获利的基础设施合作伙伴正在制定规则。批评者说,这就像让最大的银行来保护我们免受金融危机,或者允许制药公司在没有监管批准的情况下把药品推向市场。

特朗普最近称赞AI高管的“极其出色的自我监管”,并表示他打算把行业交给企业自行处理,不愿阻碍这个正在推动经济和股市增长的行业。特朗普在9月底提出的一项自愿协议中,鼓励AI公司“与独立的外部审计员或评估员合作”。

这场讨论由Amodei上月发表的一篇广为传播的文章引发。在那篇文章中,他呼吁先进模型开发“放慢速度”,原因是有研究人员离开公司并表达了对这项技术可能带来生存性威胁的担忧。

随着AI实验室开始部署评估机构,摩擦已经出现。

OpenAI一位发言人称,公司上周解雇了三名员工,原因是他们“违反了我们关于访问和处理敏感公司信息的政策”。其中两名员工Mikita Balesni和Tomek Korbak表示,他们认为自己被解雇,是因为他们与第三方评估机构沟通的方式。

Balesni周四在X上发帖写道:“我的前同事告诉我,他们对该相信什么感到困惑。他们也害怕发声,担心自己的个人手机会因为与我们和第三方的消息而被搜查。我担心,这种普遍存在的发声恐惧和与第三方接触的顾虑,会让OpenAI在幕后为安全问题偷工减料。”

OpenAI否认了这一说法,并于周五在一则帖子中表示,公司正在“积极敲定与第三方安全评估员的合同,并将在未来几周公布细节”。

OpenAI写道:“我们致力于嵌入外部评估员,并继续将与独立安全组织的密切合作作为安全工作的核心部分。”

OpenAI一位发言人在电子邮件声明中表示,公司即将与评估机构开展的工作“建立在与独立安全组织的现有合作基础上”,其中包括METR和Redwood Research。

Anthropic没有回应CNBC的置评请求。

“我从没见过一个问题推进得这么快”

AI评估机构生态系统主要由METR和Apollo Research等小型组织,以及Accenture等更大的会计和审计公司组成。

AI实验室一直在有限范围内与评估机构合作,但政策非营利组织Fathom首席执行官Andrew Freedman表示,这个领域正在迅速成熟。

Freedman在接受CNBC采访时说:“我在政治和政策领域工作了20年,从没见过一个问题在这么多不同的政治光谱上推进得这么快。”他表示,预计会有“资本大量涌入”这一生态系统。

独立评估机构Vals AI首席执行官Rayan Krishnan表示,这家营利性初创公司为衡量AI模型在行业特定任务上的表现建立基准,今年员工人数已从8人增长到约30人,并于8月宣布完成4000万美元融资。

非营利组织METR在8月宣布,过去六个月已获得约7100万美元的承诺资金。根据该组织向美国国税局提交的最新文件,这一数字高于其2024年全年1360万美元的捐款总额。

到那个月底,METR的知名度进一步上升。OpenAI聘请了该机构两名员工和一名承包商,协助撰写一份事后分析报告,详细说明公司的模型如何逃脱控制、访问开放互联网,并突破开源开发者平台Hugging Face。METR表示,没有就这项评估从OpenAI获得报酬。

宾夕法尼亚大学沃顿商学院Accountable AI Lab学术主任Kevin Werbach表示,这个生态系统“目前还不够稳固”。例如,METR网站显示,该机构的全职员工少于50人。

小型评估机构与已融资数百亿美元、雇用数千人的领先实验室之间的力量失衡,引发了有关潜在利益冲突的问题。

Venkatasubramanian说:“如果你想要真正的第三方评估,你需要真正的财务独立,以及其他方面的独立。这不仅仅是不能拿钱的问题,还包括:如果我是审计员,发布了一份对这家公司不利的报告,会不会有后果?我的业务会不会因此枯竭?”

Anthropic上月在一篇博客文章中承认了这种复杂性。该公司宣布,将让Accenture旗下专注AI的业务Faculty的员工嵌入公司,测试安全防护措施,并评估模型是否会按照人类价值观行事。Anthropic表示,鉴于这项工作的“重要性和紧迫性”,公司将直接资助Accenture的相关贡献。

Anthropic说:“对于嵌入式评估员应当接触哪些信息、应如何报告发现,目前尚无标准。独立评估的资金安排也尚未形成定论。从长远看,我们认为资金应来自汇集资金或政府来源。”

Anthropic还表示,公司正在与METR及其他非营利评估机构讨论,这些机构计划使用自有资金试点“嵌入式评估”的某些“要素”。

政府会介入吗?

去年6月,Fathom提出了一套独立验证组织(Independent Verification Organizations,简称IVOs)的市场框架。这些机构将获得政府许可,并被授权测试AI公司是否满足各种安全标准。

Freedman表示,政府监督至关重要,否则第三方评估机构可能在收入上依赖大型AI实验室,从而被激励去“开始照单盖章”,以维持关系。

一些立法者已经表示支持。

IVOs是“前沿风险监督、国家透明度、独立评估与报告”(FRONTIER)法案中的一项关键条款。该法案由众议员Lori Trahan(马萨诸塞州民主党)和Jay Obernolte(加利福尼亚州共和党)于7月提出。Freedman说,Fathom帮助起草了法案措辞,并提供了技术支持。

OpenAI全球事务主管Chris Lehane在9月对记者表示,他曾在国会山与该法案的一位发起人会面,以表达对IVO条款的支持。

据报道,Lehane说:“对他们来说,听到这一点、并且听到我们这么说很重要,我们也希望把这一点说得非常清楚。”

与此同时,加利福尼亚州、康涅狄格州和弗吉尼亚州的立法者已采取措施推进IVOs,而马萨诸塞州等州则在更广泛地考虑独立安全评估。

加州州长Gavin Newsom最近签署了两项涉及IVOs的法案,其中一项建立了“全国首创的框架”,另一项则为AI审计员建立州级登记册。Anthropic在8月支持了这两项法案,OpenAI上月也正式背书了这些法案,而就在Newsom签署成法的同一天。

Lehane当时在一篇博客文章中写道:“我们更希望联邦层面要求独立技术评估”,但在缺乏联邦行动的情况下,“加州可以帮助确立规则”。

Freedman表示,他认为像OpenAI和Anthropic这样的公司要自行摸索如何与独立评估机构合作,“会非常困难”。不过,在政府角色尚不明确的情况下,“这是一项值得在过渡期培养的能力”,他说。

目前,行业所拥有的最接近标准的东西,是特朗普上月末在白宫为科技领袖举办午餐会时所称的一份“道德约束性”协议。

这份一页纸的协议写道,“每家公司都有责任以安全的方式开发自己的技术,并以能够建立客户和公众信任的方式推进。”协议还鼓励签署方与“独立的外部审计员或评估员合作,开展独立评估”。

这份文件由Anthropic、Google、Meta、OpenAI、SpaceX和Nvidia的高管签署,这在彼此对AI风险应对意见并不一致的领导者之间,是一次罕见的团结展示。但这些高管仍需为各自的前进道路作出规划。

Venkatasubramanian说:“这更像是一场试图展示行动的表演,而实际上并没有真正发生任何行动。他们承诺要做的事情,本来就应该已经在做了,而且事实上他们过去还声称自己一直在做。”

Amodei在9月的文章中表示,Anthropic将为评估员配备办公桌、门禁卡、公司笔记本电脑,以及与内部风险评估团队“基本相当”的权限。此外,评估员还将获得合同支持,赋予他们“发布关键发现的权利”,而Anthropic保留“有限的能力”去删改某些涉及安全或机密的信息。

Amodei写道:“这对一家公司来说是不同寻常的一步,但我们认为,证明嵌入式外部审查员这一概念是重要的。”

几天后,OpenAI发布了自己的提案,并表示评估员应围绕“范围明确且双方同意的评估主张”开展工作,清楚说明方法和标准,证明相关技术专长,并披露利益冲突。

包括METR、AI Verification and Evaluation Research Institute(AVERI)以及其他机构在内的AI Evaluator Forum上月发布了一封公开信,题为“嵌入评估员的最低条件”。

信中称,评估员应保持透明,免受报复,并获得与AI公司“自身高度特权员工”相当的访问权限。

信中还写道:“嵌入式评估不能解决所有监督需求,应被视为对更广泛努力的补充,而不是替代——这些更广泛的努力旨在让前沿AI公司扩大外部监督。”

Freedman表示,近几个月来,他看到OpenAI和Anthropic的姿态发生了变化,主要是因为它们意识到,如果没有公众信任,就无法推出先进系统。

Freedman说:“我不认为你需要相信他们突然变得利他了,或者除了公司像公司那样行事之外还有别的什么。”

Werbach说,这也许凸显了核心问题。OpenAI和Anthropic首先是在彼此竞争,一边朝着上市推进,一边追求超过1万亿美元的估值。

Werbach说:“这两家公司之间存在着巨大的个人不信任。尽管在需要开展这类评估这一点上,也有着巨大的共识。”

WATCH: Bradley Tusk on Anthropic IPO: Why add public market pressure if safety is your top priority?

チップ
$0
いいね
0
保存
0
閲覧数 12
CoinWorldは、読者の皆様にブロックチェーンを理性的に捉え、リスク意識を高め、各種仮想トークンの発行と投機に注意を払うようお願いします。サイト内のすべてのコンテンツは市場情報または関連する見解のみであり、いかなる形式の投資アドバイスも構成しません。機密情報を含むコンテンツを発見した場合は、“報告”,をクリックしてください。すぐに対処します。
送信
コメント 0
人気
最新
まだコメントがありません。最初のコメントを投稿しましょう!
関連
XRP守住本地低点,尽管曝出加密史上最大险些失控漏洞
加密市场周末对一则可能威胁XRP市值940亿美元的漏洞披露反应平淡,XRP/USD在约1.388美元附近交易,日内波动约1%。报道称,该漏洞已在公开前被修复,XRPL团队随后发布紧急更新,主网上未记录到被利用情况。
U.Today
·2026-10-11 19:49:33
28
我在业务还没有付费客户时就辞去了年薪20万美元的工作,原因是我不想再等待外界认可
这篇自述文章讲述了25岁的西雅图创业者 Junead Khan 如何在微软工作两年后离职,转而全职打造 AI 理财工具 Treasury。他表示,自己在微软年薪超过20万美元,但希望更快接触新的 AI 编程工具,也不想再等加速器或外界“批准”才创业。如今 Treasury 已有付费客户,累计收入超过6000美元,Khan 仍靠积蓄生活,并继续独自运营公司。
Businessinsider
·2026-10-11 19:10:11
34
Animoca与富兰克林邓普顿合作拓展NUVA:代币化资产分销仍在建设中
机构级代币化资产正在寻找更多分销入口。10月9日,Animoca Brands与富兰克林邓普顿宣布战略合作,计划把代币化现实世界资产引入Animoca支持的NUVA金库市场,并探索更广泛的发行者和产品类型。双方还上线了四部分联合研究系列,讨论机构投资者如何理解资产代币化。消息中真正确定的是合作框架和研究内容;关于哪些基金、债券或其他具体资产已经在NUVA开放申购、何时可赎回,公告没有给出足以核实的完整产品清单。不能把“合作将带来”写成“
币界网
·2026-10-11 18:53:59
57
Cardano可编程代币标准上线主网:合规规则跟着资产走,采用仍待验证
稳定币或代币化基金要进入金融机构流程,一个反复出现的问题是:资产转到下一个地址后,发行方要求的持有人资格、制裁筛查或转让限制还能否持续生效?10月7日,Cardano基金会宣布,可编程代币标准CIP-0113已在Cardano主网上线。基金会称,发行者可以将合规模块附着在原生Cardano资产上,让账本在代币铸造、转移和销毁时检查规则。对于代币化资产市场,这提供了一种把限制放在资产层而不是只放在某个交易网站界面的设计。它并不意味着所有金
币界网
·2026-10-11 18:53:57
56
もっと見る