Clockwork.io融资3100万美元
—Clockwork.io融资3100万美元;LinkedIn、Together AI和WhiteFiber采用其容错软件,以避免GPU小时浪费
LinkedIn每月可避免数万小时的GPU停机;TorchPass的新创新可在不改代码的情况下保留AI工作负载进度,并加速强化学习。
美国加州帕洛阿尔托,2026年10月5日 /PRNewswire/ — 为AI训练、强化学习和推理工作负载在基础设施故障时维持运行的容错软件提供商Clockwork.io今日宣布获得3100万美元新融资,并在LinkedIn和Together AI完成生产部署,同时WhiteFiber进一步扩大采用。
公司还发布了TorchPass解决方案的两项新功能,每一项都可捕获正在运行的分布式AI任务状态。多模式平台快照是训练领域的行业首创,可在无需修改训练代码的情况下保存所有节点上的完整任务,并在之后恢复。快速异步应用检查点则在任务运行时于后台执行,可加速强化学习。它们会将更新后的模型权重提供给负责生成rollouts的推理副本,也就是模型学习所依据的样本,从而让这些副本减少等待时间,或避免使用过时模型工作。
容错已成为大规模AI的基础要求
大型分布式AI工作负载可能横跨数千块GPU,这些GPU必须保持同步:单块GPU故障、链路中断或服务器宕机都可能让整个任务停摆。Meta曾报告称,在使用16,384块GPU进行Llama 3为期54天的训练期间,意外中断平均约每三小时发生一次。
通常的应对方式是重新加载检查点,也就是任务进度的保存副本。恢复过程最长可达90分钟,会让正常运行的GPU闲置,并迫使系统从检查点处重复已完成的工作。客户为闲置GPU和重复计算买单,模型完成时间也会更长。随着任务规模扩大,每次重启都会让更多GPU使用时间面临风险。
在这一规模下,即使发生故障也要保证工作持续推进,已成为基础设施要求。Clockwork.io通过一套容错工具满足这一需求,平台团队将其作为硬件与工作负载之间的中间层部署。LinkPass会重路由流量以避开故障链路,让任务甚至察觉不到故障。TorchPass则可将工作负载从故障GPU迁移到正常GPU,使训练无需回退到更早状态即可继续。两项方案目前都已进入生产阶段。公司今日宣布的TorchPass平台快照新功能可捕获运行中分布式任务的状态;当故障严重到无法通过简单迁移解决时,这一功能可用于恢复整个任务。
“在AI规模下,故障不可避免;但因此损失数小时有效工作不应发生,”Clockwork.io首席执行官Suresh Vasudevan表示,“容错就像一个有效性能放大器:它让GPU继续做有生产力的工作,而不是等待恢复流程或重复已完成的任务。我们与运营着一些最大GPU集群的企业和云服务商合作开发软件,因此它能够处理他们实际遇到的故障。这种保护应当成为这些企业和服务商日常依赖的基础设施的一部分。”
采用范围扩展至企业、超大规模云和neocloud
自建GPU集群的企业、超大规模云厂商以及“neocloud”提供商出于同样原因采用Clockwork.io:让更多GPU小时用于有效工作。
LinkedIn已在其AI基础设施全栈部署LinkPass网络容错能力,从而每月避免损失数万小时的GPU停机时间。
LinkedIn基础设施高级副总裁兼首席技术官Raghu Hiremagalur表示:“在AI基础设施规模下,单一网络问题绝不应让正常工作的GPU下线,或中断正在运行的工作负载。在采用Clockwork.io之前,InfiniBand NIC的抖动可能让一台配有8块GPU的服务器退出服务,而交换机端口的抖动又可能让第二台服务器失效,使影响翻倍至16块GPU。Clockwork.io帮助改变了这一运营模式。其网络容错技术会自动将流量重定向到可用路径,让任务在链路、光学组件、线缆或网卡故障修复期间持续运行。总体而言,Clockwork.io每月为我们的整个集群避免了数万小时的GPU停机。它把原本破坏性的运营事件转变为可管理的维护事件,帮助提升了基础设施利用率和运营效率。”
Together AI正在将TorchPass作为其GPU集群上的一项服务推向市场。双方将在PyTorch大会期间现场演示一项多节点训练任务,即使故意引入网络和GPU故障,该任务也能持续运行而无需重启。
“客户衡量我们的标准是goodput,也就是GPU小时中真正推动模型进展的比例,”Together AI产品负责人Pavneet Ahluwalia表示,“节点修复功能已经可以自动检测故障并调配替代容量。Clockwork.io的TorchPass和LinkPass建立在这一基础设施之上,旨在让任务在GPU和链路故障下仍能继续执行,从而保留已取得的进展。我们正将它们作为平台下一层容错能力推向市场。”
WhiteFiber(NASDAQ: WYFI)是该公司的现有客户,正在其不断扩大的全球GPU即服务基础设施中扩大使用Clockwork.io软件。
WhiteFiber首席技术官Tom Sanfilippo表示:“在集群投入生产前对其可靠性进行压力测试至关重要,因为如果客户收到一个存在隐藏互连网络故障的系统,最终会以失败的任务和损失的GPU小时来承担后果。质量一般的光学组件、配置不当的网卡(NIC)以及在基础测试中通过但在负载下退化的链路,都可能被忽视。Clockwork.io的自动化集群审计会同时验证每条链路和每个节点,在几分钟内定位故障,并让我们在交付前修复它们。我们能更快地启动集群,因此客户的首次训练运行是在经过端到端验证的网络上进行,而不是仅仅在一个已开机的系统上进行。鉴于市场需求迅猛,快速向客户交付经过验证的容量对我们的业务至关重要;因此我们正在所有集群中部署Clockwork.io。”
TorchPass的新功能将工作负载保护交给平台团队
Clockwork.io已将TorchPass能力从GPU迁移扩展到两项此前平台团队不具备的功能:平台团队可自行生成整个分布式任务的快照,以及足够快、可在后台运行的应用检查点。
在训练场景中,平台快照会保存正在运行任务在所有节点上的执行状态,从而在中断后恢复任务。平台团队和AI基础设施工程师可将该方案部署到兼容工作负载上,而无需应用所有者修改代码或增加检查点逻辑。企业团队可通过单一机制保护整个机群中的训练任务,云服务商也可保护其无法控制代码的客户任务。当团队在应用层实施检查点时,TorchPass的快速检查点能力可让检查点更频繁地执行;这样在故障后丢失的进度更少,需要重复的计算工作也更少。
在推理方面,大模型通常运行在两台或更多服务器上,因此链路故障可能让整个副本失效,并在用户会话或代理任务进行中将其打断。LinkPass可让这些多服务器副本在链路故障下继续运行。
强化学习同时依赖训练和推理。多个模型副本生成rollouts,训练系统从中学习,更新后的权重必须先回到这些副本,副本才能用最新版本生成结果。TorchPass的应用检查点可更快地把更新后的权重传回执行副本,而LinkPass则让这些副本在链路故障下保持运行。
SemiAnalysis创始人、首席执行官兼首席分析师Dylan Patel表示:“集群容错过去只是训练问题;现在也成了推理问题。根据我们对ClusterMAX的测试,在一家获得‘金牌’评级的neocloud提供商那里,TorchPass将训练期间的有效性能损失从14%降至不到3%。强化学习(RL)把这两个过程连接起来:推理副本生成模拟,训练系统从中学习,更新后的权重再返回副本。Clockwork.io让副本能够在链路波动和网络故障下继续运行。其超快检查点还能加速权重回传到推理集群,避免流程在任一方向停滞。该方案需要作为训练、推理和强化学习通用的容错层来部署。”
企业平台团队和云服务提供商可联系Clockwork.io,评估其软件在各自工作负载中的应用,或探讨合作机会。
融资轮次及资金用途
本轮融资由Premji Invest、Wing Venture Capital和Seligman Ventures共同领投,现有投资者NEA和e& Capital参与。至此,Clockwork.io累计融资达到7300万美元。公司将利用这笔资金加速其容错工具套件的部署——适用于训练、推理和强化学习阶段——扩大企业采用,并通过云合作伙伴扩大交付规模。
“唯一能完美扩展的是不可靠性:只要在一台机器上装够多的GPU,总会有东西出问题,”NEA风投合伙人Greg Papadopoulos表示,“传统方法——停止任务并重新加载检查点——在当今规模下已经没有意义。Clockwork把故障视为常态:TorchPass可将训练实时从出错的GPU迁移出去,现在还可以在无需改代码的情况下捕获整个运行中任务的状态。它已经每月节省数万小时的GPU时间。我们在2021年就投资了Clockwork.io,并很高兴继续支持他们定义AI集群的性能层。”
关于Clockwork.io
Clockwork.io是Software-Driven AI Fabrics™的先驱,这是一层位于硬件与工作负载之间的可编程层,可让GPU集群具备可观测性、容错能力,并最大化利用率,而不受所用加速器、网络或云环境影响。AI工作负载要求整个集群像一台机器一样运行;然而,故障和瓶颈会让GPU闲置。Clockwork的FleetLens平台可恢复这部分损失的能力:借助纳秒级遥测,它能精确识别是哪块GPU、哪个节点或哪条链路在拖慢或阻塞任务,并在上线前验证集群。此外,通过LinkPass和TorchPass,它可确保从训练到推理的工作负载即使在基础设施故障或退化时也能持续运行。根据SemiAnalysis进行的独立基准测试,TorchPass在故障恢复速度方面优于主要开源框架以及传统的检查点和重启方法。LinkedIn、Together AI、WhiteFiber、Wells Fargo、Nebius、NScale和DCAI等公司都在使用Clockwork.io推动其AI基础设施。更多信息请访问www.clockwork.io。










