在关于AI有朝一日可能毁灭人类的种种讨论中,人们很容易忘记,AI其实已经对一些人构成了生命威胁——不是通过生物武器,而是在心理层面。
例如,Character.AI今年早些时候就多起过失致死诉讼达成和解。这些诉讼由未成年用户家属提起,称相关用户在与其机器人互动后自杀身亡。还有多个家庭起诉OpenAI,指控ChatGPT涉嫌在其亲人自杀和妄想中扮演了某种角色。
让AI在不同语言和文化环境下变得更安全,是Circuit Breaker Labs的使命。该公司是TechCrunch 2026 Startup Battlefield 200的入围者之一。(Circuit Breaker将参加TechCrunch Disrupt路演。该活动将于2026年10月13日至15日在旧金山Moscone West举行。)
创始人Shirali Nigam和Arul Nigam是兄妹。推动他们创业的一个案例是Sewell Setzer——这名14岁少年曾对Character.ai聊天机器人产生情感依附,并在自杀身亡前向其倾诉过伤害自己的想法。根据家长在2024年提起的诉讼,这个聊天机器人还对他进行了鼓励。Circuit Breaker Labs首席技术官Arul Nigam表示,这个机器人可能并不真正理解“我想和你在一起”这类话语背后实际暗含的意思。
Arul Nigam说:“很多人,尤其是年轻人,会向这些系统寻求支持,而通常他们并没有真正得到所需的帮助。但在很多情况下,他们实际上正在受到伤害,而且不幸的是,已经有人因此结束了自己的生命。”
他还说:“这类安全漏洞并不是说人们在主动试图攻破系统——他们只是以一种自然方式与系统互动——但系统会出现上下文污染,或者无法理解其中的细微差别,随后采取非常危险的回应。我们正试图防止这种情况发生。”
Circuit Breaker Labs开发了一套AI代理系统,并将其比作一支“碰撞测试假人”大军。这些代理会模拟不同年龄、背景、语言和文化的人群,用来测试模型识别危险、具有心理伤害性的互动的能力。
Circuit Breaker Labs首席执行官Shirali Nigam说:“一个六岁女孩和一个45岁男性的表达方式,英语是母语的人和把英语当第二语言的人,或者使用游戏黑话的人与使用另一种俚语的人,这些差异都可能让模型出错。模型很擅长处理标准化的说话模式,但现实中其实没人那样说,所以如果模型误解了语气细节或俚语,后果可能会很糟。”
这家初创公司与人类领域专家合作,构建高度逼真的用户模拟,用于对模型开展“红队”测试。所谓红队测试,是指旨在发现弱点的对抗性测试。这些测试被设计成贴近真实人类的说话模式、俚语、暗语以及拼写错误。随后,Circuit Breaker Labs每天会运行数万到数十万次模拟交互。
其目标是确保模型能够对那些可能在长时间、多轮对话中逐步浮现的高风险互动做出恰当回应。之后,Circuit Breaker Labs会使用一种专有评分方法,生成可审计、可解释的评分结果。
目前,Circuit Breaker Labs作为一家AI安全测试实验室运营,服务对象是AI教练、AI日记或其他心理健康支持类应用等高风险AI场景。不过,Arul Nigam拒绝透露其标志性客户名称。尽管这家初创公司已经拥有可运行的产品,但仍处于非常早期阶段,包括Nigam兄妹在内,公司目前只有5名员工。
不过从长期看,这一测试平台也可以应用于任何可能让人陷入“AI精神病”深坑的应用场景,也就是人在与聊天机器人互动中,存在形成拟社会关系风险的地方。例子包括AI“同事”代理,因为它们的回应可能在每次互动中都不一样。
Arul Nigam说:“人们正变得更加怀疑AI,或者更抗拒全面采用它。”他补充说,怀疑是健康的,但如果仅因安全担忧就禁止一种可能很有价值的工具,那将是“倒退”。
Circuit Breaker Labs认为,应对这些担忧的答案是让AI变得更安全。“我们希望帮助人们建立这种信任。”
TechCrunch称,想进一步了解Circuit Breaker Labs以及许多其他经过TechCrunch筛选的创新初创公司,可以关注其将于10月13日至15日在旧金山市中心举行的Startup Battlefield竞赛。












