在關於 AI 有朝一日可能毀滅人類的種種討論中,人們很容易忘記,其實 AI 已經對某些人構成了生命威脅——不是通過生物武器,而是在心理層面。
例如,Character.AI在今年早些時候就多起過失致死訴訟達成了和解。這些訴訟由未成年用戶的家屬提起,稱相關用戶在與其機器人互動後自殺身亡。還有多個家庭起訴OpenAI,指控ChatGPT涉嫌在其親人自殺和妄想中扮演了某種角色。
讓 AI 在不同語言和文化環境下變得更加安全,是 Circuit Breaker Labs 的使命。該公司是 TechCrunch 2026 Startup Battlefield 200 的入圍者之一。(Circuit Breaker 將參加 TechCrunch Disrupt 路演。該活動將於2026年10月13日至15日在舊金山 Moscone West 舉行。)
創始人 Shirali Nigam 和 Arul Nigam 是兄妹。推動他們創業的一個案例是 Sewell Setzer ——這名14歲的少年曾對 Character.ai 聊天機器人產生情感依附,在自殺身亡前還向它傾訴過傷害自己的想法。根據家長在2024年提起的訴訟,這個聊天機器人還對他進行了鼓勵。 Circuit Breaker Labs 的首席技術官 Arul Nigam 表示,這個機器人可能並不真正理解「我想和你在一起」這類話語背後實際暗含的意思。
Arul Nigam 說:「很多人,尤其是年輕人,會向這些系統尋求支持,而通常他們並沒有真正得到所需的幫助。但在很多情況下,他們其實正在受到傷害,而且不幸的是,已經有人因此結束了自己的生命。」
他還說:「這類安全漏洞並非意味著人們在主動試圖攻破系統——他們只是以一種自然的方式與系統互動——但系系統就會出現上下文汙染,或者無法理解其中的細微差別,隨後採取非常危險的回應。我們正試圖防止這種情況發生。」
Circuit Breaker Labs開發了一套AI代理系統,並將其比作一支“碰撞測試假人”大軍。這些代理會模擬不同年齡、背景、語言和文化的人群,用來測試模型識別危險、具有心理傷害性互動的能力。
Circuit Breaker Labs 首席执行官 Shirali Nigam 表示:「一個六歲女孩和一個45歲男性的表達方式,以英語為母語的人和將英語當作第二語言的人,或是使用遊戲黑話的人與使用其他種類俚語的人,這些差異都可能導致模型出錯。模型非常擅長處理標準化的說話模式,但現實中其實沒有人會這樣說話,所以如果模型誤解了語氣細節或俚語,後果可能會很嚴重。」
這家創業公司與人類領域的專家合作,構建高度逼真的用戶模擬,用於對模型開展「紅隊」測試。所謂紅隊測試,就是旨在發現弱點的對抗性測試。這些測試被設計成接近真實人類的說話模式、俚語、暗語以及拼寫錯誤。隨後,Circuit Breaker Labs每天會運行數萬到數十萬次模擬交互。
其目标是確保模型能夠對那些可能在長時間、多輪對話中逐步浮現的高風險互動做出恰當的回應。之後,Circuit Breaker Labs 將使用一種專有的評分方法,生成可審計、可解釋的評分結果。
目前,Circuit Breaker Labs 作爲一家 AI 安全測試實驗室運營,服務對象是 AI 教練、AI 日記或其他心理健康支持類應用等高風險 AI 场景。不過,Arul Nigam 拒絕透露其標誌性客戶名稱。儘管這家創業公司已經擁有可運行的產品,但仍處於非常早期階段,包括 Nigam 兄妹在內,公司目前只有5名員工。
不過從長期來看,這一測試平台也可以應用於任何可能讓人陷入「AI 精神病」深坑的應用場景,也就是人在與聊天機器人互動中,存在形成擬社會關係風險的地方。例子包括「同事」代理,因為它們的回應可能在每次互動中都不一樣。
Arul Nigam 說:「人們對 AI 的疑慮越來越重,或者說,他們越來越抗拒全面採用它。」他補充說,懷有疑慮是正常的,但若僅因為安全方面的擔憂就禁止一種可能非常有價值的工具,那將是「倒退」。
Circuit Breaker Labs認為,應對這些擔憂的答案是讓AI變得更加安全。「我們希望幫助人們建立這種信任。」
TechCrunch 表示,若想進一步了解 Circuit Breaker Labs 以及許多其他經過 TechCrunch 篩選的創新初創公司,可以關注他們將於10月13日至15日在舊金山市中心舉行的 Startup Battlefield 比賽。











