今年夏天,當視頻生成初創公司 Synthesia 的企業事務負責人 Alexandru Voica 發給我一個鏈接,指向他們公關團隊的最新成員時,我感到非常驚訝。那是一個互動虛擬頭像,經過訓練後,能夠回答有關 Synthesia 的常見媒體問題,比如公司從事什麼業務、如何運作等。前一天,我在一個論壇上還看到公關人員問我是否介意使用 AI 生成的文本進行推廣。但 Alexandru 的這個頭像已經不僅如此了——在我看來,這幾乎就是將 AI 应用在公關中的終極形態。
9月,Synthesia邀請我去他們在紐約的新辦公室。Synthesia的總部原本在英國,是數字人創業公司中的熱門玩家,同行還包括D-ID、HeyGen和Colossyan。今年早些時候,該公司的估值達到40億美元;去年則表示其年度經常性收入已超過1億美元。
Synthesia 允許企業使用 AI 头像來製作互動培訓視頻,最近還推出了一款名為 Roleplay Sessions 的產品,員工可以用它來練習銷售話術等內容,AI 头像會進行回應並對表現打分。
當我去參加新辦公室開幕活動時,他們問我是否也想要一個自己的 AI 头像,我幾乎沒有猶豫就答應了。當然,我也想要一個自己的數字分身。那天我的穿搭很好看,頭髮也很整齊。
在看到我的數字分身之前,我對頭像並不在意,但我觉得它們終將會成為日常網絡生活的一部分。我聽說有人在 Instagram 上按照自己的樣子創造頭像,用來幫助製作社交內容。我觉得這一切都非常有趣,這也許就是為何現在我可以毫無顧慮地向大家展示我的數字分身。這是 Synthesia 第一次為記者製作數字頭像,也是第一次為任何人製作,至少在 Voica 之外是這樣。它是根據我那篇關於「為何有風投支持的創業公司比沒有風投支持的創業公司更容易欺詐」的報道訓練出來的,而且只會回答關於那篇報道的問題。
以下,只需點擊「 start in a new window 」即可開始。
你可以問它這樣的問題:
- 我為何決定寫這篇報導?
- 這篇研究論文是講什麼的?
- 研究人員發現了什麼?
為了製作它,我走進了 Synthesia 办公室內的一個小型攝影棚,他們給我拍了很多照片,還錄製了兩分鐘的聲音。我必須同意這些頭像的製作,於是,數字版的 Dom 就誕生了。他們為我製作了一個個人頭像——可以直譯我提供的任何腳本——有戴眼鏡版和不戴眼鏡版;同時也為我製作了兩個互動頭像——可以和我對話、聽我說話——同樣有戴眼鏡版和不戴眼鏡版。
我們選擇了一篇文章來訓練這個互動頭像,然後團隊中的一名成員為我搭建了這個頭像,它是由語音轉文字、視頻、語言和文字轉語音模型共同驅動的。我的頭像技術架構包括 Synthesia 自家的視頻和語音模型,不過公司也允許客戶選擇其他實驗室的替代方案,比如 Cartesia、ElevenLabs、Google 或 OpenAI。企業還可以選擇將頭像部署在自己想要的任何雲端上,或者付費讓 Synthesia 托管。
語音轉文字模型將人說的話轉換成文字,智能體語言模型理解這些文字並據此採取行動,文字轉語音模型將回覆轉換成音頻,最後由 Synthesia 自己構建的視頻模型讓頭像在說話時動起來。
總體來說,Synthesia主要從事三類產品的開發:一種是帶有傳統頭像的視頻製作和分發平台,用戶輸入腳本後,頭像會按照腳本進行朗讀;另一種是名為Sessions的智能體平台,用戶可以在問卷調查或角色扮演中與頭像互動;還有一個是API平臺,用戶可以將Synthesia的視頻和語音模型與其他技術服務結合起來,構建互動頭像或其他類型的產品。
Synthesia 团隊花了好幾天的時間來製作我的頭像。我先試用了個人頭像,輸入了一段相當普通的腳本,看看 AI 的聲音聽起來如何。我讓它說了說紐約的秋天已經到來了——那是我一年中最喜歡的季節。聲音相當準確,我也很高興它沒有帶上我錄音樣本裏的那種沙啞感。
我把它給一些非科技圈的朋友看,他們覺得既有趣又有點嚇人。
然後我又給他們看了我的互動頭像。它是確定性的,也就是說,它只會說出訓練時被要求回應的內容。在這個例子裏,就是我的風投欺詐報導。我問它一些問題,比如我在加入 TechCrunch 之前在哪裡、我住在新約克的哪個區域,但每次它都會把話題拉回那篇報導上。
我的朋友們覺得這個聲音並不像我本人,外貌也不如個人頭像那樣逼真,但即便如此,還是足以讓人感到有些毛骨悚然。我的媽媽則稱它「太神奇了」,這已經是她相當高的評價了。她和我的父親一直試著問它一些「只有他們才知道」的關於我的問題——但模型每次都沒有回答,而是把他們重新引回到那篇風投欺詐報導上。
「我不記得我生過兩個你,」她在測試完模型後開玩笑說。
這次經歷讓我開始思考新聞業的未來。人們是否願意打開新聞時,看到的是一個頭像在播報?一位投資人立刻告訴我,不會。如今,AI 生成的低質內容已經侵入了社交媒體和其他新聞分享平台,反彈聲也很大。但我問過的其他人並沒有那麼確定。頭像是否會增強,甚至取代記者?企業高層是否會更願意與記者的AI頭像對話,而不是與真人對話?
我喜歡這份工作之處在於能與人建立聯繫、寫新聞報導,以及研究新的話題。但新聞業最重要的部分是信任,而這似乎永遠都不可能外包給 AI。
在新闻業之外,我確信「克隆自己」這個想法會非常有吸引力。再也不用在假期或度假後補做工作了,因為總會有另一個版本的你在場,回答問題。
我們還得看看頭像的使用在美國企業界將如何演變。但現在我自己也有一個了,我的感受很複雜。當最初的新鲜感過去後,我仔細觀察我的頭像,當它說完話停下來後,我就一直等待著——等什麼,我也不確定。也許我在等它眨眼,或者說點新的東西,或者笑一下,或者只是讓我知道它知道些什麼。
因為我的數字分身是確定性的,它們永遠不會那樣做。但我能想像,如果某個分身不是確定性的,而是由一個可以自由發揮、侃侃而談的聊天機器人驅動,人們會多麼容易陷入一點 AI 妄想。
我對一位投資人說,無論數字分身的未來如何,我預測我們這一代人——Z世代——大概不會習慣它們。它們非常有科幻感:我們在電影裏見過的一切,如今都成現實了。不過我得說,相比人形機器人,我覺得數字頭像沒那麼讓人不适。至少有頭像在,如果事情變得怪異,我總還能「下線」。
在那之前,先看看我的個人頭像,它將為你概述我們網站這週的所有頭條新聞!











