今年夏天,视频生成初创公司 Synthesia 的企业事务负责人 Alexandru Voica 给我发来一个链接,指向他们公关团队的最新成员时,我很惊讶。那是一个他的互动虚拟头像,经过训练,可以回答关于 Synthesia 的常见媒体问题,比如公司做什么、如何运作。前一天,我还在一个论坛上,公关人员问我是否介意使用 AI 生成文本的推介。可 Alexandru 的头像已经不止于此——在我看来,这几乎是把 AI 用在公关里的终极形态。
9 月,Synthesia 邀请我去了他们在纽约的新办公室。Synthesia 总部原本在英国,是数字人创业公司中的热门玩家,同行还包括 D-ID、HeyGen 和 Colossyan。今年早些时候,公司估值达到 40 亿美元;去年则表示其年度经常性收入已超过 1 亿美元。
Synthesia 允许企业用 AI 头像制作互动培训视频,最近还推出了一款名为 Roleplay Sessions 的产品,员工可以用它练习销售话术等内容,AI 头像会进行回应并对表现打分。
当我去参加新办公室开幕活动时,他们问我是否也想要一个自己的 AI 头像,我几乎没有犹豫就答应了。当然,我也想要一个自己的数字分身。那天我的穿搭很好看,头发也很整齐。
在见到我的数字分身之前,我一直对头像并不在意,但我觉得它们终究会成为日常网络生活的一部分。我听说有人在 Instagram 上按自己的样子创建头像,用来帮助制作社交内容。我觉得这一切都很有意思,这也许就是为什么我现在可以毫无顾虑地向大家展示我的数字分身。这是 Synthesia 第一次为记者制作数字头像,也是第一次为任何人制作,至少在 Voica 之外是这样。它是根据我那篇关于“为什么有风投支持的初创公司比没有风投支持的初创公司更容易欺诈”的报道训练出来的,而且只会回答关于那篇报道的问题。
下面,只需点击“start in a new window”即可开始。
你可以问它这样的问题:
- 我为什么决定写这篇报道?
- 这篇研究论文讲的是什么?
- 研究人员发现了什么?
为了制作它,我走进了 Synthesia 办公室里一个小型摄影棚,他们给我拍了很多照片,还录制了两分钟的声音。我必须同意这些头像的制作,于是,数字版 Dom 就诞生了。他们为我制作了一个个人头像——可以直接朗读我提供的任何脚本——有戴眼镜版和不戴眼镜版;同时也为我制作了两个互动头像——可以和我对话、听我说话——同样有戴眼镜版和不戴眼镜版。
我们选了一篇文章来训练这个互动头像,然后团队中的一组成员为我搭建了这个头像,它由语音转文字、视频、语言和文字转语音模型共同驱动。我的头像技术栈包括 Synthesia 自家的视频和语音模型,不过公司也允许客户选择其他实验室的替代方案,比如 Cartesia、ElevenLabs、Google 或 OpenAI。企业还可以选择把头像部署在自己想要的任何云上,或者付费让 Synthesia 托管。
语音转文字模型把人说的话转成文本,智能体语言模型理解文本并据此采取行动,文字转语音模型把回复转成音频,最后由 Synthesia 自己构建的视频模型让头像在说话时动起来。
总体来说,Synthesia 主要做三类产品——带传统头像的视频制作和分发平台,用户输入脚本后头像会照着念;名为 Sessions 的智能体平台,用户可以在问卷或角色扮演中与头像互动;以及一个 API 平台,用户可以把 Synthesia 的视频和语音模型与其他技术服务结合起来,构建互动头像或其他类型的产品。
Synthesia 团队花了几天时间制作我的头像。我先玩了个人头像,输入了一段相当普通的脚本,看看 AI 声音听起来如何。我让它谈了谈纽约的秋天已经到来——那是我一年中最喜欢的季节。声音相当准确,我也很高兴它没有带上我录音样本里那种沙哑。
我把它给一些非科技圈朋友看,他们觉得既有趣又有点吓人。
然后我又给他们看了我的互动头像。它是确定性的,也就是说,它只会说出训练时被要求回应的内容。在这个例子里,就是我的风投欺诈报道。我问它一些问题,比如我在加入 TechCrunch 之前在哪里、我住在纽约的哪个区域,但每次它都会把话题拉回那篇报道。
我的朋友们觉得这个声音并不像我本人,外形也不如个人头像逼真,但即便如此,还是足够让人有点发毛。我的妈妈则称它“太神奇了”,这已经是她相当高的评价了。她和我父亲一直试着问它一些“只有他们才知道”的关于我的问题——但模型每次都不回答,而是把他们重新引回那篇风投欺诈报道。
“我不记得我生了两个你,”她在测试完模型后开玩笑说。
这次经历让我开始思考新闻业的未来。人们会不会愿意打开新闻时,看到的是一个头像在播报?一位投资人立刻告诉我,不会。如今,AI 生成的低质内容已经侵入社交媒体和其他新闻分享平台,反弹声也很大。但我问过的其他人并没有那么确定。头像会不会增强,甚至取代记者?企业高管会不会更愿意和记者的 AI 头像而不是真人对话?
我喜欢这份工作的地方在于与人建立联系、写报道,以及研究新话题。但新闻业最重要的部分是信任,而这似乎永远不可能外包给 AI。
在新闻业之外,我确信“克隆自己”这个想法会很有吸引力。再也不用在假期或度假后补工作,因为总会有一个版本的你在场,回答问题。
我们还得看看头像的使用在美国企业界会如何演变。但现在我自己也有了一个,我的感受很复杂。等最初的新鲜感过去后,我仔细看着我的头像,它说完话停下来后,我就一直等着——等什么,我也不确定。也许我在等它眨眼,或者说点新东西,或者笑一下,或者只是让我知道它知道些什么。
因为我的数字分身是确定性的,它们永远不会那样做。但我能想象,如果某个分身不是确定性的,而是由一个可以自由发挥、侃侃而谈的聊天机器人驱动,人们会多么容易陷入一点 AI 妄想。
我对一位投资人说,无论数字分身的未来如何,我预测我们这一代人——Z 世代——大概不会习惯它们。它们很有科幻感:我们在电影里见过的一切,如今都成真了。不过我得说,相比人形机器人,我觉得数字头像没那么让人不适。至少有头像在,如果事情变得怪异,我总还能下线。
在那之前,先看看我的个人头像,它会为你概述我们网站本周的所有头条故事!









