ElevenLabs 周一推出两款新的语音模型,分别名为 ElevenLabs v4 和 v4 Turbo,提供更强的表达控制、更低的语音代理延迟,并支持 90 多种语言。
该公司去年发布了 v3 模型,并在今年早些时候于华沙的一场活动上预告了这款模型。对于 v4 这一代模型,ElevenLabs 采用了新的架构,使其能够更好地控制声音并更快地克隆语音。公司表示,借助 v4,用户只需 10 秒音频就能克隆一个声音。
在创作层面,这款模型在处理较长文本时,对声音身份的保持更好。它在朗读时也会考虑文本上下文,从而改变表达方式。ElevenLabs 曾在 v3 中引入内联标签来定义语气表达,并在 v4 中扩展了这些标签,允许用户叠加多个标签,并让模型按顺序执行。
上一版本支持 70 种语言,而 ElevenLabs 这次将这一数字提升到了 90 种语言。该初创公司表示,它观察到提升幅度最大的语言包括日语、巴西葡萄牙语、普通话和粤语。
ElevenLabs 在过去一年里迅速扩大了企业呼叫业务,公司表示,其业务中有超过 55% 来自大型企业。公司称,新模型适合语音代理,因为新版本延迟更低,能够让对话更流畅。此外,v4 还能在底层 LLM 开始生成答案时就同步开始生成音频。更重要的是,该模型还可以以不同方式处理对抗、升级和等待,以便更好地解决问题。
语音模型领域的竞争正在加剧,Cartesia、Deepgram、Fish Audio、Boson 和 WellSaid Labs 等初创公司都推出了更具表现力的语音模型。谷歌和 OpenAI 等大公司也改进了各自的语音模型。
ElevenLabs 在今年早些时候从 Sequoia 融资 5 亿美元,该轮由 Sequoia 领投,对公司的估值为 110 亿美元。市场上已经有关于后续融资轮的传闻,若成行,公司估值可能达到 220 亿美元。ElevenLabs 的年化营收运行率已从年初约 3.3 亿美元升至 6 亿多美元。随着员工人数超过 800 人,公司在印度、欧洲和巴西等不同市场积极招聘。
在最近接受 TechCrunch 采访时,公司联合创始人兼首席执行官 Mati Staniszewski 表示,公司目标是在“未来几年”进行 IPO,但没有承诺具体时间表。










