Google在9月15日发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,并在17日更新说明。两款模型都瞄准实时语音,但定位并不相同:前者强调规模化、低延迟和成本效率,后者把更多算力留给复杂、多步骤任务。它们共同释放的信号是,语音AI正在离开“问一句、答一句”的客服脚本,进入一边保持对话、一边调用工具完成工作的阶段。
这次升级最值得注意的,并不是声音听起来更像真人。Gemini 3.8 Live可以在对话中自动识别并切换97种语言,接收音频、图像、视频和文本,并在后台执行工具或API调用。用户提出订票、查库存或整理资料的要求后,模型可以先确认需求,继续追问条件,同时等待外部系统返回结果。过去的语音机器人往往一调用接口就沉默,用户不知道系统是在处理还是已经卡住;新设计试图把这段等待变成可理解的过程。
Extended Thinking版本更进一步。Google称它可以在推理的同时继续说话,用“我来核对一下”之类的早期回应确认已接到任务,并在多步骤流程中持续播报进度。这听上去只是交互细节,实际却关系到用户是否敢把复杂工作交给语音代理。一个会沉默几十秒的系统,即使最终答案正确,也很难用于银行、差旅、员工入职或设备维护等高压力场景。
榜单成绩说明能力上限,却不能替代真实业务验收
官方公布的成绩给出了模型的参照位置。Gemini 3.8 Live Extended Thinking在Artificial Analysis的语音到语音质量指数中得到82.6分;在τ-Voice任务完成评测中为68.6%,在Sierra的银行场景τ-Voice评测中为35.1%;Big Bench Audio成绩为97.7%。普通Live版本在Speech Agent Arena中位列第二。Google还称两款模型在ServiceNow EVA-Bench上兼顾任务准确率和对话体验,相关测试运行于Gemini Enterprise Agent Platform的Live API。
这些数字不能直接翻译成“68.6%的客服电话都能无人值守”。基准测试有固定任务、工具和成功条件,现实电话里会出现口音、噪声、多人抢话、长时间停顿、错误账户信息和临时改口。银行场景35.1%的成绩反而提醒市场:能自然交流与能可靠完成受监管流程是两项不同能力。部署方必须分别测试识别、意图理解、工具调用、权限校验、最终确认和异常转人工,而不能只看一个综合分数。
模型卡还给出了边界。两款模型基于Gemini 3 Pro,支持最高128K上下文,输出上限为64K,输入包括音频、图像、视频和文本。Live分发到Gemini API、Gemini应用、AI Studio、Vertex AI与Search Live;Extended Thinking还进入Gmail、Docs和Keep等Workspace渠道。渠道广不等于所有用户、地区和功能在同一时间完全开放,企业仍要以自己账户的实际可用权限、定价和数据条款为准。
语音代理进入生产环境后,权限和可恢复性比“像真人”更重要
边说边调用工具会提高效率,也会把风险从回答错误扩大到执行错误。模型误听一个日期,可能不只是说错,而是订错航班;把“取消”识别成“确认”,可能触发真实付款。生产系统因此需要把对话状态与交易状态分开:模型可以讨论选项,但高风险动作应在明确复述、二次确认和权限校验后才执行。后台任务必须有幂等设计,网络重试不能造成重复下单。
语言自动切换同样需要谨慎。97种语言意味着模型能识别更多用户,却不代表每种语言在专业术语、数字听写和法规表达上的质量一致。企业应按目标市场分别测量,而不是用英语成绩外推全部语言。视觉输入也会带来新的隐私问题:员工让模型查看屏幕、证件或现场设备时,画面里可能包含无关个人信息,采集范围和留存策略必须提前定义。
Google展示的场景包括实时员工入职、看着棋盘下棋、把草图和口头反馈变成React组件,以及协调多步骤预订。它们证明模型已经能把视觉、语音和工具调用放在同一条交互链上,但演示不等于任何流程都已稳定自动化。最合理的落地顺序,是先从可撤销、可审核、失败成本低的任务开始,再逐步开放写入和支付权限。
语音AI过去比拼音色、延迟和打断处理;Gemini 3.8 Live把竞争推向后台任务编排。真正决定它能否进入企业核心流程的,不是用户第一次听到“像真人”时的惊喜,而是第1000次任务遇到噪声、超时和改口时,系统是否仍能解释自己做到哪一步、允许人接管,并且绝不重复执行。












