Gemini 3.8 Live把语音助手变成“边说边办”:97种语言之外,真正难的是后台任务不中断
CoinMeta
3小时前
Ai 焦点
Google在9月15日发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,并在17日更新说明。两款模型都瞄准实时语音,但定位并不相同:前者强调规模化、低延迟和成本效率,后者把更多算力留给复杂、多步骤任务。它们共同释放的信号是,语音AI正在离开“问一句、答一句”的客服脚本,进入一边保持对话、一边调用工具完成工作的阶段。
有帮助
No.帮助

Google在9月15日发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,并在17日更新说明。两款模型都瞄准实时语音,但定位并不相同:前者强调规模化、低延迟和成本效率,后者把更多算力留给复杂、多步骤任务。它们共同释放的信号是,语音AI正在离开“问一句、答一句”的客服脚本,进入一边保持对话、一边调用工具完成工作的阶段。

这次升级最值得注意的,并不是声音听起来更像真人。Gemini 3.8 Live可以在对话中自动识别并切换97种语言,接收音频、图像、视频和文本,并在后台执行工具或API调用。用户提出订票、查库存或整理资料的要求后,模型可以先确认需求,继续追问条件,同时等待外部系统返回结果。过去的语音机器人往往一调用接口就沉默,用户不知道系统是在处理还是已经卡住;新设计试图把这段等待变成可理解的过程。

Extended Thinking版本更进一步。Google称它可以在推理的同时继续说话,用“我来核对一下”之类的早期回应确认已接到任务,并在多步骤流程中持续播报进度。这听上去只是交互细节,实际却关系到用户是否敢把复杂工作交给语音代理。一个会沉默几十秒的系统,即使最终答案正确,也很难用于银行、差旅、员工入职或设备维护等高压力场景。

榜单成绩说明能力上限,却不能替代真实业务验收

官方公布的成绩给出了模型的参照位置。Gemini 3.8 Live Extended Thinking在Artificial Analysis的语音到语音质量指数中得到82.6分;在τ-Voice任务完成评测中为68.6%,在Sierra的银行场景τ-Voice评测中为35.1%;Big Bench Audio成绩为97.7%。普通Live版本在Speech Agent Arena中位列第二。Google还称两款模型在ServiceNow EVA-Bench上兼顾任务准确率和对话体验,相关测试运行于Gemini Enterprise Agent Platform的Live API。

这些数字不能直接翻译成“68.6%的客服电话都能无人值守”。基准测试有固定任务、工具和成功条件,现实电话里会出现口音、噪声、多人抢话、长时间停顿、错误账户信息和临时改口。银行场景35.1%的成绩反而提醒市场:能自然交流与能可靠完成受监管流程是两项不同能力。部署方必须分别测试识别、意图理解、工具调用、权限校验、最终确认和异常转人工,而不能只看一个综合分数。

模型卡还给出了边界。两款模型基于Gemini 3 Pro,支持最高128K上下文,输出上限为64K,输入包括音频、图像、视频和文本。Live分发到Gemini API、Gemini应用、AI Studio、Vertex AI与Search Live;Extended Thinking还进入Gmail、Docs和Keep等Workspace渠道。渠道广不等于所有用户、地区和功能在同一时间完全开放,企业仍要以自己账户的实际可用权限、定价和数据条款为准。

语音代理进入生产环境后,权限和可恢复性比“像真人”更重要

边说边调用工具会提高效率,也会把风险从回答错误扩大到执行错误。模型误听一个日期,可能不只是说错,而是订错航班;把“取消”识别成“确认”,可能触发真实付款。生产系统因此需要把对话状态与交易状态分开:模型可以讨论选项,但高风险动作应在明确复述、二次确认和权限校验后才执行。后台任务必须有幂等设计,网络重试不能造成重复下单。

语言自动切换同样需要谨慎。97种语言意味着模型能识别更多用户,却不代表每种语言在专业术语、数字听写和法规表达上的质量一致。企业应按目标市场分别测量,而不是用英语成绩外推全部语言。视觉输入也会带来新的隐私问题:员工让模型查看屏幕、证件或现场设备时,画面里可能包含无关个人信息,采集范围和留存策略必须提前定义。

Google展示的场景包括实时员工入职、看着棋盘下棋、把草图和口头反馈变成React组件,以及协调多步骤预订。它们证明模型已经能把视觉、语音和工具调用放在同一条交互链上,但演示不等于任何流程都已稳定自动化。最合理的落地顺序,是先从可撤销、可审核、失败成本低的任务开始,再逐步开放写入和支付权限。

语音AI过去比拼音色、延迟和打断处理;Gemini 3.8 Live把竞争推向后台任务编排。真正决定它能否进入企业核心流程的,不是用户第一次听到“像真人”时的惊喜,而是第1000次任务遇到噪声、超时和改口时,系统是否仍能解释自己做到哪一步、允许人接管,并且绝不重复执行。

打赏
$0
点赞
0
收藏
0
浏览量 17
HKWDB提醒,请广大读者理性看待区块链,切实提高风险意识,警惕各类虚拟代币发行与炒作, 站内所有内容仅系市场信息或相关方观点,不构成任何形式投资建议。如发现站内内容含敏感信息,可点击“举报”,我们会及时处理。
提交
评论 0
最热
最新
还没有人评论哦~快抢沙发吧!
相关阅读
REX在Cboe推出Strive两倍做多ETF ASSX
REX在Cboe推出Strive两倍做多ETF ASSX,跟踪ASST单日两倍表现,Strive披露持有2.5万枚比特币。
crypto.news
·2026-09-21 12:33:38
3
比特币升破8.1万美元,NEAR因ZEC换汇量大增上涨23%
比特币站上 8.1 万美元,NEAR 因 ZEC 跨链换汇流量激增上涨 23%,市场也受到 SEC 与中美贸易谈判消息提振。
CoinDesk
·2026-09-21 12:13:37
3
比特币重回50周均线上方 市场关注延续性
比特币周线45周来首次收于50周均线上方,当前市场关注其能否守住约7.81万美元一线。
CoinDesk
·2026-09-21 12:04:40
3
朝鲜黑客冒充招聘方攻击开发者,已窃取1070万美元加密资产
多国通报称,朝鲜相关黑客冒充加密和 AI 企业招聘方,感染至少 3 万台设备,窃取约 1070 万美元加密资产。
Cointelegraph
·2026-09-21 10:04:38
11
1.16亿美元硬件钱包失窃暴露“伪随机”漏洞:AI让审计更快,也让攻击者先跑完搜索
把加密资产放进硬件钱包,通常被视为离线安全的最后一道防线。但Solana基金会9月19日发布的安全访谈指出,今年夏天发生的一起Coldcard钱包事件,问题恰恰出在生成私钥的最初一步。自7月30日起,攻击者据称从5200多个钱包中转走约1.16亿美元比特币,不需要触碰设备,只需推算强度不足的助记词。
币界网
·2026-09-21 09:55:31
50
查看更多