【大屏时代】首页 > 3D快报内容详情

Google 官宣 Gemini 3.8 Live,首创“边说边想”颠覆行业交互

1小时前 5 大屏时代

Google 正式公布了其在原生端到端语音交互领域的最新突破,推出全新一代实时语音大模型 Gemini3.8Live 以及针对高难度任务定制的 Gemini3.8Live Extended Thinking。这两款模型代表了 Google 原生音频对音频技术体系的重大跨越,不仅将实时对话延迟与自然度推向全新高度,更首次在低延迟语音流中实现了深层多步推理能力,彻底改变了语音人工智能在复杂专业场景下的应用范式。

在以往的主流语音交互架构中,人工智能系统通常需要在快速响应的浅层对话与耗时较长的深度思考之间做出妥协,面对高难度问题往往需要用户忍受长时间的静默等待。Google 此次推出的 Gemini3.8Live 着重优化了极速对话与日常流式交互体验,能够以更敏锐的语调起伏、自然打断与上下文理解能力,为用户提供极其流畅且具备人类级质感的实时语音交流。

而在其基础上推出的 Gemini3.8Live Extended Thinking,则针对高复杂度业务流进行了根本性升级。该模型赋予了人工智能“边说边想”的后台扩展推理能力,使系统在维持实时连贯对话的同时,于后台并发执行复杂的多步骤逻辑拆解、代码排错或技术诊断,无需在遇到困难问题时生硬中断对话节奏。

在实际应用落地方面,新一代 Live 系列模型将大幅拓宽语音助手的服务边界。除了日常的自然交谈外,Gemini3.8Live 及扩展推理版本在实时步骤排错、复杂数理推导、实时外语同声辅导以及多任务流式指令执行等高智力需求场景中展现出了显著优于以往版本的表现,在多项多模态与语音推理行业基准评测中位居榜首。

对于开发者与企业级用户,Google 宣布相关模型能力即日起通过官方 API 及开发工作台正式开放接入。开发者可直接调用这一极低延迟的原生音频接口,在智能硬件、客户服务、实时编程辅助及协同办公等产品形态中快速构建具备高阶推理能力的下一代全双工语音代理服务。


相关文章

相关标签: Google 官宣 Gemini 3.8 Live,首创“边说边想”颠覆行业交互