边想边说的实时语音大模型: Google 发布 Gemini 3.8 Live 与 Extended Thinking 把实时语音推向多步骤推理 基础版本 Gemini 3.8 Live 专注于大规模部署的高性价比。面向高并发、低延迟的日常助理与检索服务。支持在97种语言对话中自动识别并平滑过渡... 兼顾流畅的多模态实时互动(视觉+语音)与极具竞争力的运行成本。 Gemini 3.8 Live Extended Thinking 则主打企业级复杂任务执行。它重点强化了多步骤逻辑推理与规划能力,主要面向客户服务、专业排障、多系统协调等需要深度思考的生产环境 Thinking 版本实现了“实时思考与发音同步”。面对复杂问题时,它会自然地说出“让我查一下…”作为过渡,并在后台执行多步骤任务时同步向用户汇报进度,交流体验就像在与真人通电话。 后台异步工具调用:在调用外部 API、检索数据或订座的同时,前端的语音闲聊完全不中断,实现了真正的并发协作。 近实时多模态视觉理解:模型能一边看着画面一边聊天,例如实时根据员工入职环境答疑、看棋盘下棋,甚至看着草图直接用语音沟通并生成 React 代码。


  • 情报分类:技术学习与提效
  • 分类依据:内容涉及技术、AI、软件工具或工程实践
  • 信息来源:AI / AI前沿 / 小互 @xiaohu
  • 发布时间:2026/9/16 10:15:15