Google DeepMind 发布 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型原生耦合,让对话智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:官方给出实时视频与语音耦合的能力细节和开放入口,读者可据此判断企业级对话智能体的形态变化。
技术方向
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
3 条精选近 30 天 3 条共收录 4 条
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型原生耦合,让对话智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:官方给出实时视频与语音耦合的能力细节和开放入口,读者可据此判断企业级对话智能体的形态变化。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成在配音和播客场景的可用度。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的定位差异与多项语音基准成绩,可据此判断实时语音智能体的能力边界。