跳到正文

技术方向

语音与音频 最新动态

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

2 条精选近 30 天 2 条共收录 5 条

更新

语音与音频的精选

9月25日周五第 1–2 条
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的实时对话能力上加入低延迟流式视频,生成带唇形同步和自然表情的动态视觉形象。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言同步与异步工具调用如何用于企业对话场景。

9月16日周三