脉冲间隔变化对深度学习蝙蝠叫声分类的影响研究
研究用欧洲蝙蝠录音构建自然 IPI 与 50-ms 归一化 IPI 两组数据集,微调 EfficientNet-B0 和 PaSST 后发现 IPI 归一化影响因模型而异:PaSST 准确率从 71% 微降至 70%,EfficientNet 则从 47% 升至 57%,PaSST 两种条件下均优于 EfficientNet。
研究用欧洲蝙蝠录音构建自然 IPI 与 50-ms 归一化 IPI 两组数据集,微调 EfficientNet-B0 和 PaSST 后发现 IPI 归一化影响因模型而异:PaSST 准确率从 71% 微降至 70%,EfficientNet 则从 47% 升至 57%,PaSST 两种条件下均优于 EfficientNet。
研究者用语音语言模型自身完整与部分波形的翻译结果构造 prefix 监督,无需转录文本或人工翻译,即可适配端到端同声传译。在 FLEURS 和 CoVoST2 三个翻译方向上,prefix 训练改善了质量—延迟前沿,置信度阈值提供了最稳定的操作区间;多轮 append-only 解码在低延迟下更强,其提交校准误差整体下降 63–68%,早期 prefix 下降 68–80%。
SmartCall v1.0.7 发布,新增模型以及音色管理。SmartCall 是基于 AI 大模型 + Asterisk 通信引擎构建的智能客服呼叫中心系统,融合 AI 语音机器人、智能 IVR 流程编排、端到端双工对话模型、实时语音识别(ASR)、语音合成(TTS)与大模型意图识别等能力,提供从呼入智能应答到智能外呼的全链路 AI 客服解决方案。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的实时对话能力上加入低延迟流式视频,生成带唇形同步和自然表情的动态视觉形象。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言同步与异步工具调用如何用于企业对话场景。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:两款实时语音模型同时给出语音质量与智能体任务完成度基准,并列出开发者与企业接入路径。