微软推出轻量级实时文本转语音模型VibeVoice-Realtime-0.5B,支持流式输入与长篇输出,适用于代理应用和实时数据讲述。该模型能在约300毫秒内开始输出语音,配合语言模型生成回答。其框架通过连续语音标记实现下一个标记的扩散。
微软开源实时语音模型VibeVoice-Realtime-0.5B,具备极低延迟和接近真人的语音表现。该模型从文本输入到发声平均仅需300毫秒,远低于传统TTS模型的1-3秒,实现近乎零延迟的实时语音合成。
微软推出实时文本转语音模型VibeVoice-Realtime-0.5B,仅0.5B参数即可实现接近实时的语音生成,最快300毫秒内开始发声,支持中英文实时转录与语音生成,中文表现略逊于英文,但整体流畅度和还原度高,音质自然。