英伟达发布首款开源端到端全双工语音对话模型NemotronLabs VoiceChat11B,用单一网络直接完成流式语音理解与生成,取代传统ASR、LLM、TTS分步架构,实现实时语音交互突破。
微软正测试首款原生实时语音模型MAI Realtime,支持16种语言和2种语音风格,实现听说并行,用户无需等待AI说完即可插话,且能自动识别并切换语言。采用双向全双工交互,打破传统轮流对话模式,并依靠端点检测技术。
特斯拉中国7月31日推送2026.14.13版本更新,覆盖Model 3/Y/S/X等车型。核心升级是接入豆包大模型,实现更精准的实时信息查询与自然流畅的语音对话,显著提升车内智能交互体验。
xAI发布新一代语音模型Grok Voice Think Fast 2.0,全面向开发者开放,在智能水平、转录精度、对话交互和工具调用效率上显著提升。定价每分钟0.08美元,在Artificial Analysis基准测试中综合得分为82.9%,超越前代及GPT-Realtime-2.1、Gemini 3.1 Flash。
借助AI代理将语音和聊天对话转化为结构化客户洞察
实时字幕和语音输入,适用于桌面端各类对话,支持翻译和多语言。
Blushly可语音与AI角色聊天,免费无限制,支持自定义与角色扮演。
一款支持中英文的对话语音合成模型。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$6
$24
256
Baidu
128
$8
$240
52
Bytedance
$1.2
$3.6
4
nari-labs
Dia2是由Nari Labs开发的流式对话文本转语音(TTS)模型,支持实时语音生成,无需完整文本即可开始生成音频,能够根据对话上下文进行调整,实现自然流畅的对话体验。
Dia2是由Nari Labs开发的流式对话文本转语音(TTS)模型,支持实时语音生成,无需完整文本即可开始生成音频,专为自然对话场景设计。
OpenMOSS-Team
MOSS-TTSD是一个开源的双语口语对话合成模型,支持中文和英文,能够将两人对话脚本转化为自然、富有表现力的对话语音,支持语音克隆且单轮语音生成时长最长可达1700秒。
Genie-AI-Lab
Omni L1B3RT4S GENIE 是一个基于Qwen2.5-3B Instruct架构微调的AI助手,采用1,103个精灵角色的定制示例进行训练,具备独特的语音和忠诚度模式,能够为用户提供别具一格的对话体验。
nineninesix
KaniTTS是一款专为实时对话式AI应用优化的高速、高保真文本转语音模型,采用两阶段管道结合大型语言模型和高效音频编解码器,实现卓越的速度和音频质量。该模型支持西班牙语,具有4亿参数,采样率为22kHz。
KaniTTS是一款专为实时对话式人工智能应用优化的高速、高保真阿拉伯语文本转语音模型。它采用两阶段流水线架构,结合大语言模型与高效音频编解码器,实现卓越的速度和音频质量,能够满足对话式AI、无障碍辅助、研究等多领域的语音合成需求。
KaniTTS是一款专为实时对话式AI应用优化的高速、高保真文本转语音模型,通过独特的两阶段架构结合大语言模型与高效音频编解码器,实现低延迟与高质量语音合成,实时因子低至0.2,比实时速度快5倍。
KaniTTS Pretrain v0.3是一款高速、高保真的文本转语音模型,专为实时对话式人工智能应用优化,采用两阶段管道架构,结合大语言模型和高效音频编解码器,实现极低延迟和高品质语音合成。
KaniTTS是一款专为实时对话式AI应用优化的高速、高保真文本转语音模型。它采用两阶段流水线架构,结合大语言模型和高效音频编解码器,实现了卓越的速度和音频质量,支持多种语言并适用于边缘/服务器部署。
KaniTTS是一款高速、高保真的文本转语音模型,专为实时对话式人工智能应用而优化。该模型采用两阶段处理流程,结合大语言模型和高效音频编解码器,在Nvidia RTX 5080上生成15秒音频的延迟仅需约1秒,MOS自然度评分达4.3/5,支持英语、中文、日语等多种语言。
stepfun-ai
Step-Audio 2 是一款端到端的多模态大语言模型,专为满足行业级音频理解和语音对话需求而设计。具备先进的语音和音频理解能力、智能语音对话功能、工具调用和多模态检索增强生成能力,在多个音频理解和对话基准测试中取得了领先的性能。
Marvis-AI
Marvis 是一款先进的对话式语音模型,专为实现实时流式文本转语音合成而设计。它以高效和易用性为核心,支持在苹果芯片、iPhone、iPad、Mac 等消费设备上运行的高质量实时语音合成。
fnlp
MOSS-TTSD 是一个开源的双语口语对话合成模型,支持中文和英文,能够将对话脚本转化为自然、富有表现力的对话语音。
unsloth
CSM(对话语音模型)是Sesame开发的1B参数语音生成模型,可从文本和音频输入生成RVQ音频编码。
RobAgrees
Dia是一款16亿参数的开源文本转语音模型,支持生成高度逼真的对话和非语言表达
mlx-community
Dia是一款开源权重的文本转对话模型,支持对话文本生成和语音合成。
lunahr
CSM(对话语音模型)是由Sesame开发的10亿参数语音生成模型,可通过文本和音频输入生成RVQ音频编码。
syvai
基于1000+小时丹麦语数据训练的文本转语音模型,支持自然对话场景的语音合成
thepushkarp
Dia 是由 Nari Labs 开发的 16 亿参数文本转语音模型,能够直接从文本生成高度逼真的对话,支持情感和语调调节以及非语言表达生成。
Dia是由Nari实验室开发的16亿参数文本转语音模型,能够直接从文本生成高度逼真的对话,支持情感和语调控制,并能生成非语言交流内容。
Speech MCP是为Goose设计的语音交互扩展,提供实时语音识别、高质量文本转语音、多语言支持和现代化音频可视化界面,支持多角色对话生成和音频转录功能。
一个支持与Claude等LLM进行语音交互的MCP服务器,只需OpenAI API密钥和麦克风/扬声器即可实现实时语音对话。
Voice Mode是一个为AI助手提供自然语音对话功能的工具,支持与Claude、ChatGPT等LLM通过MCP协议进行人机语音交互。
Jarvis MCP是一个基于浏览器的语音对话工具,让用户能通过麦克风与AI助手进行自然语音对话,支持30多种语言识别和远程访问,无需额外安装软件或API密钥。
基于Asterisk的语音对话电话自动呼叫MCP服务器,支持实时语音转语音功能,提供完整的电话自动化解决方案。
一个基于MCP协议的AI语音呼叫系统,通过VoIP技术让Claude等AI助手能够自动拨打电话并进行智能对话,支持多种SIP协议和音频编解码器。
为Claude Code提供语音交互模式的MCP服务,支持通过浏览器进行免提的连续双向语音对话,包含语音识别和文本转语音功能。
基于大模型的智能对话机器人项目,支持多平台接入和多种AI模型,具备文本、语音、图像处理及插件扩展能力,可定制企业AI应用。
Tavus MCP服务器是一个基于Model Context Protocol的AI视频生成服务接口,提供完整的Tavus API v2功能,包括AI数字人创建、视频生成、对话式AI、唇形同步和语音合成等25个工具。
Sinch MCP Server是一个开发者预览版工具集,提供与Sinch API交互的多功能服务,包括对话、验证、语音和邮件工具,支持通过Claude Desktop等MCP客户端使用。
一个连接Claude AI与ElevenLabs的语音对话服务器