英伟达发布首款开源端到端全双工语音对话模型NemotronLabs VoiceChat11B,用单一网络直接完成流式语音理解与生成,取代传统ASR、LLM、TTS分步架构,实现实时语音交互突破。
腾讯混元发布语音识别模型Hy ASR3.0 Preview,基于大语言模型Hy3,融合高精度识别与深度语义理解,实现从“逐字转写”到“理解语境”的质变。模型覆盖十大方言片区,长音频场景优势突出,不依赖标准普通话,让AI不仅能听清字,更能真正听懂话。
阿里通义千问发布新一代实时语音合成模型Qwen-Audio-3.0-TTS,实现从“能说话”到“会表达”的跨越。Plus版本在Artificial Analysis Speech Arena排名全球第一,超越Gemini3.1TTS等主流模型。双版本中Flash版主打低延迟实时交互(首包约300ms),Plus版专攻高质量自然度与音色还原。
xAI推出Voice Agent Builder测试版,通过零代码平台和自研Grok Voice模型,将企业级语音智能体搭建缩短至两分钟。其核心为高度集成的端到端架构,解决了传统方案语音转文字等多环节割裂的痛点,大幅降低了开发与运营门槛。
Alibaba
$8
Input tokens/M
$240
Output tokens/M
52
Context Length
$3.9
$15.2
64
$15.8
$12.7
-
Bytedance
$0.8
$2
128
Tencent
32
$2.4
$12
8
$3
$9
$1.6
$10
$1.5
Xai
$21
$105
Openai
$3.5
$10.5
16
Baidu
openbmb
VoxCPM是一款创新的免分词器端到端文本转语音(TTS)系统,通过在连续空间中对语音进行建模,克服了离散分词的局限性。它具备上下文感知语音生成和逼真零样本语音克隆两大核心能力,能够根据文本内容自动调整韵律和风格,并仅需一个简短的参考音频即可克隆说话者的音色、口音和情感。
onnx-community
Supertonic-TTS-ONNX是一个基于ONNX格式的文本到语音转换模型,能够将英文文本转换为自然流畅的语音。该模型基于Supertone/supertonic基础模型开发,专为Transformers.js库优化,支持在浏览器环境中高效运行。
inclusionAI
铭音通是一个创新的统一语音框架,将语音理解、生成和编辑功能整合为一体。它采用统一的连续语音分词器,能在端到端模型中有效融合语义和声学特征,是首个仅通过自然语言指令就能实现通用、自由形式语音编辑的系统。
XiaomiMiMo
MiMo Audio是一款基于大规模预训练的音频语言模型,在语音智能和音频理解基准测试中取得了开源模型的SOTA性能。该模型展现出强大的少样本学习能力,能够泛化到训练数据中未包含的任务,支持语音转换、风格迁移和语音编辑等多种音频任务。
stepfun-ai
Step-Audio 2 是一款端到端的多模态大语言模型,专为满足行业级音频理解和语音对话需求而设计。具备先进的语音和音频理解能力、智能语音对话功能、工具调用和多模态检索增强生成能力,在多个音频理解和对话基准测试中取得了领先的性能。
wcy1122
MGM-Omni-TTS-2B是MGM-Omni全功能聊天机器人的语音生成组件,专门用于文本到语音转换。它支持中英文的零样本语音克隆,能够生成长达10分钟以上的流畅自然语音,并实现高效的流式音频生成。
NexaAI
Qwen2.5-Omni-3B-GGUF 是一个端到端的多模态模型,能够感知文本、图像、音频和视频等多种模态信息,同时以流式方式生成文本和自然语音响应。
calcuis
OpenAudio的GGUF量化版本是基于FishAudio模型的文本到语音合成工具,支持通过简单命令运行,提供便捷的语音合成体验。
unsloth
Whisper是OpenAI开发的最先进的自动语音识别(ASR)和语音翻译模型,在超过500万小时的标记数据上训练,具有强大的零样本泛化能力。Turbo版本是原版的修剪微调版本,解码层从32层减少到4层,速度大幅提升但质量略有下降。
Qwen
Qwen2.5-Omni 是一个端到端的多模态模型,能够感知文本、图像、音频和视频等多种模态,并以流式方式生成文本和自然语音响应。
Qwen2.5-Omni是一款端到端多模态模型,能够感知包括文本、图像、音频和视频在内的多种模态,同时以流式方式生成文本和自然语音响应。
salihfurkaan
VoxPolska是一个专注于波兰语文本到语音转换的先进模型,能够生成自然流畅且富有表现力的波兰语语音。
Qwen2.5-Omni是一款端到端多模态模型,能够感知文本、图像、音频和视频等多种模态信息,并以流式方式同步生成文本和自然语音响应。
Emova-ollm
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,能够生成具有情感控制的文本和语音响应。
epchannel
viⓍTTS 是一款语音生成模型,能够通过6秒的简短音频片段克隆声音到不同语言中。
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,具备情感语音对话能力。
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,无需依赖外部模型即可实现多模态理解和生成。
speechbrain
这是一个基于SpeechBrain框架训练的端到端自动语音识别系统,使用Conformer架构在25,000小时英文语音数据上训练。
Menlo
无言是一个紧凑的开源文本到语义模型(10亿参数),旨在直接将音频转换为离散的语义标记,无需依赖传统的文本转语音(TTS)模型。
一个基于Streamlit的智能聊天机器人,使用GPT-4o自动路由用户请求到不同工具(如聊天、图像生成、数据库查询、语音合成等),支持快速实验AI工具路由功能。
基于Minimax AI和Amazon S3的语音生成MCP服务器,提供文本转语音功能并自动上传音频文件到云端存储