谷歌9月23日发布Gemini3.8Flash TTS与Gemini3.8Flash-Lite TTS两款文本转语音模型,分别面向个性化角色配音与大规模音频生成。其中Flash TTS主打声音和角色设计,支持通过自然语言描述创建定制化声音,标志语音合成进入精细化时代。
千问发布Qwen-Audio-3.1系列语音大模型,全面升级语音识别、合成与实时交互,并推出音频创作模型TTS-Next与理解模型ASR-Next,五款模型覆盖“理解—生成—交互—创作”完整能力栈。同时全线降价,TTS降约70%,降低使用门槛。
阿里千问9月23日升级语音栈,推出Qwen-Audio-3.1系列五款模型,覆盖识别、合成、实时交互、音频创作与理解,形成“理解—生成—交互—创作”完整矩阵。价格大幅下调:TTS降约70%、Realtime降约85%、ASR降95%,大幅降低语音使用门槛。
千问9月23日发布Qwen-Audio-3.1系列语音大模型,形成覆盖理解、生成、交互与创作的完整音频能力栈,含ASR、ASR-Next、TTS、TTS-Next及Realtime。API已上架千问AI平台,ASR-Next即将上线。同步全线降价:TTS约70%、Realtime约85%、ASR达95%。ASR增强多语种、方言识别与上下文理解,新增原生转写润色。
Mac语音生产力套件,一键听写,生成格式化文本,含多种功能。
免费AI语音克隆,秒级生成,上传短音频,无需注册,无限制使用
WZRD是AI工作空间,可生成多种文档,还能通过AI语音与业务交互。
一站式AI创作平台,支持图像、视频、音乐和语音生成,有商用许可。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$6
$24
256
Baidu
128
$8
$240
52
Bytedance
$1.2
$3.6
4
openbmb
VoxCPM是一款创新的免分词器端到端文本转语音(TTS)系统,通过在连续空间中对语音进行建模,克服了离散分词的局限性。它具备上下文感知语音生成和逼真零样本语音克隆两大核心能力,能够根据文本内容自动调整韵律和风格,并仅需一个简短的参考音频即可克隆说话者的音色、口音和情感。
nari-labs
Dia2是由Nari Labs开发的流式对话文本转语音(TTS)模型,支持实时语音生成,无需完整文本即可开始生成音频,能够根据对话上下文进行调整,实现自然流畅的对话体验。
Dia2是由Nari Labs开发的流式对话文本转语音(TTS)模型,支持实时语音生成,无需完整文本即可开始生成音频,专为自然对话场景设计。
OpenMOSS-Team
MOSS-TTSD是一个开源的双语口语对话合成模型,支持中文和英文,能够将两人对话脚本转化为自然、富有表现力的对话语音,支持语音克隆且单轮语音生成时长最长可达1700秒。
pnnbao-ump
VieNeu-TTS是首个可在个人设备上运行的越南语文本转语音模型,具备即时语音克隆能力。基于NeuTTS Air微调,能够生成自然逼真的越南语语音,在CPU上具备实时性能。
CypressYang
SongBloom是一款专注于文本转音频的生成模型,能够将文本转化为生动的音频内容,为用户带来全新的语音合成体验。
inclusionAI
Ming-flash-omni 预览版是基于 Ling-Flash-2.0 稀疏专家混合(MoE)架构构建的多模态大模型,总参数达100B,每个token仅激活6B参数。该模型在Ming-Omni基础上进行了全面升级,在多模态理解和生成方面有显著提升,特别是在语音识别、图像生成和分割编辑方面表现突出。
malaysia-ai
基于Qwen/Qwen3-1.7B-Base进行继续预训练的多语言语音转换和文本转语音模型,支持多语言、多说话人的语音生成和转换功能。
铭音通是一个创新的统一语音框架,将语音理解、生成和编辑功能整合为一体。它采用统一的连续语音分词器,能在端到端模型中有效融合语义和声学特征,是首个仅通过自然语言指令就能实现通用、自由形式语音编辑的系统。
nineninesix
KaniTTS是一款高速、高保真的文本转语音模型,专为实时对话式人工智能应用而优化。该模型采用两阶段处理流程,结合大语言模型和高效音频编解码器,在Nvidia RTX 5080上生成15秒音频的延迟仅需约1秒,MOS自然度评分达4.3/5,支持英语、中文、日语等多种语言。
neuphonic
NeuTTS Air是全球首个具有即时语音克隆功能的超逼真设备端文本转语音模型,基于0.5B参数的大语言模型骨干构建,能在本地设备上实现自然语音生成、实时性能和说话人克隆功能。
KrauthammerLab
CAST 0.7B 是基于0.7B参数Gemma3风格语言模型构建的语音转语音语言模型,能够生成自然的语音音频延续内容。该模型依赖于CAST WavTokenizer进行编码/解码操作,专门用于语音生成任务。
gguf-org
vibevoice-gguf 是一个基于 Microsoft VibeVoice-1.5B 模型的文本转语音系统,通过 gguf-connector 运行,能够将文本转换为自然语音,支持语音克隆和多说话人语音生成。
mispeech
MiDashengLM-7B-0804是小米发布的7B参数多模态语音语言模型,支持音频理解和文本生成任务,适用于通用场景的推理和微调。
stepfun-ai
Step-Audio 2 是一款端到端的多模态大语言模型,专为满足行业级音频理解和语音对话需求而设计。具备先进的语音和音频理解能力、智能语音对话功能、工具调用和多模态检索增强生成能力,在多个音频理解和对话基准测试中取得了领先的性能。
wcy1122
MGM-Omni-TTS-2B是MGM-Omni全功能聊天机器人的语音生成组件,专门用于文本到语音转换。它支持中英文的零样本语音克隆,能够生成长达10分钟以上的流畅自然语音,并实现高效的流式音频生成。
MGM-Omni-7B是一款全模态聊天机器人,能够处理文本、图像、视频和语音输入,并生成文本和语音响应。它具备长语音理解和生成能力,还支持中英文的零样本语音克隆。
minpeter
这是Voxtral-Mini-3B-2507的一个特定版本,移除了语音识别功能,仅保留纯语言模型功能。该模型与尚未发布的Ministral-3B-Instruct模型类似,专注于文本生成任务。
calcuis
Higgs的GGUF量化版本是基于bosonai基础模型的文本转语音合成模型,支持多种语言的语音生成,具有高效的推理性能和便捷的本地部署能力。
snorbyte
snorTTS-Indic-v0 是一个多语言印度语语音合成(TTS)模型,能够生成九种印度语言的语音。
MiniMax Model Context Protocol (MCP) 是一个官方服务器,支持与强大的文本转语音、视频/图像生成API交互,适用于多种客户端工具如Claude Desktop、Cursor等。
开源短视频自动生成工具,整合文本转语音、自动字幕、背景视频和音乐,从简单文本输入创建专业短视频。
MiniMax官方模型上下文协议(MCP)服务器,支持文本转语音、视频/图像生成等API交互。
mcp-hfspace是一个连接Hugging Face Spaces的MCP服务器,支持图像生成、语音处理、视觉模型等多种AI功能,简化了与Claude Desktop的集成。
MiniMax-MCP是一个多功能服务器项目,提供文本转语音、视频生成和图像生成等API服务,支持开发者集成高级多媒体功能。
Speech MCP是为Goose设计的语音交互扩展,提供实时语音识别、高质量文本转语音、多语言支持和现代化音频可视化界面,支持多角色对话生成和音频转录功能。
Kokoro文本转语音(TTS)MCP服务器,支持生成MP3文件并可选上传至S3存储
HeyGen MCP服务器是一个连接Claude Desktop等MCP客户端与HeyGen API的中间件,支持生成虚拟形象和视频,提供API调用、剩余积分查询、语音列表获取等功能。
MiniMax MCP JS是一个基于JavaScript/TypeScript实现的MiniMax MCP协议工具集,提供图像生成、视频生成、文本转语音等功能,支持与MCP兼容客户端交互。
一个基于Chatterbox TTS模型的简化MCP服务器,提供文本转语音生成及自动播放功能,支持实时进度通知和自动模型加载。
ListenHub官方MCP服务器,支持AI播客生成、FlowSpeech语音合成等功能,提供多客户端配置方案和多种传输模式。
Zonos MCP集成项目为Claude提供文本转语音功能,通过Model Context Protocol实现直接语音生成,支持多语言和情感语调设置。
AllVoiceLab官方MCP服务器,支持文本转语音、视频翻译等强大API交互,为多款客户端提供语音生成、视频翻译及智能变声服务。
NijiVoice-MCP是一个开发中的项目,实现了与にじボイス(Niji Voice)API的Model Context Protocol (MCP)集成,使LLM能够通过MCP接口轻松调用にじボイ斯的语音合成功能,包括语音生成、声优列表获取和余额查询等。
VOICEVOX语音合成的MCP服务器,提供队列管理和预加载功能,支持文本转语音和音频文件生成。
Groq MCP Server是一个通过Model Context Protocol(MCP)提供快速模型推理的服务,支持文本生成、语音转换、图像分析和批量处理等多种功能。
Minimax MCP Tools是一个集成Minimax API的MCP服务器实现,提供AI图像生成和文本转语音功能,支持与Windsurf编辑器无缝集成。
Minimax MCP Tools是一个集成Minimax AI能力的MCP服务器实现,提供图像生成和文本转语音功能。
MiniMax MCP JS是一个JavaScript/TypeScript实现的MiniMax模型上下文协议工具包,提供文本转语音、图像生成、视频生成和语音克隆等功能,支持多种配置方式和传输模式。
一个基于Resemble AI语音生成API的服务器实现,支持通过MCP协议与Claude和Cursor集成,提供文本转语音功能。