国家安全部近日发布提示,指出AI语音克隆技术带来社会秩序与财产安全新挑战。该技术仅需三至五秒音频即可精准复刻人声,普通人辨别伪造语音的成功率不足一半,且大量在线平台推出“一键”生成功能,加剧滥用风险。
ElevenLabs平台引入斯坦·李标志性声音,由专业录音室精心还原其温暖、幽默的嗓音。创作者可通过Iconic Marketplace合成语音,或在ElevenReader中用于朗读文章、脚本,应用于视频、播客等场景。
AIGCPanel 2.0.0版本迎来重大升级,被称为“史上改动最大的一次”。核心亮点包括:通过工作流引擎与CLI命令行工具,整合数字人合成、语音克隆和音视频处理,解决AI创作工具碎片化问题。逻辑流定义创作模式实现一键输出成品,推动从手动拼凑到自动化生产的转变。
微软开源VibeVoice语音AI模型,支持ASR和TTS,具备长音频处理、多说话人对话生成及实时低延迟特性,已在GitHub获27K星。采用MIT协议,支持本地部署,无需云端费用,旨在推动语音合成领域创新。
StrikeScribe是一款AI语音转文字和会议转录软件,支持100多种语言。
专业AI面试助手,提供实时语音识别、智能回答生成等功能,提升面试成功率。
开源的前沿语音 AI 模型,支持语音识别和文本转语音。
一体化AI创意平台,集视频、图像、音乐、语音合成等功能于一体。
Alibaba
-
Input tokens/M
Output tokens/M
Context Length
$8
$240
52
$3.9
$15.2
64
$15.8
$12.7
Bytedance
$0.8
$2
128
Baidu
Tencent
nineninesix
KaniTTS是一款专为实时对话式人工智能应用优化的高速、高保真阿拉伯语文本转语音模型。它采用两阶段流水线架构,结合大语言模型与高效音频编解码器,实现卓越的速度和音频质量,能够满足对话式AI、无障碍辅助、研究等多领域的语音合成需求。
KaniTTS是一款专为实时对话式AI应用优化的高速、高保真文本转语音模型,通过独特的两阶段架构结合大语言模型与高效音频编解码器,实现低延迟与高质量语音合成,实时因子低至0.2,比实时速度快5倍。
facebook
Meta AI开发的奇契瓦语文本转语音模型,基于VITS架构,支持高质量语音合成
Meta AI开发的波斯语文本转语音模型,基于VITS架构,支持高质量语音合成
Meta AI开发的希伯来语文本转语音模型,基于VITS架构,支持高质量语音合成
这是一个基于Node.js的MCP服务器项目,通过Model Context Protocol实现AI助手与棒読みちゃん语音合成软件的集成,提供文本转语音功能。
一个为AivisSpeech文本转语音引擎设计的MCP服务器,支持日语语音合成、多角色声音选择和参数配置,实现与AI助手的无缝集成。
ListenHub官方MCP服务器,支持AI播客生成、FlowSpeech语音合成等功能,提供多客户端配置方案和多种传输模式。
Voicevox MCP Server是一个VOICEVOX兼容的语音合成服务器,通过MCP协议实现与AivisSpeech/VOICEVOX/COEIROINK的交互,支持Cursor等编辑器中的Claude 3.7代理模式语音合成。
Hume MCP服务器是一个AI协作工具,允许用户通过MCP客户端应用(如Claude Desktop、Cursor等)使用Octave文本转语音技术,实现智能语音合成与交互。
一个基于Streamlit的智能聊天机器人,使用GPT-4o自动路由用户请求到不同工具(如聊天、图像生成、数据库查询、语音合成等),支持快速实验AI工具路由功能。
AI-StoryLab是一个基于Next.js的智能故事创作平台,提供故事生成、语音合成、音效添加和绘图提示词生成功能,支持中英文内容创作。
Tavus MCP服务器是一个基于Model Context Protocol的AI视频生成服务接口,提供完整的Tavus API v2功能,包括AI数字人创建、视频生成、对话式AI、唇形同步和语音合成等25个工具。
AivisSpeech的MCP协议服务器实现,提供与AivisSpeech Engine的接口,支持AI助手的语音合成功能。
这是一个基于Node.js的MCP服务器项目,通过Model Context Protocol实现AI助手与棒読みちゃん语音合成软件的集成,提供文本转语音功能,支持音色、音量、语速等参数调整。
为Claude AI提供Linux系统上的Zonos TTS语音合成集成