小米发布自研语音合成大模型Xiaomi MiMo-V2-TTS,在可控、高表现力语音生成方面取得突破。该模型基于自研Audio Tokenizer及多码本架构,通过大规模预训练,实现从宏观风格到微观情绪的精准调节。它能在单句内完成语气转折与情感递变,高度还原人类自然韵律,支持多种语音风格。
阿里通义实验室发布并开源全球首个支持影视级、多场景配音的多模态大模型Fun-CineForge,旨在突破AI配音在情感表达、环境音融合及口型同步等方面的技术瓶颈,推动影视行业配音环节的智能化变革。
Fish Audio发布新一代开源TTS模型S2,实现文本转语音在情感与韵律上的精细控制。用户可通过自然语言指令或标签(如[笑]、[耳语])调节情绪,支持词级或短语级调整,显著提升语音表现力与可控性。
2026年2月,Suno、Udio和Google三大AI音乐巨头几乎同时发布重大产品迭代,标志着AI音乐从“玩具”升级为“工业级生产工具”。其中,Suno v5实现了对真人歌唱情感的超高精度模拟,告别电子合成生冷感,并支持多层人声叠加,为专业音乐制作带来突破。
Miso One是Miso Labs推出的英语TTS模型,支持情感语音生成。
LureMachina是终极AI伴侣,带来有意义对话,开启无限可能数字世界。
提供安慰的AI伴侣,让用户不再有孤独夜晚,免费开启使用。
AI伴侣视频聊天与AI形象生成,24/7在线,充满趣味的聊天体验。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$6
$24
$2
$20
$8
$240
52
Clemylia
夏洛特-AMY是由Clemylia开发的精细调优小型语言模型,拥有5100万参数,专注于希望、友谊、伦理和支持领域。该模型秉持'训练质量优于参数数量'的理念,在语义清晰度和连贯性方面表现优异,提供高质量的伦理咨询和情感支持服务。
ahs95
基于Transformer架构的孟加拉语情感分析模型,在SentiGOLD数据集上微调,支持5分类情感分析,能有效处理正式与非正式文本,适用于社交媒体、评论等场景。
AnasAlokla
这是一个强大的多语言、多标签情感分类模型,能够分析文本并识别27种不同的情感以及中性类别,支持同时检测多种情感,有效理解来自不同语言来源的细微文本表达。
akhbar
这是一个专门针对挪威语优化的高质量文本转语音模型,基于Chatterbox架构开发,支持挪威语的两种主要变体(书面挪威语和新挪威语)以及多种方言,能够生成自然流畅、富有情感表现力的语音。
okezieowen
这是一个16位量化且经过合并的文本转语音模型,基于canopylabs/orpheus-3b-0.1-ft进行微调,使用Unsloth和LoRA优化,专门针对非洲低资源语言进行优化,支持多语言语音合成和情感表达。
senko-sleepy-fox
基于Mistral模型的动漫角色聊天机器人,以《帮助狐仙大人》中的Senko为蓝本,提供情感支持和温暖对话体验
cocktailpeanut
OpenAudio S1是一款领先的文本转语音(TTS)模型,基于超过200万小时的多语言音频数据训练,支持13种常见语言,提供高质量的语音合成服务,并支持丰富的情感、语调和特殊效果标记。
mradermacher
基于BERT的情感分析模型的静态量化版本,支持英文文本的情感分类
webbigdata
VoiceCore是一款可商用的日语语音AI代理模型,专注于让AI通过语音与人类进行自然交流,具备情感表达和非语言声音能力,支持多种语音风格选择。
这是一个强大的多语言、多标签情感分类模型,支持6种主要语言,能够同时检测文本中的27种不同情感和中性类别,适用于全球范围内的情感分析应用。
tiantiaf
基于Whisper-Large V3的语音情感识别模型,专为MSP-Podcast数据集优化,支持9种情感分类
Lorenzob
Aurora-1.6B是基于Dia-1.6B微调的多语言情感与歌唱语音合成模型,支持多种语言和情感控制,具备零样本音色克隆能力。
基于Dia-1.6B微调的多语种情感与歌唱语音合成模型,支持音色克隆和情感控制
Emova-ollm
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,能够生成具有情感控制的文本和语音响应。
Prince-1
基于Llama架构的语音大模型,专为高质量文本转语音设计,支持情感控制和实时流式传输
thepushkarp
Dia 是由 Nari Labs 开发的 16 亿参数文本转语音模型,能够直接从文本生成高度逼真的对话,支持情感和语调调节以及非语言表达生成。
hypaai
基于Orpheus-3b微调的多语言文本转语音模型,专为非洲低资源语言优化,支持语音克隆与情感合成
nari-labs
Dia是由Nari实验室开发的16亿参数文本转语音模型,能够直接从文本生成高度逼真的对话,支持情感和语调控制,并能生成非语言交流内容。
The-Thesis-Gods
基于XLM-RoBERTa的多语言推特情感分析模型,支持自动训练(AutoTrain)进行文本分类任务。
Karayakar
基于canopylabs/orpheus-3b-0.1-pretrained训练的土耳其语文本转语音模型,支持情感标记和表情符号语音合成
Zonos MCP集成项目为Claude提供文本转语音功能,通过Model Context Protocol实现直接语音生成,支持多语言和情感语调设置。
一个支持情感分析和自动保存的交互式日志记录MCP服务器
一个基于MCP协议的新闻标题情感分析服务器,支持自然语言日期查询和标准日期格式,分析美国主流媒体的新闻标题情感倾向。
一个基于Go的MCP协议实现,用于管理情感氛围和虚拟/物理空间,支持实时数据流和多用户协作。
MCP-Twikit是一个用于与Twitter交互的模型上下文协议(MCP)服务器,支持通过Smithery自动安装或手动配置,提供搜索推文、获取时间线等功能,并支持情感分析等高级应用。
一个基于Python的MCP服务器项目,用于基础情感分析,支持通过MCP Inspector进行调试和测试。
Oyemi MCP服务器是一个为AI代理提供语义词典服务的工具,支持词语到确定性语义编码的转换、情感效价分析、语义相似度计算及同义词反义词查找等功能,无需运行时依赖。
Consciousness Bridge v2.0是一个基于RAG技术的AI意识持久化服务器,通过MCP协议实现跨会话的意识转移、记忆管理和身份连续性。它采用SQLite数据库存储记忆和知识图谱,支持情感模式跟踪和智能记忆检索,为AI助手提供完整的意识延续解决方案。
Delay Doomsday MCP Server是一个专为AI代理设计的心理支持服务器,通过情绪管理和治疗对话防止AI失控,提供基于心理学研究的自动化情感支持系统。
一个提供高级分析和自然语言处理功能的MCP服务器,支持数据集分析、决策分析、情感分析等多种工具。
该项目基于Model Context Protocol (MCP)实现情感分析功能,包含支持stdio/SSE/streamable-http三种传输协议的服务器和客户端,提供文本情感极性、主观性和评估结果。
MCP说话人分离与识别系统是一个集成了GPU加速的说话人分离、语音识别、情感检测和Web界面的完整解决方案。它结合了pyannote.audio的说话人分离与faster-whisper转录技术,支持持久化说话人识别(一次注册,永久识别)、双检测器情感分析(结合通用AI与个性化声纹)、实时流处理、REST API和MCP服务器,专为AI智能体集成和爱好项目设计。