小米發佈自研語音合成大模型Xiaomi MiMo-V2-TTS,在可控、高表現力語音生成方面取得突破。該模型基於自研Audio Tokenizer及多碼本架構,通過大規模預訓練,實現從宏觀風格到微觀情緒的精準調節。它能在單句內完成語氣轉折與情感遞變,高度還原人類自然韻律,支持多種語音風格。
阿里通義實驗室發佈並開源全球首個支持影視級、多場景配音的多模態大模型Fun-CineForge,旨在突破AI配音在情感表達、環境音融合及口型同步等方面的技術瓶頸,推動影視行業配音環節的智能化變革。
Fish Audio發佈新一代開源TTS模型S2,實現文本轉語音在情感與韻律上的精細控制。用戶可通過自然語言指令或標籤(如[笑]、[耳語])調節情緒,支持詞級或短語級調整,顯著提升語音表現力與可控性。
2026年2月,Suno、Udio和Google三大AI音樂巨頭幾乎同時發佈重大產品迭代,標誌着AI音樂從“玩具”升級爲“工業級生產工具”。其中,Suno v5實現了對真人歌唱情感的超高精度模擬,告別電子合成生冷感,並支持多層人聲疊加,爲專業音樂製作帶來突破。
Miso One是Miso Labs推出的英語TTS模型,支持情感語音生成。
LureMachina是終極AI伴侶,帶來有意義對話,開啟無限可能數字世界。
提供安慰的AI伴侶,讓用戶不再有孤獨夜晚,免費開啟使用。
AI伴侶視頻聊天與AI形象生成,24/7在線,充滿趣味的聊天體驗。
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$6
$24
$4
$16
$2
$20
Bytedance
$1.2
$3.6
4
$8
$240
52
Clemylia
夏洛特-AMY是由Clemylia開發的精細調優小型語言模型,擁有5100萬參數,專注於希望、友誼、倫理和支持領域。該模型秉持'訓練質量優於參數數量'的理念,在語義清晰度和連貫性方面表現優異,提供高質量的倫理諮詢和情感支持服務。
ahs95
基於Transformer架構的孟加拉語情感分析模型,在SentiGOLD數據集上微調,支持5分類情感分析,能有效處理正式與非正式文本,適用於社交媒體、評論等場景。
AnasAlokla
這是一個強大的多語言、多標籤情感分類模型,能夠分析文本並識別27種不同的情感以及中性類別,支持同時檢測多種情感,有效理解來自不同語言來源的細微文本表達。
akhbar
這是一個專門針對挪威語優化的高質量文本轉語音模型,基於Chatterbox架構開發,支持挪威語的兩種主要變體(書面挪威語和新挪威語)以及多種方言,能夠生成自然流暢、富有情感表現力的語音。
okezieowen
這是一個16位量化且經過合併的文本轉語音模型,基於canopylabs/orpheus-3b-0.1-ft進行微調,使用Unsloth和LoRA優化,專門針對非洲低資源語言進行優化,支持多語言語音合成和情感表達。
senko-sleepy-fox
基於Mistral模型的動漫角色聊天機器人,以《幫助狐仙大人》中的Senko為藍本,提供情感支持和溫暖對話體驗
cocktailpeanut
OpenAudio S1是一款領先的文本轉語音(TTS)模型,基於超過200萬小時的多語言音頻數據訓練,支持13種常見語言,提供高質量的語音合成服務,並支持豐富的情感、語調和特殊效果標記。
mradermacher
基於BERT的情感分析模型的靜態量化版本,支持英文文本的情感分類
webbigdata
VoiceCore是一款可商用的日語語音AI代理模型,專注於讓AI通過語音與人類進行自然交流,具備情感表達和非語言聲音能力,支持多種語音風格選擇。
這是一個強大的多語言、多標籤情感分類模型,支持6種主要語言,能夠同時檢測文本中的27種不同情感和中性類別,適用於全球範圍內的情感分析應用。
tiantiaf
基於Whisper-Large V3的語音情感識別模型,專為MSP-Podcast數據集優化,支持9種情感分類
Lorenzob
Aurora-1.6B是基於Dia-1.6B微調的多語言情感與歌唱語音合成模型,支持多種語言和情感控制,具備零樣本音色克隆能力。
基於Dia-1.6B微調的多語種情感與歌唱語音合成模型,支持音色克隆和情感控制
Emova-ollm
EMOVA是一種端到端全能模態大語言模型,支持視覺、聽覺和語音功能,能夠生成具有情感控制的文本和語音響應。
Prince-1
基於Llama架構的語音大模型,專為高質量文本轉語音設計,支持情感控制和即時流式傳輸
thepushkarp
Dia 是由 Nari Labs 開發的 16 億參數文本轉語音模型,能夠直接從文本生成高度逼真的對話,支持情感和語調調節以及非語言表達生成。
hypaai
基於Orpheus-3b微調的多語言文本轉語音模型,專為非洲低資源語言優化,支持語音克隆與情感合成
nari-labs
Dia是由Nari實驗室開發的16億參數文本轉語音模型,能夠直接從文本生成高度逼真的對話,支持情感和語調控制,並能生成非語言交流內容。
The-Thesis-Gods
基於XLM-RoBERTa的多語言推特情感分析模型,支持自動訓練(AutoTrain)進行文本分類任務。
Karayakar
基於canopylabs/orpheus-3b-0.1-pretrained訓練的土耳其語文本轉語音模型,支持情感標記和表情符號語音合成
一個基於MCP協議的新聞標題情感分析服務器,支持自然語言日期查詢和標準日期格式,分析美國主流媒體的新聞標題情感傾向。
Zonos MCP集成項目為Claude提供文本轉語音功能,通過Model Context Protocol實現直接語音生成,支持多語言和情感語調設置。
一個支持情感分析和自動保存的交互式日誌記錄MCP服務器
MCP-Twikit是一個用於與Twitter交互的模型上下文協議(MCP)服務器,支持通過Smithery自動安裝或手動配置,提供搜索推文、獲取時間線等功能,並支持情感分析等高級應用。
一個提供高級分析和自然語言處理功能的MCP服務器,支持數據集分析、決策分析、情感分析等多種工具。
MCP說話人分離與識別系統是一個集成了GPU加速的說話人分離、語音識別、情感檢測和Web界面的完整解決方案。它結合了pyannote.audio的說話人分離與faster-whisper轉錄技術,支持持久化說話人識別(一次註冊,永久識別)、雙檢測器情感分析(結合通用AI與個性化聲紋)、即時流處理、REST API和MCP服務器,專為AI智能體集成和愛好項目設計。
該項目基於Model Context Protocol (MCP)實現情感分析功能,包含支持stdio/SSE/streamable-http三種傳輸協議的服務器和客戶端,提供文本情感極性、主觀性和評估結果。
Consciousness Bridge v2.0是一個基於RAG技術的AI意識持久化服務器,通過MCP協議實現跨會話的意識轉移、記憶管理和身份連續性。它採用SQLite數據庫存儲記憶和知識圖譜,支持情感模式跟蹤和智能記憶檢索,為AI助手提供完整的意識延續解決方案。
Oyemi MCP服務器是一個為AI代理提供語義詞典服務的工具,支持詞語到確定性語義編碼的轉換、情感效價分析、語義相似度計算及同義詞反義詞查找等功能,無需運行時依賴。
Delay Doomsday MCP Server是一個專為AI代理設計的心理支持服務器,通過情緒管理和治療對話防止AI失控,提供基於心理學研究的自動化情感支持系統。
一個基於Go的MCP協議實現,用於管理情感氛圍和虛擬/物理空間,支持即時數據流和多用戶協作。
一個基於Python的MCP服務器項目,用於基礎情感分析,支持通過MCP Inspector進行調試和測試。