9月16日,2026 vivo开发者大会宣布蓝心大模型全面升级,打造以个人为中心的智能体矩阵,发布Blue LM-RealTime、Nano、Flash、Pro四款核心模型,覆盖语音理解、端侧感知记忆与云侧任务执行。语音模型采用端到端架构,抗嘈杂口音,端侧模型可沉淀个人记忆。
谷歌发布新一代实时语音大模型Gemini3.8 Live及扩展思考版,实现原生端到端音频交互突破,降低对话延迟、提升自然度,并首次在低延迟语音流中支持深层多步推理,重塑复杂专业场景下的语音AI应用范式。
xAI推出Voice Agent Builder测试版,通过零代码平台和自研Grok Voice模型,将企业级语音智能体搭建缩短至两分钟。其核心为高度集成的端到端架构,解决了传统方案语音转文字等多环节割裂的痛点,大幅降低了开发与运营门槛。
阿里通义千问团队开源Qwen3-TTS系列语音生成模型,采用端到端架构,支持秒级音色克隆、自然语言音色设计和实时流式输出。其核心创新Dual-Track双轨混合流式生成机制结合离散多码本语言模型,实现极致低延迟,大幅降低实时应用门槛。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
$8
$240
52
Bytedance
$1.2
$3.6
4
stepfun-ai
Step-Audio 2 是一款端到端的多模态大语言模型,专为满足行业级音频理解和语音对话需求而设计。具备先进的语音和音频理解能力、智能语音对话功能、工具调用和多模态检索增强生成能力,在多个音频理解和对话基准测试中取得了领先的性能。
Emova-ollm
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,能够生成具有情感控制的文本和语音响应。
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,具备情感语音对话能力。
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,无需依赖外部模型即可实现多模态理解和生成。
facebook
Meta公司开发的Kuwaa语(blh)文本转语音模型,属于大规模多语言语音计划的一部分,采用VITS端到端语音合成架构
Meta公司开发的哈里亚纳维语文本转语音模型,属于大规模多语言语音(MMS)项目的一部分,采用VITS端到端语音合成架构。
Meta公司开发的邦板牙语文本转语音模型,属于大规模多语言语音项目的一部分,采用VITS端到端语音合成架构。
Meta公司开发的荷兰语文本转语音模型,属于大规模多语言语音项目的一部分,采用VITS端到端语音合成架构。