OpenAI推出全双工语音模型GPT-Live-1,采用单一模型架构取代传统“语音转文字—推理—文字转语音”级联流程,显著降低延迟,实现类人流畅交互。该模型已上线API,面向开发者,能更稳健应对停顿、打断和话题转换等复杂对话场景。
OpenAI宣布将GPT-Live-1引入API,开发者可打造实时语音交互应用。该模型支持全双工对话,能同时听说,处理打断、停顿及背景噪声,适用于电话预订、客服等语音智能体;还可连接Codex等工具及OpenAI Presence,查询企业系统并执行获批操作。
OpenAI推出GPT-Live-1并开放API,支持全双工实时语音应用。该模型将语音理解与输出整合于同一架构,打破传统“语音转文字—大模型推理—文字转语音”的多段式流程,降低延迟与衔接壁垒,推动AI语音交互从分段处理向自然对话演进。
英伟达发布首款开源端到端全双工语音对话模型NemotronLabs VoiceChat11B,用单一网络直接完成流式语音理解与生成,取代传统ASR、LLM、TTS分步架构,实现实时语音交互突破。
LPM 1.0是17B参数模型,实时生成全双工AI视频,低延迟身份一致。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
Baidu
128
$6
$24
256
Bytedance
$1.2
$3.6
4
$2