OpenAI被曝将推出下一代双向音频模型GPT-Bidi-1,升级ChatGPT语音模式。该模型采用双向架构,突破传统单工对讲,可同时聆听与表达,实时捕捉用户插话打断并动态调整语义,避免卡顿,大幅提升交互体验。
Spotify与环球音乐达成里程碑式授权协议,首次允许付费用户利用AI翻唱和重混授权艺人的歌曲。该功能作为增值服务专为Premium会员打造,粉丝可亲自改编泰勒·斯威夫特等艺人的作品,标志着音乐消费从被动聆听向主动创作转型。
LPM1.0模型发布,能通过单张参考图实时生成人物说话、聆听及唱歌视频。其核心突破在于多模态处理,可同步整合文本、音频与图像,生成唇形精准同步、表情细腻且情绪过渡自然的动态画面。该模型支持接入ChatGPT等主流语音AI,将传统语音对话升级为具备视觉反馈的实时交互。
StepFun AI团队推出音频大模型Step-Audio-R1,通过优化计算资源利用,解决了音频AI模型在长推理链中准确性下降的问题。研究团队指出,问题源于训练时过度依赖文本数据,导致模型推理类似阅读文字而非实际聆听声音。
StemGen: 一款聆听音乐生成模型
Ai音频检测,聆听更真实的互联网
Alibaba
$8
Input tokens/M
$240
Output tokens/M
52
Context Length
Baidu
-