谷歌I/O大会发布AI创作工具重大升级,核心是通过新一代Gemini模型降低创作门槛。亮点是Gemini Omni多模态模型,能无缝整合文本、图像、音频和视频,实现高效的跨模态理解与处理。
谷歌发布新一代Google Home智能音箱,首次深度整合自研Gemini大模型。该设备旨在通过更强的语义理解和智能交互,重塑智能家居体验,标志谷歌AI技术正式全面赋能音频硬件。
Stability AI 发布新一代音频大模型Stable Audio3,并开源部分权重。该模型基于潜扩散技术,支持高品质立体声输出,生成速度显著提升。提供多种规格版本,满足音乐创作和音效制作等需求,并支持可变长度音频生成。
MiniMax发布新一代音乐大模型Music2.5,通过技术创新显著提升AI音乐的专业性与听感。模型重点突破两大核心技术:段落级强控制,精准把握音乐结构,使乐曲逻辑更严密;物理级高保真,大幅提升音频质量。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
Bytedance
$1.2
$3.6
4
DAMO-NLP-SG
VideoLLaMA 2是新一代视频大语言模型,专注于提升时空建模能力和音频理解能力,支持多模态视频问答和描述任务。