英伟达发布首款开源端到端全双工语音对话模型NemotronLabs VoiceChat11B,用单一网络直接完成流式语音理解与生成,取代传统ASR、LLM、TTS分步架构,实现实时语音交互突破。
Black Forest Labs发布FLUX3多模态基础模型,采用统一架构联合学习图像、视频和音频。基于Self-Flow自监督流匹配框架,在FLUX系列基础上扩展多模态生成与理解。支持文生视频、图生视频,单次生成最长20秒视频并原生输出同步音频,性能全面超越前代。
人工智能初创公司Ideogram发布4.0开放权重文生图模型,拥有93亿参数,采用单流架构实现文本与图像标志融合,被公认为全球最强开源图像生成AI。
AI图像生成平台Ideogram于6月3日发布开放权重模型Ideogram 4.0,拥有93亿参数,采用单流架构实现文本与图像Token联合建模。据官方基准测试,该模型已成为领先的开源图像生成模型之一,尤其在文字生成与版式控制能力上有显著提升。
Alibaba
$2
Input tokens/M
$20
Output tokens/M
-
Context Length
Xai
$1.4
$10.5
256
Openai
$0.35
$2.8
400
Anthropic
$21
$105
200
Google
$0.7
131
Minimax
$1
$8
128
Baidu