商汤开源轻量级多模态模型SenseNova U1.5-Lite-Preview,采用8B-MoT参数和NEO-unify架构,支持原生4K图像生成、精细纹理、精准中英文字生成及稳定图像编辑。该模型重点提升长篇自然语言与结构化视觉指令理解,实现复杂需求下的精准多模态生成。
xAI升级视频模型Imagine Video1.5,新增图像参考、语音参考、纯文本生成视频及原生1080p输出,强化角色一致性与场景控制。文本转视频和1080p功能已在Grok Imagine各端上线,图像与语音参考率先向美国SuperGrok Heavy/Plus用户开放,后续将扩大覆盖。
MiniMax推出全模态生成模型H3,承诺近期全面开源。该模型支持文本、图像、视频、声音任意组合输入,可生成带原生双声道音频的高清视频,用户只需提供参考素材即可驱动创作。
MiniMax发布通用全模态模型H3,首次统一文本、图像、视频、音频的理解与生成,打破视频生成任务割裂,推动从“专用专家”向“通用助手”转型。H3支持原生双声道音视频输出,可生成最高15秒2K分辨率内容,在指令遵循、品牌呈现及视频到视频迁移等方面表现突出。
Tyndall AI是用于图像和视频生成的AI原生创意工具包
谷歌原生多模态AI视频生成与编辑工具,支持文本、图像和音频一键同步创作。
在线文本转视频、图像转视频,支持运动控制,生成带原生音频的电影剪辑。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
Owen777
UltraFlux是一款基于Flux的扩散变换器,专门用于原生4K文本到图像生成。它通过数据、架构和损失的协同设计,能够在各种不同纵横比下保持一致的图像质量。
showlab
Show-o2 是一个改进的原生统一多模态模型,利用自回归建模和流匹配技术,支持文本、图像和视频模态的统一理解和生成。
Show-o2是一个改进的原生统一多模态模型,支持文本、图像和视频模态的理解与生成。
Runware
基于扩散的文本生成图像模型,支持自然语言和原生标签输入,采用v-prediction预测机制
Laxhar
基于Illustrious-xl训练的文本到图像生成模型,使用最新Danbooru和e621数据集训练,带有原生标签标注
craftsman3d
巧匠是一个基于原生3D生成与交互式几何优化的高保真网格生成系统,能够从单张图像生成高质量的3D网格模型。
基于Laxhar/noobai-XL_v1.0微调的图像生成模型,支持原生标签和自然语言描述,采用v预测模型。
基于Illustrious-xl训练的文本到图像生成模型,采用完整Danbooru和e621数据集训练,支持原生标签标注