商汤发布开源轻量多模态模型SenseNova U1.5-Lite-Preview,基于原生NEO-Unify架构,仅8B-MoT参数即实现媲美闭源模型的生成与编辑质量。它支持多模态理解、推理及4K高分辨率,以小体量挑战大模型军备竞赛。
商汤开源轻量级多模态模型SenseNova U1.5-Lite-Preview,采用8B-MoT参数和NEO-unify架构,支持原生4K图像生成、精细纹理、精准中英文字生成及稳定图像编辑。该模型重点提升长篇自然语言与结构化视觉指令理解,实现复杂需求下的精准多模态生成。
字节跳动发布 Seedance 2.5 视频生成模型,单次生成时长翻倍至 30 秒,将陆续上线即梦 AI、豆包专业版,API 接入火山方舟,覆盖影视、广告、教育、工业制造及自动驾驶等场景。该模型延续多模态音视频联合生成架构,重点提升长叙事、多模态参考与编辑能力,推动 AI 视频从短片段迈向长内容创作。
Black Forest Labs发布FLUX3多模态基础模型,采用统一架构联合学习图像、视频和音频。基于Self-Flow自监督流匹配框架,在FLUX系列基础上扩展多模态生成与理解。支持文生视频、图生视频,单次生成最长20秒视频并原生输出同步音频,性能全面超越前代。
多模态驱动的定制视频生成架构。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
$6
$24
Baidu
128
Gjm1234
Wan2.2是基础视频模型的重大升级版本,专注于将有效MoE架构、高效训练策略和多模态融合等创新技术融入视频扩散模型,为视频生成领域带来更强大、更高效的解决方案。
pramjana
Qwen3-VL-4B-Instruct是阿里巴巴推出的40亿参数视觉语言模型,基于Qwen3架构开发,支持多模态理解和对话任务。该模型具备强大的图像理解和文本生成能力,能够处理复杂的视觉语言交互场景。
HIT-TMG
Uni-MoE 2.0-Omni 是荔枝科技(Lychee)推出的完全开源全模态模型,采用全模态 3D RoPE 和动态容量专家混合架构,显著提升了以语言为中心的多模态理解、推理和生成能力。该版本集成了全模态理解以及音频和图像生成能力。
unsloth
Qwen3-VL是迄今为止Qwen系列中最强大的视觉语言模型,在文本理解与生成、视觉感知与推理、上下文长度、空间和视频动态理解以及智能体交互能力等方面都进行了全面升级。该模型采用混合专家(MoE)架构,提供卓越的多模态处理能力。
Hugguf
Qwen3-VL-30B-A3B-Instruct是基于Qwen3-VL-30B模型的多模态视觉语言模型,支持图像和文本的联合理解与生成任务。该模型采用先进的视觉语言融合架构,能够处理复杂的多模态推理任务。
inclusionAI
Ming-flash-omni 预览版是基于 Ling-Flash-2.0 稀疏专家混合(MoE)架构构建的多模态大模型,总参数达100B,每个token仅激活6B参数。该模型在Ming-Omni基础上进行了全面升级,在多模态理解和生成方面有显著提升,特别是在语音识别、图像生成和分割编辑方面表现突出。
QuantStack
Qwen-Image是基于Qwen架构的多模态视觉语言模型,支持文本到图像的生成任务,采用GGUF格式转换以便在ComfyUI中使用,保留了原模型的Apache-2.0许可证和使用限制。
Mungert
ERNIE-4.5-21B-A3B-PT是基于MoE架构的先进文本生成模型,具有210亿参数和高效的多模态处理能力。
gabriellarson
ERNIE-4.5-300B-A47B 是一款基于 MoE 架构的多模态预训练模型,具备强大的文本理解和生成能力,支持视觉-语言联合推理。
Undi95
Llama 4 Maverick 是 Meta 发布的多模态 AI 模型,支持文本与图像理解,采用混合专家架构(MoE),在多语言文本和代码生成任务中表现优异。
samgreen
Qwen2.5-VL-7B-Captioner-Relaxed 是一个多模态视觉语言模型,基于 Qwen2.5 架构,专注于图像到文本的生成任务。
Athagi
Janus-Pro 是一种新颖的自回归框架,统一了多模态理解和生成。它通过解耦视觉编码路径,使用单一的统一 Transformer 架构处理多模态任务。
deepseek-ai
Janus-Pro 是一种新颖的自回归框架,统一了多模态理解与生成能力。通过解耦视觉编码路径,使用单一 Transformer 架构处理多模态任务。
Janus-Pro 是一种创新的自回归框架,统一了多模态理解与生成功能。通过解耦视觉编码路径,采用单一Transformer架构处理,解决了视觉编码器在理解与生成角色间的冲突。
THUdyh
Ola-7B是由腾讯、清华大学和南洋理工大学联合开发的多模态大语言模型,基于Qwen2.5架构,支持处理文本、图像、视频和音频输入,并生成文本输出。
nvidia
NVIDIA开发的基于扩散架构的多模态世界基础模型,能够根据文本输入生成高质量物理感知视频
mradermacher
这是一个基于Qwen2架构的多模态模型,专注于文本生成、图像转文本和视觉问答任务。
这是一个基于Qwen2架构的多模态模型,支持文本生成、图像转文本和视觉问答任务,提供多种量化版本以适应不同需求。
second-state
Qwen2-VL-2B-Instruct 是一个多模态视觉语言模型,支持图像文本生成任务,基于 Qwen2 架构,参数规模为 2B。
gpustack
StableDiffusion 3.5 中型模型的 GGUF 版本是基于文本生成图像的强大扩散模型,在图像质量、排版效果、复杂提示理解和资源效率方面有显著提升。该模型采用改进的多模态扩散变换器架构,支持多种文本编码器,适用于艺术创作、教育工具和生成模型研究等场景。