英伟达发布Nemotron-Labs-TwoTower离散扩散语言模型,解决大模型逐token生成速度慢的痛点,权重已在Huggingface开源。该模型复用现有骨干网预训练权重,无需从头训练,显著降低成本。采用60B双塔架构,两座30B网络并行协同,每塔激活3B参数并搭载128个可路由专家模块,提升生成效率。
智谱联合华为开源图像生成模型GLM-Image,这是首个在国产芯片上完成全流程训练的SOTA多模态模型。其创新采用“自回归+扩散解码器”混合架构,实现了图像生成与语言模型的深度融合,在知识密集型任务中表现出色,能精准理解全局指令。
清华大学与快手可灵团队合作推出SVG模型,替代VAE,解决了语义纠缠问题,训练效率提升6200%,生成速度提高3500%,标志着VAE在图像生成领域逐步淘汰。
Radical Numerics发布30B参数开源扩散语言模型RND1-Base,采用稀疏专家混合架构,仅激活3B参数。该模型具备并行生成优势,在基准测试表现优异,并公开完整权重与训练方案,推动扩散模型技术发展。
无需额外训练的高质量图像修复插件,适用于所有稳定扩散模型。
TokenVerse 是一种基于预训练文本到图像扩散模型的多概念个性化方法。
GameFactory 是一个基于预训练视频扩散模型的通用世界模型,可创建开放领域的游戏。
训练无关的区域提示扩散变换器模型
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
$8
$240
52
Bytedance
$1.2
$3.6
4
Gjm1234
Wan2.2是基础视频模型的重大升级版本,专注于将有效MoE架构、高效训练策略和多模态融合等创新技术融入视频扩散模型,为视频生成领域带来更强大、更高效的解决方案。
sd2-community
Stable Diffusion v2 是一个基于扩散模型的文本到图像生成模型,能够根据文本提示生成和修改图像。该模型在LAION-5B数据集子集上训练,结合了自编码器和扩散模型,在潜在空间中进行训练,支持多种分辨率和任务。
MadhavRupala
Stable Diffusion v1-5是基于潜在扩散技术的文本到图像生成模型,能够根据文本描述生成逼真的图像。该模型在LAION-2B数据集上训练,支持英语文本输入,生成512x512分辨率的图像。
radicalnumerics
RND1是一个实验性的扩散语言模型,拥有300亿参数,采用稀疏专家混合架构。该模型从预训练的自回归基础模型转换而来,支持基于扩散的文本生成,每个标记仅激活30亿参数,在计算效率和模型容量之间取得平衡。
likewendy
Pandora是一个用于生成逼真、高质量手机拍摄风格图像的扩散模型,采用两阶段训练过程,能够生成具有惊喜效果的手机拍摄风格图像。
inclusionAI
LLaDA-MoE是基于扩散原理构建的新型混合专家语言模型,是首个开源的MoE扩散大语言模型,在约20万亿个标记上从头预训练,总参数70亿,推理时仅激活14亿参数,在代码生成和数学推理等任务中表现卓越。
tristan-deep
这是一个基于分数生成扩散模型的医学图像处理模型,专门针对心脏超声图像进行去雾处理。该模型在DehazeEcho2025数据集上训练,能够有效去除超声图像中的雾状干扰,提升图像清晰度。
JetLM
SDAR是一种新型大语言模型,集成了自回归和离散扩散建模策略,结合了AR模型高效训练和扩散模型并行推理的优势。在通用任务上与SOTA开源AR模型相当,在科学推理任务上表现出色,成为最强大的扩散语言模型。
nvidia
Cosmos-Predict2.5是NVIDIA开发的专为物理AI设计的高性能预训练世界基础模型套件,基于扩散模型技术,能够根据文本、图像或视频输入生成具有物理感知的高质量图像和视频,为自动驾驶、机器人等应用提供世界模拟能力。
Mungert
一个专为社区免费开放的图像字幕视觉语言模型(VLM),可用于训练扩散模型,支持多样化的图像风格和内容。
amd
Nitro-T 是一系列专注于高效训练的文本到图像扩散模型,在图像生成基准测试中具有竞争力,训练时间极短。
GSAI-ML
LLaDA 1.5是一款通过方差缩减偏好优化(VRPO)方法训练的大型扩散语言模型,专注于提升文本生成的质量和效率。
rp-yu
Dimple是首个结合自回归与扩散训练范式的离散扩散多模态大语言模型(DMLLM),在LLaVA-NEXT相同数据集上训练后,以3.9%的优势超越LLaVA-NEXT-7B。
Lightricks
基于扩散模型的视频空间分辨率增强工具,专门针对LTX视频模型生成的潜在视频表示进行超分辨率训练
gordon-0115
一个实验性的自然语言到3D模型生成流程,基于改进的预训练多视角扩散模型
jobs-git
SkyReels V2是全球首个采用扩散强制框架的无限长度电影生成模型,融合多模态大语言模型、多阶段预训练、强化学习与扩散强制技术实现全面优化。
Freepik
F Lite是由Freepik与Fal联合开发的100亿参数扩散模型,专注于生成高质量纹理图像,训练数据全部为版权合规且适合工作环境的内容。
F Lite是由Freepik与Fal联合研发的100亿参数扩散模型,训练数据完全采用版权合规且适合工作场景的内容
kaupane
基于Wikiart数据集训练的扩散变换器模型,用于生成艺术作品图像
基于Wikiart数据集训练的扩散变换器模型,用于生成艺术风格图像