英伟达发布Nemotron-Labs-TwoTower离散扩散语言模型,解决大模型逐token生成速度慢的痛点,权重已在Huggingface开源。该模型复用现有骨干网预训练权重,无需从头训练,显著降低成本。采用60B双塔架构,两座30B网络并行协同,每塔激活3B参数并搭载128个可路由专家模块,提升生成效率。
英伟达开源Nemotron-Labs-TwinTower扩散语言模型,通过“双塔”架构突破自回归模型的串行解码瓶颈。该模型将生成任务拆分为两个子网络,其中一个保持冻结,以并行方式提升文本生成吞吐量,为大规模合成任务提供高效新解法。
谷歌于2026年6月发布开源语言模型DiffusionGemma,首次将图像AI扩散机制引入文本生成,打破传统逐字自回归范式。该模型从随机噪声迭代优化,并行输出256个词块。经英伟达优化,在单GPU单用户模式下,运行速度比同类传统模型快近四倍,如H100显卡处理单请求时表现显著提升。
谷歌于6月10日发布开源实验模型DiffusionGemma,采用文本扩散架构,在专用GPU上文本生成速度较传统自回归模型最高提升4倍,旨在提升AI生成效率,但官方对此保持谨慎态度。
开源框架,加速大型视频扩散模型
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
inclusionAI
LLaDA-MoE是基于扩散原理构建的新型混合专家语言模型,是首个开源的MoE扩散大语言模型,在约20万亿个标记上从头预训练,总参数70亿,推理时仅激活14亿参数,在代码生成和数学推理等任务中表现卓越。
JetLM
SDAR是一种新型大语言模型,集成了自回归和离散扩散建模策略,结合了AR模型高效训练和扩散模型并行推理的优势。在通用任务上与SOTA开源AR模型相当,在科学推理任务上表现出色,成为最强大的扩散语言模型。
Dream-org
Dream-Coder-v0-Base-7B 是一款开源的、性能顶尖的代码生成扩散大语言模型,专注于代码生成任务。
Skywork
SkyReels V2是首个采用自回归扩散强制架构的开源视频生成模型,支持无限长度电影生成,在公开模型中实现了最先进的性能表现。
ostris
开源80亿参数文本生成图像扩散模型,内置通用控制和图像修复功能
SkyReels V2 是一个采用自回归扩散强制架构的开源视频生成模型,支持无限长度电影生成,在公开模型中实现了最先进的性能表现。
SkyReels V2是首个采用自回归扩散强制架构的开源视频生成模型,支持无限时长电影生成,在公开模型中实现最先进的性能表现。
codewithdark
DiffusionLLM是基于扩散模型的文本生成项目,使用wikitext-103-v1数据集训练,专注于高质量文本生成任务。该项目采用transformers库和PyTorch框架,通过BLEU指标评估性能,遵循MIT开源许可证。
retronic
一款开源的表情符号生成器,基于扩散模型和LoRA微调技术,能够根据文本描述生成高质量的表情符号。
zai-org
CogVideoX1.5-5B-I2V是一个开源的图像到视频生成模型,能够将静态图像转换为动态视频。该模型基于扩散模型架构,支持从单张图像生成高质量的视频内容,类似于商业产品清影。
kandinsky-community
Kandinsky 3.0是基于Kandinsky2-x模型系列开发的开源文生图扩散模型,融合了更多俄罗斯文化相关数据,提升了文本理解与视觉生成质量。
alibaba-pai
阿里巴巴PAI团队开源的中文潜在扩散模型,支持中文文本到图像生成
阿里巴巴开源的中文美食主题隐扩散模型,支持根据中文文本生成高质量美食图像