英伟达开源Nemotron-Labs-TwinTower扩散语言模型,通过“双塔”架构突破自回归模型的串行解码瓶颈。该模型将生成任务拆分为两个子网络,其中一个保持冻结,以并行方式提升文本生成吞吐量,为大规模合成任务提供高效新解法。
谷歌于6月10日发布开源实验模型DiffusionGemma,采用文本扩散架构,在专用GPU上文本生成速度较传统自回归模型最高提升4倍,旨在提升AI生成效率,但官方对此保持谨慎态度。
Inception Labs推出Mercury2模型,采用扩散模型替代Transformer架构,实现文本生成范式转移。该模型不再逐字生成,而是像编辑一样整体处理文本,旨在突破传统大模型的性能瓶颈。
快手Kling AI 2.6版本发布,首次集成音频生成功能,支持中英双语对白、歌唱与音效,实现文本、视频、音频一键同步生成。技术采用扩散变换器与3D时空联合注意力架构,提升复杂指令遵守率15%,并增强跨镜头角色一致性。视频输出保持10秒1080P高清,生成成本降低30%。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$6
$24
256
Baidu
128
Bytedance
$1.2
$3.6
4
$2
$3.9
$15.2
64
Moonshot
Owen777
UltraFlux是一款基于Flux的扩散变换器,专门用于原生4K文本到图像生成。它通过数据、架构和损失的协同设计,能够在各种不同纵横比下保持一致的图像质量。
radicalnumerics
RND1是一个实验性的扩散语言模型,拥有300亿参数,采用稀疏专家混合架构。该模型从预训练的自回归基础模型转换而来,支持基于扩散的文本生成,每个标记仅激活30亿参数,在计算效率和模型容量之间取得平衡。
John6666
这是一个基于稳定扩散XL架构的文本到图像生成模型,专门用于生成具有高度真实感和丰富色彩的照片级图像。该模型在OnomaAIResearch/Illustrious-xl-early-release-v0基础上构建,专注于提升皮肤质感和色彩表现。
multimodalart
FLUX.1-dev是一个基于通量模型的文本生成图像模型,支持LoRA技术和扩散模型架构,专注于生成等距视角的3D图标。
Efficient-Large-Model
SANA-1.5是一个高效的文本生成图像模型,基于线性扩散Transformer架构,支持1024px高分辨率图像生成。
基于稳定扩散XL架构的文本生成图像模型,专注于生成动漫风格图像,特别是女孩角色。
eldrazeem
一个基于LoRA技术的文本生成图像模型,采用扩散器架构,支持生成具有狂热盒子风格的图像。
nvidia
NVIDIA开发的基于扩散架构的多模态世界基础模型,能够根据文本输入生成高质量物理感知视频
完美小马XL模型是一个基于稳定扩散XL架构的文本到图像生成模型,专门擅长生成动漫风格的图像,特别是动漫女孩和小马等形象,为用户提供独特的动漫图像创作体验。
second-state
Stable Diffusion 3.5 Large 是一个强大的文本生成图像模型,基于扩散模型架构,能够根据文本描述生成高质量的图像。
gpustack
StableDiffusion 3.5 中型模型的 GGUF 版本是基于文本生成图像的强大扩散模型,在图像质量、排版效果、复杂提示理解和资源效率方面有显著提升。该模型采用改进的多模态扩散变换器架构,支持多种文本编码器,适用于艺术创作、教育工具和生成模型研究等场景。
stabilityai
基于多模态扩散Transformer架构的文本生成图像模型,在图像质量、排版效果和复杂提示理解方面有显著提升
这是一个基于稳定扩散技术的文本到图像生成模型,专门用于生成精美的动漫小马风格图像。模型采用稳定扩散XL架构,能够根据文本描述生成高质量的动漫风格图像,适用于动漫创作和艺术设计领域。
FLUX.1-schnell 是一个高效的文本生成图像模型,基于扩散模型架构,支持英文文本输入生成高质量图像。
PixArt-alpha
PixArt-Σ是基于Transformer架构的潜在扩散模型,可直接通过文本提示生成高分辨率图像(最高4K)。
IDEA-CCNL
Taiyi-Diffusion-XL是一个专注于增强中文文生图生成能力的同时保留英文理解能力的双语扩散模型。基于Stable-Diffusion-XL架构,通过高质量双语数据集训练,在图像质量、多样性和文本对齐方面表现出色,为AIGC和数字艺术创作提供新的选择。
ehristoforu
与DALL·E 3高度相似的文本生成图像模型,基于稳定扩散架构微调
nota-ai
BK-SDM是一种经过架构压缩的稳定扩散模型,通过移除U-Net中的残差和注意力块,并在有限数据上进行知识蒸馏训练,实现了高效的文本到图像合成。该模型在保持良好生成质量的同时大幅减少了参数数量。
vinesmsuic
基于InstructPix2Pix架构的图像编辑扩散模型,可根据文本指令修改图像内容
vdo
基于多阶段文本生成视频扩散模型架构,输入英文描述文本可生成符合描述的视频内容