MiniMax开源多模态生成模型H3,摩尔线程随即基于国产智算卡MTT S5000完成极速适配。H3打破单任务局限,能融合文本、图像、音频与视频输入,精准理解创作意图,可直接生成2K分辨率、最长15秒视频。
MiniMax推出全模态生成模型H3,承诺近期全面开源。该模型支持文本、图像、视频、声音任意组合输入,可生成带原生双声道音频的高清视频,用户只需提供参考素材即可驱动创作。
阿里发布Qwen-Image-3.0图像生成基础模型,支持最长4.5K Token文本输入,可一次性生成公式、几何图形、逻辑推导及多层UI等复杂内容,原生兼容12种语言和20余款字体渲染,文本长度较上代提升4.5倍,大幅强化影视分镜、知识图解等商业级图文创作能力。
字节跳动发布多模态AI模型Seedream5.0Pro,推动图像创作从生成迈向设计。该模型在图文匹配、结构合理性、文字渲染和画面质感上显著提升,并重点突破复杂信息可视化能力,能精准解析意图,将数据、概念和密集文字转化为专业视觉呈现。
免费AI 3D模型生成器,可秒将文本和图像转化为3D模型,适合多领域创作者。
V2Fun的AI 3D创作平台,可从文本或图像生成3D模型、角色、游戏资源和动画。
在线AI图像转视频生成器,上传图片、加提示词、选模型即可创作
Meta超智能实验室先进图像生成模型,可创作、编辑和混合图像。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
tencent
混元视频-1.5是一款轻量级高性能视频生成模型,仅用83亿参数就能提供顶级的视频质量,显著降低了使用门槛。它能在消费级GPU上流畅运行,支持文本到视频和图像到视频生成,让每个开发者和创作者都能轻松使用。
chetwinlow1
Ovi是一款先进的音频-视频生成模型,能够根据文本或文本+图像输入同时生成同步的视频和音频内容。该模型采用双骨干架构,支持5秒视频生成,为多媒体创作提供了强大的工具。
madcaptj
这是一个基于Qwen/Qwen-Image基础模型训练的图像转视频LoRA模型,专门用于图像生成任务,为图像创作提供了新的可能性。
elixirx
charu-anime-lora是一个基于LoRA技术的文生图模型,专门用于生成精美的动漫风格图像,以Qwen/Qwen-Image为基础模型,为动漫图像创作提供高效解决方案。
duyntnet
Chroma 是一个高质量的文本到图像生成模型,专注于生成逼真的图像内容。该模型采用先进的扩散技术,能够根据文本描述生成高质量的视觉内容,特别适合本地部署环境下的图像创作需求。
John6666
Noobai-XL-1.0是基于Stable Diffusion XL技术的文本到图像生成模型,专注于生成逼真、写实风格的图像,为图像创作领域提供高质量的AI生成解决方案。
Crealism Terra Mirabilis 是一款基于 Stable Diffusion XL 技术的文本到图像生成模型,专注于生成具有高度真实感的图像,支持亚洲和欧洲风格的多种特色图像创作,适用于创意、时尚、肖像等领域。
Intorealism XL 是一款强大的文本到图像生成模型,能够生成逼真、细腻的图像,涵盖人像、风景等多种主题,在光影、纹理等方面表现出色,严格遵循输入提示进行图像创作。
Keltezaa
MillieBB_v2是一个基于LoRA和Diffusers技术的文本到图像生成模型,能够根据文本提示生成特定风格的图像,为图像创作提供了新的可能性。
这是由SoloLee创作的以Emma Watson为主题的图像生成模型,基于black-forest-labs/FLUX.1-dev开发,专门用于生成Emma Watson风格的图像作品
KiraDepth 是一个基于稳定扩散XL的文本到图像生成模型,专注于生成具有深度、细节和阴影的2.25D/2.5D风格图像,特别适合动漫风格的创作。
city96
Wan2.1-FLF2V-14B-720P 是一个视频生成模型,支持从图像生成视频,适用于多种视频创作场景。
一个支持多种风格的文本到图像生成模型,特别适合动漫、漫画等风格的图像创作。
Realistic Vision V5.1是一个基于Stable Diffusion XL的文本到图像生成模型,专门用于生成逼真的照片级图像。该模型在图像创作领域具有较高的应用价值,能够根据文本描述生成高质量的写实风格图像。
基于稳定扩散XL的动漫风格文本到图像生成模型,专注于高质量动漫角色创作
基于Stable Diffusion XL的2.5D风格文本生成图像模型,支持照片级真实感和艺术风格生成,特别擅长女性形象和女同性恋主题创作。
glif-loradex-trainer
apu_apustaja_cartoon 是一个文本到图像的模型,可根据特定触发词生成相关卡通图像,为图像创作带来新的可能。
dima806
基于Vision Transformer (ViT)的图像分类模型,用于区分AI生成与人类创作的图像,准确率达98%。
LHRuig
这是一个文本到图像的LoRA模型,能够基于特定提示词生成高质量的图像,为图像创作带来更多可能性。
Yntec
融合Lehina模型与Delicate模型元素的精致文本生成图像模型,擅长超写实、美学风格及角色创作。
一个通过fal.ai API和MCP协议从文本生成图像的Node.js工具,支持多种模型和参数,适合开发者和创作者快速生成图像。
ImgMCP是一个多媒体AI模型聚合平台,通过统一的MCP协议和API,为用户提供便捷访问和使用多种AI模型(如图像生成、理解、处理)的能力,旨在连接AI能力与用户创意,提升创作体验与效率。