MiniMax推出全模态生成模型H3,承诺近期全面开源。该模型支持文本、图像、视频、声音任意组合输入,可生成带原生双声道音频的高清视频,用户只需提供参考素材即可驱动创作。
阿里发布Qwen-Image-3.0图像生成基础模型,支持最长4.5K Token文本输入,可一次性生成公式、几何图形、逻辑推导及多层UI等复杂内容,原生兼容12种语言和20余款字体渲染,文本长度较上代提升4.5倍,大幅强化影视分镜、知识图解等商业级图文创作能力。
谷歌9日宣布在“我的广告中心”新增“此广告如何制作”信息区块,提升生成式AI在广告中的透明度。新规覆盖搜索、YouTube与Discover等平台。采用谷歌自家AI工具创作或编辑文本、图像及事件的广告,将自动展示AI披露标签;使用第三方工具生成的内容也将纳入披露范畴。
字节跳动发布多模态AI模型Seedream5.0Pro,推动图像创作从生成迈向设计。该模型在图文匹配、结构合理性、文字渲染和画面质感上显著提升,并重点突破复杂信息可视化能力,能精准解析意图,将数据、概念和密集文字转化为专业视觉呈现。
V2Fun的AI 3D创作平台,可从文本或图像生成3D模型、角色、游戏资源和动画。
专为Web3创作者打造的AI设计工具,可创建多种NFT视觉内容。
在线AI图像转视频生成器,上传图片、加提示词、选模型即可创作
Kira创作者共创社区,创造值得分享的快乐
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
-
$1
$10
256
$2
$20
$8
$240
52
Bytedance
$1.2
$3.6
4
tencent
混元视频-1.5是一款轻量级高性能视频生成模型,仅用83亿参数就能提供顶级的视频质量,显著降低了使用门槛。它能在消费级GPU上流畅运行,支持文本到视频和图像到视频生成,让每个开发者和创作者都能轻松使用。
chetwinlow1
Ovi是一款先进的音频-视频生成模型,能够根据文本或文本+图像输入同时生成同步的视频和音频内容。该模型采用双骨干架构,支持5秒视频生成,为多媒体创作提供了强大的工具。
madcaptj
这是一个基于Qwen/Qwen-Image基础模型训练的图像转视频LoRA模型,专门用于图像生成任务,为图像创作提供了新的可能性。
elixirx
charu-anime-lora是一个基于LoRA技术的文生图模型,专门用于生成精美的动漫风格图像,以Qwen/Qwen-Image为基础模型,为动漫图像创作提供高效解决方案。
duyntnet
Chroma 是一个高质量的文本到图像生成模型,专注于生成逼真的图像内容。该模型采用先进的扩散技术,能够根据文本描述生成高质量的视觉内容,特别适合本地部署环境下的图像创作需求。
John6666
Noobai-XL-1.0是基于Stable Diffusion XL技术的文本到图像生成模型,专注于生成逼真、写实风格的图像,为图像创作领域提供高质量的AI生成解决方案。
camenduru
FLUX.1 [dev] 是一个具有120亿参数的整流流变压器,专门用于文本到图像生成。它在图像生成质量方面表现卓越,仅次于FLUX.1 [pro],具有出色的提示跟随能力和高效的训练方式,为科研和创作提供强大支持。
Crealism Terra Mirabilis 是一款基于 Stable Diffusion XL 技术的文本到图像生成模型,专注于生成具有高度真实感的图像,支持亚洲和欧洲风格的多种特色图像创作,适用于创意、时尚、肖像等领域。
Intorealism XL 是一款强大的文本到图像生成模型,能够生成逼真、细腻的图像,涵盖人像、风景等多种主题,在光影、纹理等方面表现出色,严格遵循输入提示进行图像创作。
Keltezaa
MillieBB_v2是一个基于LoRA和Diffusers技术的文本到图像生成模型,能够根据文本提示生成特定风格的图像,为图像创作提供了新的可能性。
这是由SoloLee创作的以Emma Watson为主题的图像生成模型,基于black-forest-labs/FLUX.1-dev开发,专门用于生成Emma Watson风格的图像作品
KiraDepth 是一个基于稳定扩散XL的文本到图像生成模型,专注于生成具有深度、细节和阴影的2.25D/2.5D风格图像,特别适合动漫风格的创作。
city96
Wan2.1-FLF2V-14B-720P 是一个视频生成模型,支持从图像生成视频,适用于多种视频创作场景。
一个支持多种风格的文本到图像生成模型,特别适合动漫、漫画等风格的图像创作。
Realistic Vision V5.1是一个基于Stable Diffusion XL的文本到图像生成模型,专门用于生成逼真的照片级图像。该模型在图像创作领域具有较高的应用价值,能够根据文本描述生成高质量的写实风格图像。
基于稳定扩散XL的动漫风格文本到图像生成模型,专注于高质量动漫角色创作
基于Stable Diffusion XL的2.5D风格文本生成图像模型,支持照片级真实感和艺术风格生成,特别擅长女性形象和女同性恋主题创作。
glif-loradex-trainer
apu_apustaja_cartoon 是一个文本到图像的模型,可根据特定触发词生成相关卡通图像,为图像创作带来新的可能。
dima806
基于Vision Transformer (ViT)的图像分类模型,用于区分AI生成与人类创作的图像,准确率达98%。
LHRuig
这是一个文本到图像的LoRA模型,能够基于特定提示词生成高质量的图像,为图像创作带来更多可能性。
MCP Kling是首个且唯一完整的Kling AI MCP服务器,提供13种创意工具,支持视频生成、图像处理、唇形同步及虚拟试衣等功能,实现与Claude的无缝集成,适用于内容创作者和开发者。
基于Google Gemini 2.5 Flash API的MCP图像生成与编辑服务器,支持文本生成图像、图像编辑、迭代创作和风格迁移功能
Gemini Nanobanana MCP 是一个让用户通过文本描述生成AI图像的Claude插件,集成了Google Gemini 2.5 Flash图像生成功能,支持多种图像编辑和创作方式。
一个通过fal.ai API和MCP协议从文本生成图像的Node.js工具,支持多种模型和参数,适合开发者和创作者快速生成图像。
ImgMCP是一个多媒体AI模型聚合平台,通过统一的MCP协议和API,为用户提供便捷访问和使用多种AI模型(如图像生成、理解、处理)的能力,旨在连接AI能力与用户创意,提升创作体验与效率。
SVGMaker MCP Server是一个基于SVGMaker API的强大服务,用于生成、编辑和转换SVG图像。它支持AI驱动的SVG创作、智能编辑、图像转SVG等功能,并提供安全文件操作和实时进度更新。
MCP-SynClub-Generate-Comic是一个专为漫画创作设计的Claude桌面扩展,集成了从剧本生成、角色图像生成、故事板创建到最终漫画图像生成的全流程工作流。
VideoCutter是一款集成视频、音频、图像处理的专业多媒体工具,支持AI智能编辑和MCP协议,提供一站式智能化创作解决方案。