7月7日,Meta发布其超级智能实验室首个AI图像生成模型Muse Image,通过Meta AI应用免费上线,并集成至Instagram与WhatsApp。用户只需输入自然语言描述,即可生成高质量图像,支持模拟历史地标合影、擦除背景路人、生成自定义二维码等场景。
谷歌宣布向全美免费用户开放Gemini平台个性化AI图像生成功能,昔日付费独享走向大众。用户现可自定义并锁定专属视觉风格,告别每次生成时需重复描述画风与背景的繁琐,让创作更加高效。
xAI发布Grok Imagine Video1.5预览版,进军AI视频生成赛道。该模型可将单张静态图片转换为短视频,支持720p分辨率输出。用户上传图片后,通过文本提示描述镜头运动、画面节奏和氛围,模型能保留原始图像细节、光影和风格,生成自然流畅的动态视频。
苹果公司于5月19日发布一系列由Apple Intelligence驱动的新AI辅助功能,并借助Apple Vision Pro推出革命性眼控轮椅技术,标志着无障碍领域的重大突破。此次更新深度融合端侧AI,在保障隐私的前提下升级核心辅助功能,如“旁白”图像浏览器通过AI实现更精细的账单、照片等视觉内容描述。
AI驱动,将图像和视频转化为描述、OCR、Alt文本等多种形式
最简单的AI家谱图生成器,可文本描述或上传图像,秒建、分析并导出PDF。
免费的GPT Image 2生成器,无需注册,可将描述转化为高保真图像。
Seedream 5.0可将文本描述瞬间转化为精美图像,免费且无限创作
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
-
$1
$10
256
$2
$20
$8
$240
52
Bytedance
$1.2
$3.6
4
gguf-org
flux2-dev-gguf 是一个基于 FLUX.2-dev 的图像到图像转换模型,专门用于根据文本提示生成特定风格的图像。该模型支持在 ComfyUI 环境中运行,能够将文本描述转换为风格化的视觉内容。
ostris
这是一个基于LoRA技术的文本到图像转换模型,专门用于生成具有法国印象派画家贝尔特·莫里索艺术风格的图像。该模型在FLUX.2-dev基础模型上训练,能够将普通图像或文本描述转换为莫里索风格的画作。
uriel353
Anime2Realism是一个基于Qwen/Qwen-Image基础模型的文本到图像转换模型,专门实现从动漫风格到写实风格的图像转换。该模型利用LoRA和Diffusers技术,能够根据文本描述生成相应的写实风格图像。
mradermacher
这是Qwen3-VL-8B-Abliterated-Caption-it模型的静态量化版本,支持多语言图像描述任务,提供多种量化级别选择,平衡性能与资源需求。
Svngoku
Qwen3-VL-TimeTravel是基于Qwen3-VL-8B-Instruct模型,使用Unsloth库在MBZUAI/TimeTravel数据集上进行微调得到的版本。该模型专门用于生成历史文物图像的描述,在历史和文化文物分析方面具有专业能力。
briaai
FIBO是首个专为长结构化描述训练的开源文本到图像模型,为可控性、可预测性和特征解耦设定了新标准。该模型拥有80亿参数,仅使用有许可的数据进行训练,支持专业工作流程需求。
lichorosario
这是一个基于Qwen-Image模型训练的LoRA(Low-Rank Adaptation)模型,专门用于文本到图像的生成任务。该项目使用AI Toolkit训练,能够将文本描述转化为高质量的图像,支持在多种图像生成工具中使用。
bghira
这是一个基于PixArt-900M-1024模型的LyCORIS适配器,专门用于文本到图像的转换任务。该模型能够根据输入的文本描述生成相应的图像,支持多种分辨率的图像生成。
MadhavRupala
Stable Diffusion v1-5是基于潜在扩散技术的文本到图像生成模型,能够根据文本描述生成逼真的图像。该模型在LAION-2B数据集上训练,支持英语文本输入,生成512x512分辨率的图像。
这是一个基于Qwen-Image模型使用LoRA技术进行微调的文本到图像生成模型,能够将输入的文本描述转化为对应的图像,支持生成人物形象、影视角色和特定场景等多种类型的图像。
John6666
Illustrious-xl-early-release-v0 是一款基于 Stable Diffusion XL 架构的文本到图像生成模型,专门针对动漫和2D插画风格进行优化,能够根据文本描述生成高质量的图像作品。
hunyuanvideo-community
混元图像2.1是基于diffusers库的文生图模型,能够根据文本描述生成高质量的图像,支持中英双语输入,为用户提供便捷的图像生成体验。
manycore-research
FLUX.1 Wireframe [dev] LoRA 是 FLUX.1-Layout-ControlNet 的改进版本,作为 SpatialGen 的关键组件,能够根据文本描述生成图像,同时遵循给定线框图像的结构。该模型适用于 FLUX.1 [dev] 框架,专门用于室内场景生成任务。
uwcc
poshanimals是一个基于FLUX.1-dev模型训练的文本到图像生成模型,使用AI Toolkit by Ostris训练,能够根据文本描述生成具有特定风格的图像作品。
tekoaly4
这是一个基于stabilityai/stable-diffusion-3.5-large的LyCORIS适配器,专门用于文本到图像生成,能够根据文本描述生成高质量的产品摄影图像,特别针对Borges品牌产品进行了优化。
FLUX.1-Layout-ControlNet是SpatialGen框架的关键组件,是一个基于语义图像条件化的ControlNet模型。它能够根据文本描述生成2D图像,同时严格遵循输入语义图像的布局约束,主要用于3D室内场景合成。
Immac
NetaYume Lumina Image 2.0 是一个文本到图像的扩散模型,经过GGUF格式量化处理,能够将文本描述转换为图像。该模型经过优化,在保持生成质量的同时减少了内存使用和提升了性能。
davidrd123
这是一个基于Qwen/Qwen-Image的LyCORIS适配器,专门用于文本到图像的生成任务。该模型能够根据输入的文本描述生成相应的图像,特别擅长生成具有涂鸦风格和混合媒体效果的图像内容。
duyntnet
Chroma 是一个高质量的文本到图像生成模型,专注于生成逼真的图像内容。该模型采用先进的扩散技术,能够根据文本描述生成高质量的视觉内容,特别适合本地部署环境下的图像创作需求。
Kakyoin03
本模型是基于Llama-3.2-11B-Vision-Instruct微调的专业汽车损伤检测模型,专门用于自动分析受损车辆图像,能够精准识别和描述车辆损伤类型、位置和严重程度。
基于即梦AI的图像生成服务,专为Cursor IDE设计,实现文本描述到图像的生成与保存。
一个基于xAI Grok API的MCP服务器,提供AI图像分析功能,支持URL和本地文件的图像描述、元数据提取和OCR文字识别
基于Florence-2的MCP图像处理服务
Deep Research是一个基于代理的工具,提供网页搜索和高级研究功能,支持PDF分析、图像描述和YouTube转录提取,可作为MCP服务器运行。
一个提供图像识别功能的MCP服务器,支持Anthropic和OpenAI的视觉API,具备图像描述、多格式支持、可配置主备服务商及OCR文本提取功能。
Moondream MCP Server是一个基于Moondream视觉模型的图像分析服务,提供图像描述生成、物体检测和视觉问答功能,可轻松集成到Claude和Cline等AI助手中。
一个基于Go语言的MCP服务器,通过OpenAI的DALL-E API实现文本描述生成图像功能,可与Claude等大型语言模型集成使用。
一个基于Google Gemini图像生成模型的MCP服务器,允许AI代理通过文本提示生成、编辑和描述图像,支持多种模型和配置选项。
Gemini Nanobanana MCP 是一个让用户通过文本描述生成AI图像的Claude插件,集成了Google Gemini 2.5 Flash图像生成功能,支持多种图像编辑和创作方式。
一个基于Inspire后端图像搜索能力的MCP服务器,提供通过文本描述搜索相似图片的功能。
该项目实现了一个MCP服务器,通过OpenAI的gpt-image-1模型提供图像生成和编辑功能,支持文本描述生成图像、基于参考图像编辑或修复图像,并可将结果保存到本地。
Flux Image MCP Server是一个基于Flux Schnell模型的图像生成服务,通过Replicate平台提供API接口,支持通过文本描述生成图像。
该项目是一个连接ComfyUI的MCP服务器实现,提供图像生成、图像描述生成、标签解析等功能,支持通过API与ComfyUI交互进行图像处理。
一个基于Amazon Bedrock Nova Canvas模型的MCP服务器,提供高质量的AI图像生成服务,支持文本描述生成图像、负面提示优化、尺寸配置和种子控制等功能。
一个基于Model Context Protocol的图像识别服务器,通过OpenAI兼容的视觉模型提供图像分析和描述功能,支持云端和本地模型集成。
一个基于Freepik Flux AI的MCP服务器,用于通过文本描述生成图像,支持多种宽高比,并与Claude Desktop集成。
一个基于HTTP的图片生成服务器,通过调用Replicate的Flux Schnell模型来根据文本描述生成图像。
Nano Banana是一个专业的MCP扩展,用于通过文本描述生成、编辑和修复图像,支持多种图像处理功能,如生成图标、图案、故事和图表等。
一个基于Go语言的MCP服务器,通过OpenAI的DALL-E API实现文本描述生成图像功能,支持与Claude等大型语言模型集成。
一个基于GPT-4o-mini模型的图像分析MCP服务器,通过接收图片URL进行内容识别和描述