9月22日,腾讯混元发布图像3.5预览版,画质、排版、修图等核心能力全面升级,使用成本大幅降低,主打“便宜又好用”。官方称整体能力较上代提升约30%,文字生成更精准,避免缺笔少画;排版更能理解画面布局需求;修图能力同步增强。
9月21日,通义千问团队开源新一代图像模型Qwen-Image-2.1。该模型以仅7B参数的轻量视觉生成模块,统一文生图、透明图像生成与多种图像编辑能力,实现生成效果、推理效率与使用成本的新平衡。其视觉生成采用32层Single-Stream DiT结构,借助混合粒度注意力与KV Cache复用机制,优化多图输入场景下的效率与表现。
百图生科与华大智造达成战略合作,共建细胞大模型,提升细胞状态建模与扰动响应预测能力,并打造高质量数据基础设施,探索“设备+模型+智能体”一体化产品模式,加速AI4S进程。华大智造提供测序与自动化硬件入口,百图生科负责AI建模,双方分工互补。
未发布的GPT Image 2.5引发科技圈关注,版本号从猜测的2.1跃升至2.5,彰显迭代速度与技术野心。该模型被疑为LMArena匿名模型luna-lisa-alpha,多项生图能力全面飞跃,生成速度较前代更快,画面表现亦有显著提升。
OpenAI推出的全能型AI图像生成器,具备超高文本准确率与像素级UI设计能力。
一站式AI API商店,一个接口覆盖视频、图像和音频无限生成能力
前沿AI图像生成器,结合双技术,有卓越文本渲染能力。
Google基于Gemini 3 Pro的AI图像编辑器,推理强,生成编辑能力出色
Openai
$2.8
输入tokens/百万
$11.2
输出tokens/百万
1k
上下文长度
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$6
$24
Baidu
128
$2
$20
GuangyuanSD
Z-Image-Re-Turbo 是一个基于文本生成图像的模型,它在 Z-Image-De-Turbo 模型的基础上进行了去还原和重新加速优化。该模型旨在兼顾训练时的便利性与推理时的速度,恢复了接近原始 Turbo 模型的快速生成能力,同时保持了与 Z-Image-De-Turbo 相同的训练友好特性,使其能够完美兼容 Z-Image 生态系统中已训练的大量 LoRA 模型。
diffusers
FLUX.2-dev是基于NF4量化的DiT和文本编码器的图像生成与编辑模型,提供高质量的图像生成和编辑能力,适用于图像领域的开发应用。
pramjana
Qwen3-VL-4B-Instruct是阿里巴巴推出的40亿参数视觉语言模型,基于Qwen3架构开发,支持多模态理解和对话任务。该模型具备强大的图像理解和文本生成能力,能够处理复杂的视觉语言交互场景。
kayte0342
ChronoEdit-14B是NVIDIA开发的一款具备时间推理能力的图像编辑和世界模拟模型,拥有140亿参数。它通过两阶段推理过程实现物理感知的图像编辑和基于动作条件的世界模拟,从预训练视频生成模型中提炼先验知识。
HIT-TMG
Uni-MoE 2.0-Image 是基于 Uni-MoE 2.0-Omni 派生而来的视觉生成模型,在视觉生成数据上进行了专门微调,具备强大的图像生成和编辑能力。
Uni-MoE 2.0-Omni 是荔枝科技(Lychee)推出的完全开源全模态模型,采用全模态 3D RoPE 和动态容量专家混合架构,显著提升了以语言为中心的多模态理解、推理和生成能力。该版本集成了全模态理解以及音频和图像生成能力。
DavidAU
这是一个增强版的多模态视觉语言模型,基于Qwen3-VL-8B-Thinking模型,通过Brainstorm 20x技术扩展至12B参数,采用NEO Imatrix增强的GGUF量化。模型具备强大的图像理解、文本生成和多模态推理能力,在视觉感知、文本质量和创意场景方面都有显著提升。
peteromallet
QwenEdit InScene LoRAs是基于QwenEdit微调的模型组,专注于增强基于场景参考生成图像的能力。包含InScene主模型和InScene Annotate两个组件,能够在保持角色一致性和场景连贯性的同时创建全新的场景镜头。
QuantTrio
Qwen3-VL-32B-Thinking-AWQ是基于Qwen/Qwen3-VL-32B-Thinking模型的量化版本,是通义系列中最强大的视觉语言模型。该模型具备卓越的文本理解与生成能力、深入的视觉感知与推理能力,支持长上下文和视频理解,适用于图像文本到文本的转换任务。
mlx-community
这是一个基于Qwen3-VL-32B-Thinking模型转换的4位量化版本,专门针对MLX框架优化。该模型是一个32B参数规模的多模态视觉语言模型,具备思维链推理能力,能够同时处理图像和文本输入,生成高质量的文本响应。
Svngoku
Qwen3-VL-TimeTravel是基于Qwen3-VL-8B-Instruct模型,使用Unsloth库在MBZUAI/TimeTravel数据集上进行微调得到的版本。该模型专门用于生成历史文物图像的描述,在历史和文化文物分析方面具有专业能力。
QuantStack
CenKreChro-SVDQ是基于CenKreChro文本到图像模型的量化版本,采用SVDQuant技术进行优化。该模型结合了Chroma和Flux Krea的优势,提供了高效的图像生成能力,特别针对不同GPU架构进行了优化。
mrgant
lans_v1 - lora是基于Qwen/Qwen-Image模型使用AI Toolkit by Ostris训练的文本到图像转换模型,采用LoRA技术进行优化,具备良好的图像生成能力。
nunchaku-tech
基于Stable Diffusion XL Base 1.0的量化版本,通过SVDQuant技术实现4位量化,在保持高质量图像生成能力的同时显著提升推理效率。
ymb943
simpletuner-lora是一个基于PEFT的LoRA微调模型,源自stabilityai/stable-diffusion-3.5-large,专门用于文本到图像和图像到图像的转换任务。该模型经过162轮训练,具有高效的推理能力和良好的图像生成质量。
unsloth
Gemma 3是Google推出的轻量级、最先进的开源模型家族,基于与Gemini模型相同的研究和技术构建。该模型具有多模态处理能力,支持文本和图像输入,并生成文本输出,适用于各种文本生成和图像理解任务。
Gemma 3是谷歌推出的轻量级、最先进的开放模型家族,基于与Gemini模型相同的研究和技术构建。具有多模态处理能力,支持文本和图像输入,并生成文本输出,适用于各种文本生成和图像理解任务。
wcy1122
MGM-Omni-7B是一款全模态聊天机器人,能够处理文本、图像、视频和语音输入,并生成文本和语音响应。它具备长语音理解和生成能力,还支持中英文的零样本语音克隆。
camenduru
FLUX.1 [dev] 是一个具有120亿参数的整流流变压器,专门用于文本到图像生成。它在图像生成质量方面表现卓越,仅次于FLUX.1 [pro],具有出色的提示跟随能力和高效的训练方式,为科研和创作提供强大支持。
chatpig
Qwen2.5-VL-7B-IT-GGUF是一个强大的多模态模型,支持文本和图像到文本的生成任务,具备文本编码能力,并与多种工具兼容。
一个基于MCP协议的知识图谱管理服务器,支持多种启动方式和完整的知识图谱操作功能,包含实验性的短故事生成能力。
Outsource MCP是一个支持多AI模型提供商的统一接口服务,通过MCP协议让AI应用能便捷调用不同厂商的文本和图像生成能力。
一个基于TypeScript的MCP服务器,提供AntV图表生成能力,支持15+种图表类型
一个基于Google Gemini模型的AI图像生成MCP服务器,支持智能模型选择(Flash快速生成和Pro高质量4K生成)、多种宽高比控制、文件管理和模板功能,提供生产级图像生成能力。
一个功能强大的MCP服务器,提供完整的AI开发工作空间,支持文件操作、代码执行、Web部署、数据处理和图像生成等一站式Agent能力。
Replicate Flux MCP是一个基于Model Context Protocol(MCP)的高级服务器,通过Replicate API利用Flux Schnell和Recraft V3 SVG模型,为AI助手提供高质量的图像和矢量图形生成能力。
Project Synapse是一个革命性的MCP服务器,通过语义分析和知识图谱技术将文本转化为互联知识网络,并自主生成洞察。它结合Montague语义学和Zettelkasten方法,实现AI的认知协作能力。
Image Gen MCP Server是一个通用AI图像生成服务,通过Model Context Protocol(MCP)标准协议为各类LLM聊天机器人提供跨平台、多模型的图像生成能力,支持OpenAI和Google的多种图像模型,实现文本对话到可视化内容的无缝转换。
ImgMCP是一个多媒体AI模型聚合平台,通过统一的MCP协议和API,为用户提供便捷访问和使用多种AI模型(如图像生成、理解、处理)的能力,旨在连接AI能力与用户创意,提升创作体验与效率。
一个基于Replicate Flux模型的图像生成MCP服务器,为Claude Desktop提供图像生成能力
Napkin AI MCP服务器是一个非官方的社区维护工具,通过Model Context Protocol为AI助手(如Claude)提供生成信息图、思维导图、流程图等可视化内容的能力。它支持多种输出格式(SVG、PNG、PPT)和存储后端(本地、S3、Google Drive等),并包含异步处理、自动轮询和重试机制。
一个基于fal.ai FLUX.1 Pro模型的图像生成服务,通过MCP协议提供API调用能力
Minimax MCP Tools是一个集成Minimax AI能力的MCP服务器实现,提供图像生成和文本转语音功能。
一个基于Cloudflare Worker的MCP服务器,提供通过Flux模型生成图像的能力
一个基于MCP平台的本地代理服务器和客户端实现,集成天气查询、谷歌搜索、摄像头控制、AI图片生成和智能对话等多种AI工具调用能力,支持跨平台运行和模块化扩展。
该项目是一个集成Stable Diffusion图像生成功能的MCP服务器,为AI代理提供图像生成服务,包含开发调试工具和Goose平台集成能力。
D2 MCP Server是一个提供D2图表生成和操作功能的模型上下文协议服务器,支持通过文本创建、渲染、导出和保存D2图表,并具备增量编辑能力。
一个基于DALL-E 3的MCP服务器,提供高质量图像生成功能,支持多种尺寸、质量和风格配置,具备自动文件管理和错误处理能力。
基于Google Gemini的图片生成与编辑服务,通过MCP协议提供AI图像处理能力