AI视频创作平台Higgsfield完成4亿美元B轮融资,估值达54亿美元,较8个月前的13亿美元增长逾4倍。本轮由DST Global领投,高盛另类投资基金等参投。公司由前Snap高管Alex Mashrabov于2023年创立,提供AI图像和视频生成工具,曾因AI生成电影在戛纳、纽约电影节首映受到关注。
MiniMax开源多模态生成模型H3,摩尔线程随即基于国产智算卡MTT S5000完成极速适配。H3打破单任务局限,能融合文本、图像、音频与视频输入,精准理解创作意图,可直接生成2K分辨率、最长15秒视频。
MiniMax推出全模态生成模型H3,承诺近期全面开源。该模型支持文本、图像、视频、声音任意组合输入,可生成带原生双声道音频的高清视频,用户只需提供参考素材即可驱动创作。
阿里发布Qwen-Image-3.0图像生成基础模型,支持最长4.5K Token文本输入,可一次性生成公式、几何图形、逻辑推导及多层UI等复杂内容,原生兼容12种语言和20余款字体渲染,文本长度较上代提升4.5倍,大幅强化影视分镜、知识图解等商业级图文创作能力。
浏览创作者AI图像提示,查看全提示、混搭风格,一键生成图像。
一站式AI创作平台,支持图像、视频、音乐和语音生成,有商用许可。
免费AI 3D模型生成器,可秒将文本和图像转化为3D模型,适合多领域创作者。
一站式AI视频、图像与音频生成创作平台
Openai
$2.8
输入tokens/百万
$11.2
输出tokens/百万
1k
上下文长度
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
-
$1
$10
256
$2
$20
$8
$240
52
Bytedance
$1.2
$3.6
4
tencent
混元视频-1.5是一款轻量级高性能视频生成模型,仅用83亿参数就能提供顶级的视频质量,显著降低了使用门槛。它能在消费级GPU上流畅运行,支持文本到视频和图像到视频生成,让每个开发者和创作者都能轻松使用。
chetwinlow1
Ovi是一款先进的音频-视频生成模型,能够根据文本或文本+图像输入同时生成同步的视频和音频内容。该模型采用双骨干架构,支持5秒视频生成,为多媒体创作提供了强大的工具。
madcaptj
这是一个基于Qwen/Qwen-Image基础模型训练的图像转视频LoRA模型,专门用于图像生成任务,为图像创作提供了新的可能性。
elixirx
charu-anime-lora是一个基于LoRA技术的文生图模型,专门用于生成精美的动漫风格图像,以Qwen/Qwen-Image为基础模型,为动漫图像创作提供高效解决方案。
duyntnet
Chroma 是一个高质量的文本到图像生成模型,专注于生成逼真的图像内容。该模型采用先进的扩散技术,能够根据文本描述生成高质量的视觉内容,特别适合本地部署环境下的图像创作需求。
John6666
Noobai-XL-1.0是基于Stable Diffusion XL技术的文本到图像生成模型,专注于生成逼真、写实风格的图像,为图像创作领域提供高质量的AI生成解决方案。
camenduru
FLUX.1 [dev] 是一个具有120亿参数的整流流变压器,专门用于文本到图像生成。它在图像生成质量方面表现卓越,仅次于FLUX.1 [pro],具有出色的提示跟随能力和高效的训练方式,为科研和创作提供强大支持。
Crealism Terra Mirabilis 是一款基于 Stable Diffusion XL 技术的文本到图像生成模型,专注于生成具有高度真实感的图像,支持亚洲和欧洲风格的多种特色图像创作,适用于创意、时尚、肖像等领域。
Intorealism XL 是一款强大的文本到图像生成模型,能够生成逼真、细腻的图像,涵盖人像、风景等多种主题,在光影、纹理等方面表现出色,严格遵循输入提示进行图像创作。
Keltezaa
MillieBB_v2是一个基于LoRA和Diffusers技术的文本到图像生成模型,能够根据文本提示生成特定风格的图像,为图像创作提供了新的可能性。
这是由SoloLee创作的以Emma Watson为主题的图像生成模型,基于black-forest-labs/FLUX.1-dev开发,专门用于生成Emma Watson风格的图像作品
KiraDepth 是一个基于稳定扩散XL的文本到图像生成模型,专注于生成具有深度、细节和阴影的2.25D/2.5D风格图像,特别适合动漫风格的创作。
city96
Wan2.1-FLF2V-14B-720P 是一个视频生成模型,支持从图像生成视频,适用于多种视频创作场景。
一个支持多种风格的文本到图像生成模型,特别适合动漫、漫画等风格的图像创作。
Realistic Vision V5.1是一个基于Stable Diffusion XL的文本到图像生成模型,专门用于生成逼真的照片级图像。该模型在图像创作领域具有较高的应用价值,能够根据文本描述生成高质量的写实风格图像。
基于稳定扩散XL的动漫风格文本到图像生成模型,专注于高质量动漫角色创作
基于Stable Diffusion XL的2.5D风格文本生成图像模型,支持照片级真实感和艺术风格生成,特别擅长女性形象和女同性恋主题创作。
glif-loradex-trainer
apu_apustaja_cartoon 是一个文本到图像的模型,可根据特定触发词生成相关卡通图像,为图像创作带来新的可能。
dima806
基于Vision Transformer (ViT)的图像分类模型,用于区分AI生成与人类创作的图像,准确率达98%。
LHRuig
这是一个文本到图像的LoRA模型,能够基于特定提示词生成高质量的图像,为图像创作带来更多可能性。
MCP Kling是首个且唯一完整的Kling AI MCP服务器,提供13种创意工具,支持视频生成、图像处理、唇形同步及虚拟试衣等功能,实现与Claude的无缝集成,适用于内容创作者和开发者。
基于Google Gemini 2.5 Flash API的MCP图像生成与编辑服务器,支持文本生成图像、图像编辑、迭代创作和风格迁移功能
一个通过fal.ai API和MCP协议从文本生成图像的Node.js工具,支持多种模型和参数,适合开发者和创作者快速生成图像。
Gemini Nanobanana MCP 是一个让用户通过文本描述生成AI图像的Claude插件,集成了Google Gemini 2.5 Flash图像生成功能,支持多种图像编辑和创作方式。
ImgMCP是一个多媒体AI模型聚合平台,通过统一的MCP协议和API,为用户提供便捷访问和使用多种AI模型(如图像生成、理解、处理)的能力,旨在连接AI能力与用户创意,提升创作体验与效率。
SVGMaker MCP Server是一个基于SVGMaker API的强大服务,用于生成、编辑和转换SVG图像。它支持AI驱动的SVG创作、智能编辑、图像转SVG等功能,并提供安全文件操作和实时进度更新。
MCP-SynClub-Generate-Comic是一个专为漫画创作设计的Claude桌面扩展,集成了从剧本生成、角色图像生成、故事板创建到最终漫画图像生成的全流程工作流。
VideoCutter是一款集成视频、音频、图像处理的专业多媒体工具,支持AI智能编辑和MCP协议,提供一站式智能化创作解决方案。