GitMind推出多模态AI升级,联合StackCommerce以49.99美元提供终身订阅(原价169美元)。该工具聚焦解决手动绘制思维导图的痛点,整合多模态AI解析能力,可直接处理PDF、YouTube视频、截图等多种内容,实现智能知识整理。
阶跃星辰发布面向手机、车载等终端的Step Edge系列模型,包含基础版、Audio版、GUI版及Gen版。该模型支持本地处理图文音频,能实现屏幕理解、语音识别、界面操作与图像生成,工具调用延迟低至0.1秒。简单、高频或弱网场景下任务全在本地完成,复杂推理则交由云端处理,实现端云高效协同。
谷歌9日宣布在“我的广告中心”新增“此广告如何制作”信息区块,提升生成式AI在广告中的透明度。新规覆盖搜索、YouTube与Discover等平台。采用谷歌自家AI工具创作或编辑文本、图像及事件的广告,将自动展示AI披露标签;使用第三方工具生成的内容也将纳入披露范畴。
盖蒂图片社宣布与OpenAI合作,将其合规授权图库集成进ChatGPT搜索与内容发现板块。此前,盖蒂已联合英伟达推出正版AI生成工具,以自身图库训练并保障版权,避免侵权。此次合作将推动AI内容在合法合规下的应用。
AI驱动,从文本和图像生成合规专利图,支持多办公室专利申报。
V2Fun的AI 3D创作平台,可从文本或图像生成3D模型、角色、游戏资源和动画。
专为Web3创作者打造的AI设计工具,可创建多种NFT视觉内容。
专为创作者打造的AI视频与图像生成工作室,支持文本、图片生成视频及风格重塑。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
NewBie-AI
NewBie image Exp0.1 是一个基于 Next-DiT 架构开发的高效图像生成基础模型,专门用于生成高质量的动漫风格图像。它融合了先进的文本编码器和视觉组件,支持自然语言和结构化标签输入,是多角色动漫图像生成的强大工具。
bartowski
这是Qwen3-VL-2B-Instruct模型的量化版本,使用llama.cpp工具和imatrix方法生成了多种量化级别的模型文件,便于在不同硬件环境下高效运行。该模型是一个2B参数的多模态视觉语言模型,支持图像和文本的交互。
jayn7
本项目提供了由LightX2V团队开发的万2.2蒸馏模型的量化GGUF版本,专门用于图像转视频和视频生成任务。该版本经过优化,可与ComfyUI-GGUF等工具配合使用,提供高效的推理性能。
lichorosario
这是一个基于Qwen-Image模型训练的LoRA(Low-Rank Adaptation)模型,专门用于文本到图像的生成任务。该项目使用AI Toolkit训练,能够将文本描述转化为高质量的图像,支持在多种图像生成工具中使用。
expert78
kontext-dusk-3-lora是一个基于FLUX.1-Kontext-dev基础模型训练的LoRA图像生成模型,专门用于生成黄昏蓝调时刻风格的图像。该模型通过特定触发词触发,支持多种主流AI图像生成工具使用。
BarleyFarmer
pejawan22-lora是一个基于AI技术训练的LoRA模型,专门用于特定图像的生成,可与多种AI工具集成使用,通过触发词'peja'来生成图像。
andrewwe
my_qwennud-lora是基于Qwen-Image-Edit-2509使用特定工具训练的LoRA模型,专门用于图像生成和编辑任务,采用AI Toolkit by Ostris训练而成,可与多种主流AI工具配合使用。
chetwinlow1
Ovi是一款先进的音频-视频生成模型,能够根据文本或文本+图像输入同时生成同步的视频和音频内容。该模型采用双骨干架构,支持5秒视频生成,为多媒体创作提供了强大的工具。
Hikarias
f3rnanda_wan22-lora是基于AI Toolkit by Ostris训练的LoRA模型,专门用于图像到视频的生成任务。该模型使用Wan2.2-I2V-A14B作为基础模型,支持在多种AI工具中使用,包括ComfyUI、AUTOMATIC1111等主流平台。
piccoli_no_style-lora 是一个基于图像到视频技术的LoRA模型,使用AI Toolkit进行训练,主要用于图像生成任务,可与多种主流AI工具配合使用。
dottrmstr-long-captions-lora 是一个基于 LoRA 技术的文本到图像生成模型,通过特定工具训练而成,能够生成风格独特的图像,适用于多种图像生成框架。
dottrmstr-long-captions-lora 是一个基于 Qwen/Qwen-Image 基础模型训练的 LoRA 模型,专门用于文本到图像的生成任务。该模型借助 AI 工具包进行训练,支持多种工具调用,能够生成具有独特风格的图像。
sothmik
这是一个基于Civitai平台的文本到图像生成模型,能够将文本描述转换为高质量的图像。模型支持通过量化工具进行优化,适用于创意设计和视觉内容生成。
chatpig
Qwen2.5-VL-7B-IT-GGUF是一个强大的多模态模型,支持文本和图像到文本的生成任务,具备文本编码能力,并与多种工具兼容。
QuantStack
这是black-forest-labs/FLUX.1-Krea-dev模型的GGUF格式量化版本,专门用于文本到图像的生成任务。该模型通过GGUF格式优化,可在特定工具和库中使用,适用于非商业用途的图像生成应用。
Koitenshin
本模型是基于mrcuddle/Lumimaid-v0.2-12B-Pixtral转换的GGUF量化版本,是一个12B参数的多模态模型,支持图像文本到文本的生成任务。通过llama.cpp工具进行格式转换和量化优化。
tencent
混元3D-2是一款支持图像到3D、文本到3D转换的工具,为3D内容生成提供了强大的解决方案。
jree423
SVGDreamer是一款基于扩散模型的文本引导式SVG生成工具,能够创建高质量的矢量图形。
VAST-AI
TripoSG-scribble 是一个基于涂鸦图像和文本提示快速生成3D模型的AI工具,是TripoSG的变体,适用于创意设计和快速原型构建。
AryanKaushik
一个基于PyTorch框架和HuggingPics工具生成的图像分类模型,专门用于识别常见快餐食品。
MiniMax Model Context Protocol (MCP) 是一个官方服务器,支持与强大的文本转语音、视频/图像生成API交互,适用于多种客户端工具如Claude Desktop、Cursor等。
Security Detections MCP 是一个基于Model Context Protocol的服务器,允许LLM查询统一的安全检测规则数据库,涵盖Sigma、Splunk ESCU、Elastic和KQL格式。最新3.0版本升级为自主检测工程平台,可自动从威胁情报中提取TTPs、分析覆盖差距、生成SIEM原生格式检测规则、运行测试并验证。项目包含71+工具、11个预构建工作流提示和知识图谱系统,支持多SIEM平台。
Blueprint MCP是一个基于Arcade生态的图表生成工具,利用Nano Banana Pro等技术,通过分析代码库和系统架构自动生成架构图、流程图等可视化图表,帮助开发者理解复杂系统。
MemoryMesh是一个为AI模型设计的知识图谱服务器,专注于文本角色扮演游戏和互动叙事。它通过动态模式定义和自动生成工具,帮助AI在对话中维护一致且结构化的记忆,实现更丰富、更动态的交互体验。
FileScopeMCP是一个基于TypeScript的代码分析工具,通过计算文件重要性评分、追踪依赖关系、生成可视化图表和添加文件摘要,帮助开发者快速理解代码库结构。支持多语言项目分析,提供Mermaid图表生成和持久化存储功能,可与Cursor的模型上下文协议集成。
tldraw-agent是一个基于AI的文本转图表生成工具,支持通过命令行、库、MCP服务等多种方式使用,可将文本描述(如架构图、流程图)自动生成为PNG或SVG格式的图表。
MCP Kling是首个且唯一完整的Kling AI MCP服务器,提供13种创意工具,支持视频生成、图像处理、唇形同步及虚拟试衣等功能,实现与Claude的无缝集成,适用于内容创作者和开发者。
MCP ECharts是一个通过AI动态生成Apache ECharts图表的工具,支持全功能ECharts语法及多种导出格式,轻量安全且无需远程服务。
UML-MCP-Server是一个基于MCP协议的UML图表生成工具,支持通过自然语言描述或直接编写PlantUML代码生成多种类型的UML图,并集成到支持MCP的客户端如Cursor中。
基于火山引擎SeeDream模型的MCP图片生成工具,支持高质量图片生成、自定义尺寸和智能参考图,可通过MCP协议在Cursor、Claude Desktop等客户端中使用。
OpenSCAD MCP服务器是一个通过文本或图像生成参数化3D模型的工具,支持多视角重建和远程处理。
ComfyUI-AnimaTool是一个让AI Agent直接生成二次元图片并原生显示在聊天窗口的工具,通过MCP协议或HTTP API连接ComfyUI,支持结构化提示词、多长宽比、批量生成和LoRA加载等功能。
LetzAI MCP是一个基于Node.js的图像生成工具,通过Claude桌面应用集成LetzAI API实现AI图像生成与处理。
DiffuGen是一个先进的本地图像生成工具,集成了MCP协议,支持多种AI模型(包括Flux和Stable Diffusion系列),可直接在开发环境中生成高质量图像。它提供了灵活的配置选项、多GPU支持,并可通过MCP协议与多种IDE集成,同时提供OpenAPI接口供外部调用。
Freepik FastMCP工具包是一个MCP服务器,用于将AI助手与Freepik API无缝集成,提供图标搜索下载、资源管理、图像分类和生成等功能。
PuchAI Hackathon项目提供多种工具集,包括Reddit内容分析、数据可视化图表生成、药品信息查询、用户偏好管理及任务管理功能,支持开发者快速验证市场假设和分析用户需求。
一个基于LangGraph的代理工具,帮助用户通过AI生成图像并注册为Story区块链上的IP资产,包括图像生成、IPFS上传、元数据创建、许可条款协商和区块链注册全流程。
MCP Mermaid是一个通过AI动态生成Mermaid图表和图形的工具,支持多种导出格式和主题配置,适用于多种开发环境和平台。
VGGT-MPS是基于苹果芯片优化的3D视觉重建工具,使用Metal Performance Shaders加速,能够从单张或多张图像生成深度图、相机姿态和3D点云,支持稀疏注意力实现城市级重建。
MiniMax MCP JS是一个基于JavaScript/TypeScript实现的MiniMax MCP协议工具集,提供图像生成、视频生成、文本转语音等功能,支持与MCP兼容客户端交互。