8月17日,阿里发布AI音乐生成模型HappyShrimp(快乐虾米)1.0。它突破传统标签式输入门槛,用生活化自然语言即可驱动作词、作曲、编曲、演唱全流程,让普通用户产出高完成度原创音乐。不同于堆砌专业术语的工具,它将音乐理解为有语法、语义的创作。
7月7日,Meta发布其超级智能实验室首个AI图像生成模型Muse Image,通过Meta AI应用免费上线,并集成至Instagram与WhatsApp。用户只需输入自然语言描述,即可生成高质量图像,支持模拟历史地标合影、擦除背景路人、生成自定义二维码等场景。
腾讯在5月27日SPARK2026发布会上推出AI游戏创作平台“代号Craft”,由游戏生态发展部研发。其核心功能是通过内置完整AIGC工具链,将复杂开发简化为自然语言对话,用户只需输入指令即可从“对话”生成游戏原型,大幅降低门槛,实现“人人皆可创作游戏”的目标。
Google 推出AI Studio独立移动应用,已在Google Play开放预注册,将Gemini驱动的AI开发平台从桌面端扩展至移动端。用户可通过自然语言快速构建应用、工具和小游戏,支持语音或文字输入描述创意,AI自动生成原型、专业图标并设计界面,无需编程基础即可轻松制作。
使用知识探索API通过自然语言输入实现对结构化数据的交互式搜索体验。
AI建站工具,构建令人惊叹的网站
基于自然语言输入的图像修复算法
Google
$0.49
Input tokens/M
$2.1
Output tokens/M
1k
Context Length
Xai
$1.4
$3.5
2k
$17.5
$0.7
$2.8
Alibaba
$15.8
$12.7
64
Bytedance
-
Tencent
$1
$4
32
Openai
$0.35
400
Anthropic
$105
$525
200
$1.95
16
$2.4
$12
8
$140
$280
Baidu
$3
$9
$8.75
$70
Huawei
128
NewBie-AI
NewBie image Exp0.1 是一个基于 Next-DiT 架构开发的高效图像生成基础模型,专门用于生成高质量的动漫风格图像。它融合了先进的文本编码器和视觉组件,支持自然语言和结构化标签输入,是多角色动漫图像生成的强大工具。
RedHatAI
这是Qwen3-VL-235B-A22B-Instruct的量化版本,通过将权重和激活值量化为FP8数据类型,有效减少了磁盘大小和GPU内存需求约50%。支持文本、图像和视频输入,输出文本,适用于多种自然语言处理和多模态任务。
kzap201
BLIP 是一个基于 Transformer 的图像到文本生成模型,能够为输入图像生成自然语言描述。
HKUSTAudio
AudioX是一个统一的扩散变压器模型,可实现任意内容到音频及音乐的生成。它能生成高质量通用音频与音乐作品,提供灵活的自然语言控制,并能无缝处理多种模态输入。
aryan083
这是一个基于ViT和GPT2架构的图像描述生成模型,能够为输入的图像生成自然语言描述。
Runware
基于扩散的文本生成图像模型,支持自然语言和原生标签输入,采用v-prediction预测机制
yeniguno
这是一个基于BERT的微调模型,用于将用户输入分类为82种不同的意图,适用于对话系统和自然语言理解任务。
premanthcharan
结合视觉变换器(ViT)与自然语言处理的图像描述生成模型,能够自动为输入图像生成自然语言描述
daliavanilla
BLIP 是一个基于 Transformer 的图像描述生成模型,能够为输入图像生成自然语言描述。
mo-thecreator
基于ViT-GPT2架构的图像描述生成模型,能够为输入的图像生成自然语言描述。
motheecreator
DAMO-NLP-SG
VideoLLaMA 2是一个多模态大语言模型,专注于视频理解和音频处理,能够处理视频和图像输入并生成自然语言响应。
evlinzxxx
基于视觉变换器(ViT)和GPT-2的跨模态模型,能够为输入图像生成自然语言描述
marianna13
LLaVa-Phi-2-3B是一个开源的多模态聊天机器人模型,基于Phi-2架构微调而成,能够处理图像和文本输入并生成自然语言响应。
Ayansk11
这是一个基于Vision Transformer(ViT)和GPT2架构的图像描述生成模型,能够为输入图像生成自然语言描述。
yesidcanoc
基于Swin Transformer和DistilGPT2的端到端图像描述生成模型,能够为输入图像生成自然语言描述。
Xenova
基于ViT和GPT2架构的图像描述生成模型,可将输入的图像转换为自然语言描述。
baseplate
这是一个基于Vision Encoder-Decoder架构的图像描述生成模型,能够为输入图像生成自然语言描述。
jaimin
基于VisionEncoderDecoder架构的图像描述生成模型,能够将输入图像转换为自然语言描述。
ibm-research
Re2G-NQ重排器是IBM开发的神经信息检索组件,专门用于对检索结果进行重排优化。该模型基于BERT-base架构,在MSMARCO数据集上训练,能够显著提升初始检索结果的质量,并支持合并来自不同检索方法(如DPR和BM25)的不可比分数结果,为自然语言生成系统提供更好的输入素材。
MCP逻辑求解器是一个结合大型语言模型与形式化定理证明能力的强大推理系统,支持自然语言和一阶逻辑输入,通过Prover9/Mace4进行自动验证,并提供结构化推理和解释。
一个基于Rust开发的本地化AI财务管理系统,支持自然语言输入、智能分析、税务计算和债务追踪,所有数据存储在本地SQLite数据库。
SEO工具MCP服务器是一个通过标准输入输出接口提供SEO API服务的中间件,支持LLM模型与DataForSEO等SEO工具的自然语言交互,实现关键词分析、排名检查、链接分析等功能。
一个基于自然语言处理的意图解析服务器,将用户输入转换为结构化可执行工作流,提供高扩展性和可靠性的API服务。
Hyprland MCP Server是一个非官方的轻量级服务器,通过Model Context Protocol(MCP)将Hyprland窗口管理器的功能暴露给语言模型,支持自然语言查询和控制Hyprland的窗口管理、布局、输入等。
AI小记是一款基于AI的个人智能记账工具,通过自然语言交互实现极速记账和查账,支持多种输入方式和多端使用。
一个基于自然语言处理的意图解析服务器,将用户输入转换为结构化可执行工作流,提供可扩展的API接口和可靠的处理架构。
MyMCP Prompt是一个通过自然语言描述生成Model Context Protocol (MCP)服务器的工具,使用Google Gemini API将用户描述转换为功能性的Python MCP服务器和对应的JSON配置。项目包含Flask后端和React前端,提供Web界面供用户输入服务器描述,并展示生成的代码和配置。