8月23日,橡鹿机器人发布全球首个基于真实厨房数据训练的多模态烹饪AI基础模型“CookingMuse厨启”,标志烹饪AI从指令执行迈向深度理解与真实场景应用。同步推出3K视觉AI炒菜机器人和具身烹饪机器人“现炒方舟”,技术布局覆盖烹饪全流程。
DeepSeek工具链升级至0.1.1-rc.1版,在V4Flash与V4Pro基础上新增视觉模型体验版V4Flash Vision-Exp。此前v0.1.0-rc.8已打通多模态能力,支持原生图片请求,/goal、/plan等指令实现图文混合输入。
商汤开源轻量级多模态模型SenseNova U1.5-Lite-Preview,采用8B-MoT参数和NEO-unify架构,支持原生4K图像生成、精细纹理、精准中英文字生成及稳定图像编辑。该模型重点提升长篇自然语言与结构化视觉指令理解,实现复杂需求下的精准多模态生成。
openJiuwen社区发布Skill-Omni,首个工程化多模态Skill范式,突破传统纯文本指令局限,使智能体经验从“读得懂”升级为“看得见”,精准赋能修图、GUI操作等视觉任务,开辟复杂视觉交互新路径。
统一的多模态AI,支持基于指令的图像编辑与生成,超越商业模型。
视觉定位GUI指令的多模态模型
大规模多模态推理与指令调优平台
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
-
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$2
$20
$6
$24
$8
$240
52
ExaltedSlayer
Gemma 3是谷歌推出的轻量级开源多模态模型,本版本为12B参数的指令调优量化感知训练模型,已转换为MLX框架的MXFP4格式,支持文本和图像输入并生成文本输出,具有128K上下文窗口和140+语言支持。
noctrex
这是一个基于Mistral架构的图像文本转文本量化模型,参数规模为24B,专门针对指令跟随任务进行了优化训练,支持多模态输入处理。
unsloth
Qwen3-VL-2B-Instruct是Qwen系列中最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持以及强大的空间和视频动态理解能力。该模型采用2B参数规模,支持指令交互,适用于多模态AI应用。
rafacost
DreamOmni2-GGUF是将xiabs/DreamOmni2-7.6B模型转换为GGUF格式的图像到图像模型,支持多模态指令编辑和生成,遵循Apache-2.0许可证。
mlx-community
这是Qwen3-VL-4B-Instruct模型的MLX格式8位量化版本,由mlx-community转换。该模型是一个40亿参数的多模态视觉语言模型,支持图像理解和文本生成任务,专为指令跟随场景优化。
NexaAI
Qwen3-VL-4B-Instruct是阿里云Qwen团队推出的40亿参数指令调优多模态大语言模型,专为高通NPU优化,融合强大的视觉语言理解能力与对话微调功能,适用于聊天推理、文档分析和视觉对话等实际应用场景。
lapa-llm
Lapa LLM 12B PT是基于Google Gemma 3-12B开发的开源大语言模型,专门针对乌克兰语处理优化。由乌克兰多所高校研究团队开发,在乌克兰语处理方面表现卓越,具备高效的指令微调和多模态能力。
Gemma 3是谷歌推出的轻量级、最先进的开源多模态模型家族,基于与Gemini模型相同的研究和技术构建。该270M版本是经过指令调优的模型,采用量化感知训练(QAT),能够在显著降低内存需求的同时保持与bfloat16相近的质量。
Gemma 3是谷歌推出的轻量级开源多模态模型家族,基于与Gemini相同的研究技术构建。270M版本是其中最小的指令微调模型,支持140多种语言,具有32K上下文长度,适用于资源受限环境下的文本生成任务。
DeepGlint-AI
UniME是一个基于多模态大模型的通用嵌入学习框架,通过文本判别知识蒸馏和硬负样本增强的指令调优策略,显著提升了多模态嵌入能力。
mjwong
针对新加坡英语优化的多模态语音识别模型,基于微软Phi-4多模态指令模型微调,显著提升对新加坡英语独特语音特征的识别能力。
tsunghanwu
SESAME是一款开源多模态模型,基于LLaVA模型在各种基于指令的图像定位(分割)数据上进行微调训练而成。
Gemma 3是谷歌推出的轻量级开源多模态模型系列,基于与Gemini模型相同的研究构建。本版本为4B参数的指令微调模型,采用量化感知训练(QAT),支持文本和图像输入并生成文本输出,适用于多种文本生成和图像理解任务。
Gemma 3是Google推出的轻量级开放模型系列,基于创建Gemini模型的研究和技术构建。12B版本是经过指令调优的多模态模型,支持文本和图像输入,生成文本输出。
p4rzvl
这是一个基于Llama架构的多模态模型,支持视觉和文本指令,经过4位量化优化。
google
Gemma 3是Google推出的轻量级多模态开放模型,支持文本和图像输入,生成文本输出。4B版本经过指令调优和量化感知训练,适合资源有限环境部署。
Gemma 3是Google推出的轻量级开源多模态模型系列,基于Gemini技术构建,支持文本和图像输入,生成文本输出。1B版本经过指令调优和量化感知训练(QAT),适合资源有限环境部署。
Gemma 3是Google基于Gemini技术打造的轻量级开源多模态模型系列,支持文本和图像输入并生成文本输出。12B版本经过指令调优和量化感知训练(QAT),适合资源有限环境部署。
vinimuchulski
Gemma 3是Google推出的轻量级开源多模态模型系列,支持文本和图像输入,能生成文本输出。该版本为27B参数的指令调优模型,采用量化感知训练技术,内存需求低但质量接近原版。
junnei
Gemma-3-MM是基于Gemma-3-4b-it扩展的多模态指令模型,新增语音处理能力,可处理文本、图像和音频输入,生成文本输出。
Frame0 MCP Server是一个为Frame0线框图工具提供的多模态控制协议服务,支持通过自然语言指令创建和修改线框图。