小红书 dots infra 团队于7月22日开源 BigMac 流水并行训练范式,专为原生多模态大模型设计,打破训练中速度与显存不可兼得的帕累托前沿,平衡显存占用与计算速度。代码已发布在 GitHub Dots-Infra 仓库。
字节跳动发布多模态AI模型Seedream5.0Pro,推动图像创作从生成迈向设计。该模型在图文匹配、结构合理性、文字渲染和画面质感上显著提升,并重点突破复杂信息可视化能力,能精准解析意图,将数据、概念和密集文字转化为专业视觉呈现。
商汤科技正秘密研发多模态大模型“U1Pro”,面向设计场景,由首席科学家林达华牵头。该模型隶属“日日新”家族,目标对标OpenAI的GPT-Image2,强调长程逻辑与思考能力,预计7月启动内测并商用。
人工智能算力竞争进入国产化深水区。科大讯飞在无锡大会上发布星火多模态大模型X2-VL,这是目前唯一基于全国产算力训练的模型,采用专门设计,标志着技术迭代与自主可控的重要突破。
ByteDance推出的新一代多模态4K AI视频与图像生成与编辑平台。
一个强大的统一多模态模型,支持文本到图像生成及图像编辑。
基于孪生多模态扩散变换器的创意布局到图像生成技术
新一代自回归图像生成模型,提供多模态输入和高级图像编辑功能。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
-
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
$8
$240
52
tencent
混元OCR是由混元原生多模态架构驱动的端到端OCR专家VLM模型,仅用10亿参数的轻量级设计,在多个行业基准测试中取得最先进成绩。该模型擅长处理复杂的多语言文档解析,在文本定位、开放域信息提取、视频字幕提取和图片翻译等实际应用场景中表现出色。
microsoft
Fara-7B是微软研究院开发的专为计算机使用场景设计的小型语言模型,仅有70亿参数,在同规模模型中实现卓越性能,能够执行网页自动化、多模态理解等计算机交互任务。
NexaAI
Qwen3-VL-8B-Thinking是阿里云Qwen团队开发的80亿参数多模态大语言模型,专为深度多模态推理设计,支持视觉理解、长上下文处理和结构化思维链生成,在复杂推理任务中表现出色。
mlx-community
Apriel-1.5-15B-Thinker是一个专为图像理解与推理设计的150亿参数多模态模型,采用中期训练方法而非RLHF训练。本版本为适用于苹果芯片的MLX量化版本,具有内存占用小、启动速度快的特点。
PerceptronAI
Isaac-0.1是感知公司推出的首个开源视觉语言模型,拥有20亿参数,专为现实世界应用设计。该模型在多模态理解和空间推理方面表现出色,性能达到甚至超越比它大50倍以上的模型,树立了新的效率标准。
stepfun-ai
Step-Audio 2 是一款端到端的多模态大语言模型,专为满足行业级音频理解和语音对话需求而设计。具备先进的语音和音频理解能力、智能语音对话功能、工具调用和多模态检索增强生成能力,在多个音频理解和对话基准测试中取得了领先的性能。
aisingapore
Gemma-SEA-LION-v4-27B-IT-GGUF是基于Gemma-SEA-LION-v4-27B-IT量化的模型,专为东南亚地区任务设计。具有128K大上下文长度、多模态理解能力和高级函数调用功能,能在普通笔记本上运行。
OmniNeural是全球首个专门为神经处理单元(NPU)设计的全多模态模型,能够原生理解文本、图像和音频,可在PC、移动设备、汽车、物联网和机器人等多种设备上运行。
Mungert
SmolVLM是一个紧凑的开源多模态模型,能够接受图像和文本输入并生成文本输出,专为高效设计,适用于设备端应用。
ibm-granite
基于granite-vision-3.3-2b构建的高效嵌入模型,专为多模态文档检索设计,可处理包含表格、图表、信息图和复杂布局的文档。
WenchuanZhang
Patho-R1-7B是一款专门针对病理学领域设计的多模态推理模型,通过三阶段训练管道(持续预训练、监督微调、强化学习)来增强病理诊断理解能力,能够有效处理高分辨率病理图像和复杂诊断推理任务。
google
MedGemma是基于Gemma 3优化的医学多模态模型系列,专为医学文本和图像理解设计,提供4B和27B两种参数规模版本。
MedGemma是基于Gemma 3优化的医学多模态模型,专为医疗文本和图像理解设计,提供4B和27B两个版本。
SmolVLM-500M-Instruct是SmolVLM系列中的轻量级多模态模型,能够处理图像和文本输入并生成文本输出。该模型设计追求高效性,适用于设备端应用,在多模态任务上保持强大性能。
MathLLMs
MathCoder-VL系列开源大型多模态模型,专为通用数学问题解决而设计,结合视觉与代码增强数学推理能力。
RedHatAI
Llama-4-Scout是Meta推出的Llama 4系列模型之一,采用混合专家(MoE)架构,是原生多模态AI模型,支持文本和图像输入,在多语言文本理解和视觉任务方面表现出色。该模型具有17B参数,16个专家,专为商业和研究用途设计。
jinaai
Jina Embeddings v4 是一款专为多模态和多语言检索设计的通用嵌入模型,特别适用于复杂文档的检索,包括包含图表、表格和插图的视觉丰富文档。
ByteDance-Seed
SAIL是一个专为视觉与语言设计的单一Transformer模型,作为统一的多模态大语言模型(MLLM),它在单一架构中无缝集成了原始像素编码和语言解码功能。
UCSC-VLAA
OpenVision 是一个全开放、高性价比的先进视觉编码器家族,专为多模态学习设计。
OpenVision是一个完全开源、高性价比的先进视觉编码器家族,专为多模态学习设计,性能匹配甚至超越OpenAI CLIP。
Context Engineering MCP平台是一个AI上下文管理与优化平台,通过系统化的方法设计、管理和优化AI模型的输入信息,实现提示工程的工程化。平台提供智能分析引擎、优化算法、模板管理等功能,显著提升AI响应质量、降低API成本,并支持多模态内容处理。
MaxKB是一款开源的AI助手,专为企业设计,支持RAG流程、工作流引擎和多模态交互,适用于智能客服、知识库等场景。