9月22日云栖大会杭州开幕,阿里公布大模型进展:Qwen4已投入训练,后续参数规模计划扩至5万亿至10万亿;递归自我改进进入训练、推理及芯片协同;多模态矩阵升级,11月发布新一代视频生成模型。刘大一恒称Scaling是迈向ASI的重要路径。
2026云栖大会上,阿里巴巴宣布将训练参数规模5万亿至10万亿的新一代模型,为迄今最激进AI计划,标志着从云计算服务商向全栈人工智能平台蜕变。该模型将成为通义千问系列重要后续产品,Qwen团队正推进架构与数据创新。
9月16日,阿里千问Qwen3.8-27B在Hugging Face最受欢迎开源大模型榜单登顶,超越FLUX.1、DeepSeek-R1、Kimi-K3、Meta-Llama-3等。该榜以开发者点赞为评选口径,反映真实偏好,而非跑分或参数规模,成社区史上最受欢迎开源模型。
科大讯飞发布星火X2.5大模型,采用MoE混合专家架构,参数规模达293B-A30B,在架构设计、核心能力及国产算力适配方面全面升级,重点强化代码编写与智能体(Agent)应用开发能力。
大型语言模型,支持多种参数规模
大规模参数扩散变换器模型
19亿参数规模的角色扮演模型,支持few shots角色定制。
小米开发的大规模预训练语言模型,参数规模64亿。
Google
$0.7
Input tokens/M
$2.8
Output tokens/M
1k
Context Length
$2.1
$17.5
Alibaba
$4
$16
$1
$10
256
$6
$24
$2
$20
-
Moonshot
Baidu
32
Xai
$1.4
$10.5
Tencent
Deepseek
$12
128
Openai
$0.4
$0.75
64
$0.63
$3.15
131
noctrex
INTELLECT-3 是一个由 Prime Intellect 开发的、参数规模达 106B(激活参数 12B)的混合专家(MoE)推理模型。它基于 GLM-4.5-Air-Base 进行监督微调,并经过大规模强化学习训练,在数学、编码和推理任务上表现优异。
mlx-community
本模型是 Mistral AI 发布的 Ministral-3-3B-Instruct-2512 指令微调模型的 MLX 格式转换版本。它是一个参数规模为 3B 的大型语言模型,专门针对遵循指令和对话任务进行了优化,并支持多种语言。MLX 格式使其能够在 Apple Silicon 设备上高效运行。
John1604
Qwen3 VL 4B Thinking 是一个支持图像到文本以及文本到文本转换的多模态模型,具有4B参数规模,能够满足多种图文交互需求。
prithivMLmods
VibeThinker-1.5B是微博AI推出的15亿参数密集语言模型,基于Qwen2.5-Math-1.5B微调,专门针对数学和算法编码问题设计。采用'频谱到信号原理'框架训练,在多个数学竞赛测试中超越规模更大的模型,训练成本约7800美元,支持最长约40k词元的输出。
Nanbeige
楠米色4-3B-思维-2511是楠米色系列的最新增强版本,通过先进的蒸馏技术和强化学习优化,在紧凑的3B参数规模下实现了强大的推理能力。该模型在Arena-Hard-V2和BFCL-V4等基准测试中,在参数小于32B的模型中取得了最先进(SOTA)成果。
allenai
Olmo 3 7B RL-Zero Mix是Allen AI开发的7B参数规模的语言模型,属于Olmo 3系列。该模型在Dolma 3数据集上进行预训练,在Dolci数据集上进行后训练,并通过强化学习优化数学、编码和推理能力。
unsloth
Qwen3-Coder-REAP-363B-A35B是通过REAP方法对Qwen3-Coder-480B-A35B-Instruct进行25%专家剪枝得到的稀疏混合专家模型,在保持接近原模型性能的同时显著降低了参数规模和内存需求,特别适用于资源受限的代码生成和智能编码场景。
redponike
Qwen3-VL-4B-Instruct 是通义千问系列最新的视觉语言模型,在4B参数规模下实现了卓越的视觉感知、文本理解与生成、空间推理和智能体交互能力。它支持长上下文和视频理解,具备强大的OCR和多语言处理能力。
这是一个基于Mistral架构的图像文本转文本量化模型,参数规模为24B,专门针对指令跟随任务进行了优化训练,支持多模态输入处理。
lmstudio-community
Qwen3-VL-2B-Thinking是由Qwen推出的视觉语言模型,基于2B参数规模,使用MLX进行8位量化,专门针对Apple Silicon芯片进行了优化。该模型支持图像和文本的多模态理解与生成任务。
microsoft
Fara-7B是微软研究院开发的专为计算机使用场景设计的小型语言模型,仅有70亿参数,在同规模模型中实现卓越性能,能够执行网页自动化、多模态理解等计算机交互任务。
Qwen3-VL-2B-Instruct是Qwen系列中最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持以及强大的空间和视频动态理解能力。该模型采用2B参数规模,支持指令交互,适用于多模态AI应用。
Qwen3-VL-2B-Thinking是Qwen系列中最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持、增强的空间和视频动态理解能力,以及更强的智能体交互能力。该模型采用2B参数规模,支持指令版和增强推理的思考版。
LightOnOCR-1B-1025是基于图像到文本的OCR模型,采用1B参数规模,经过imatrix量化优化,专门用于从图像中提取和识别文本内容。
这是一个基于Qwen3-VL-32B-Thinking模型转换的4位量化版本,专门针对MLX框架优化。该模型是一个32B参数规模的多模态视觉语言模型,具备思维链推理能力,能够同时处理图像和文本输入,生成高质量的文本响应。
cerebras
GLM-4.5-Air-REAP-82B-A12B 是 GLM-4.5-Air 的高效压缩版本,通过 REAP 剪枝技术将参数规模从 106B 压缩到 82B,减少 25% 内存需求,同时保持近乎无损的性能表现。
Mungert
Apriel-1.5-15b-Thinker 是一款由 ServiceNow SLAM 实验室开发的多模态推理模型,参数规模为150亿。它具备强大的文本和图像理解与推理能力,采用‘思考-回答’的链式推理模式,旨在以较小的模型规模实现与大型模型相媲美的性能。
kathywu95
这是一个基于DeepSeek-V3架构的随机权重生成模型,专门用于测试和开发目的。模型使用随机初始化的权重,参数规模经过精简,适合快速原型开发和功能验证。
Apertus是一款参数规模达70B和8B的全开放多语言语言模型,支持超1000种语言和长上下文处理,仅使用完全合规且开放的训练数据,性能可与闭源模型相媲美。
Apertus是一款参数规模达70B和8B的完全开放多语言语言模型,支持超1000种语言和长上下文,仅使用完全合规且开放的训练数据,性能可与闭源训练的模型相媲美。