阿里云将“阿里云开发者”公众号更名为“千问AI平台”,定位“为Agent而生,驱动AI生产力”。此举顺应AI向智能体演进趋势,聚焦大模型与Agent前沿技术,依托通义千问模型和阿里云技术,开启AI内容与开发者服务全面升级。
谷歌DeepMind推出GenCeption模型,将视频生成AI逆向改造为视觉分析引擎,单一模型即可同时完成深度估计、图像分割、3D姿态估计等五项核心视觉任务。模型基于阿里通义万相Wan2.1框架训练,一次前向传播实现预测,打破任务孤立格局。
阿里通义千问发布新一代实时语音合成模型Qwen-Audio-3.0-TTS,实现从“能说话”到“会表达”的跨越。Plus版本在Artificial Analysis Speech Arena排名全球第一,超越Gemini3.1TTS等主流模型。双版本中Flash版主打低延迟实时交互(首包约300ms),Plus版专攻高质量自然度与音色还原。
国内大模型开源节奏持续加快。阿里即将发布并开源新一代通义千问3.8,预览版Qwen3.8-Max已率先上线阿里云Token Plan、Qoder及QoderWork三平台,用户可提前体验其能力边界,正式版近期推出。此举进一步推动通义千问家族在开源赛道上的迭代与布局。
Qwen2.5-Omni 是阿里云通义千问团队开发的端到端多模态模型,支持文本、音频、图像、视频输入。
Wan是阿里巴巴通义实验室开发的先进视觉生成模型,可基于文本、图像等生成视频。
全能AI助手,提供语音识别、字幕翻译、文档速读等功能
代码演示平台,提供智能问答体验
Alibaba
-
输入tokens/百万
输出tokens/百万
上下文长度
$4
$16
1k
$1
$10
256
$2
$20
$6
$24
$8
$240
52
$3.9
$15.2
64
$15.8
$12.7
$0.8
128
$54
$163
redponike
Qwen3-VL-4B-Instruct 是通义千问系列最新的视觉语言模型,在4B参数规模下实现了卓越的视觉感知、文本理解与生成、空间推理和智能体交互能力。它支持长上下文和视频理解,具备强大的OCR和多语言处理能力。
unsloth
Qwen3-VL是通义系列中最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持、强大的空间和视频动态理解能力以及出色的智能体交互能力。
Qwen3-VL-8B-Thinking是通义千问系列中最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持、强大的空间和视频动态理解能力,以及出色的智能体交互能力。
Qwen3-VL是通义系列中最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持、强大的空间和视频动态理解能力,以及出色的智能体交互能力。
Qwen3-VL是通义系列中最强大的视觉语言模型,在文本理解与生成、视觉感知与推理、上下文长度、空间和视频动态理解以及智能体交互能力等方面全面升级。该模型提供密集架构和混合专家架构,支持从边缘设备到云端的灵活部署。
Qwen
Qwen3-VL-30B-A3B-Thinking是通义系列中最强大的视觉语言模型,具备出色的文本理解和生成能力、深入的视觉感知和推理能力、长上下文支持、强大的空间和视频动态理解能力,以及智能体交互能力。
Qwen3-VL是通义系列最强大的视觉语言模型,采用混合专家模型架构(MoE),提供GGUF格式权重,支持在CPU、GPU等设备上进行高效推理。模型在文本理解、视觉感知、空间理解、视频处理等方面全面升级。
Qwen3-VL-30B-A3B-Instruct是通义系列中最强大的视觉语言模型,采用混合专家模型架构,具备出色的文本理解与生成能力、深入的视觉感知与推理能力,支持256K长上下文和视频理解,可在多种设备上进行推理。
Qwen3-VL-8B-Thinking是通义千问系列中最强大的视觉语言模型,具备增强推理能力的8B参数版本。该模型在文本理解、视觉感知、空间理解、长上下文处理等方面全面升级,支持多模态推理和智能体交互。
Qwen3-VL是通义系列中最强大的视觉语言模型,具备出色的文本理解和生成能力、深入的视觉感知和推理能力、长上下文支持、强大的空间和视频动态理解能力,以及智能体交互能力。本仓库提供GGUF格式权重,支持在CPU、GPU等设备上高效推理。
Qwen3-VL-32B-Instruct是通义系列中最强大的视觉语言模型,具备出色的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持、强大的空间和视频动态理解能力,以及智能体交互能力。
Qwen3-VL-8B-Instruct是通义系列中最强大的视觉语言模型,具备卓越的文本理解和生成能力、深入的视觉感知和推理能力、长上下文支持以及强大的空间和视频动态理解能力。
Qwen3-VL-4B-Instruct是通义系列最强大的视觉语言模型之一,在文本理解、视觉感知、空间理解、视频处理等方面全面升级,支持在多种硬件设备上运行,具备卓越的多模态推理能力。
Qwen3-VL-2B-Instruct-GGUF是通义千问系列的多模态视觉语言模型的GGUF量化版本,具备20亿参数,支持图像理解和文本生成的无缝融合,可在CPU、GPU等设备上高效运行。
Qwen3-VL是通义大模型系列中最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持、强大的空间和视频动态理解能力以及出色的智能体交互能力。该模型采用混合专家(MoE)架构,是增强推理的思维版。
Qwen3-VL是通义系列中最强大的视觉语言模型,在文本理解与生成、视觉感知与推理、上下文长度、空间和视频动态理解以及智能体交互能力等方面都进行了全面升级。该模型提供密集架构和混合专家架构,支持从边缘设备到云端的灵活部署。
bullerwins
Qwen3-VL是通义系列迄今为止最强大的视觉语言模型,实现了全面升级,包括卓越的文本理解与生成能力、更深入的视觉感知与推理能力、更长的上下文长度、增强的空间和视频动态理解能力,以及更强的智能体交互能力。
Qwen3-VL是通义系列最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持、强大的空间和视频动态理解能力,以及出色的智能体交互能力。
MCP服务器是一个多功能后端服务平台,支持文件管理、数据库操作、API集成和向量搜索,提供Docker部署方案和通义千问集成示例。
基于TypeScript的MCP服务器,集成阿里云通义万相的文生图和文生视频API,支持异步任务处理和MCP协议规范
基于TypeScript的MCP服务器,集成通义万相的文生图和文生视频API,支持异步任务处理和MCP协议规范。