阿里达摩院启动“阿里星”计划,面向2027届毕业生,开放AI芯片、新型CPU架构、医疗多模态智能体、AGI决策等15项前沿课题,重点布局AI芯片编程模型、编译器及面向大模型的AI SoC架构,吸引顶尖人才探索下一代人工智能技术。
阿里发布新一代大模型Qwen3.8-Max,在编程、办公、长程任务及多模态智能体等能力上全面升级,可端到端自主执行复杂任务,极少人工干预即可完成从目标理解到成果交付。模型权重下周开源,重点强化智能体在真实场景下的执行与交付能力。
为满足AI Agent执行长程任务时的深度检索需求,火山引擎正式上线豆包搜索服务。该服务面向企业及开发者,为智能体构建提供跨语言、多模态、多垂类的联网信息支撑,同时升级信息获取与可信度治理,可直接输出结构化数据及Markdown原文,实现精准定向查询。
近日,火山引擎上线豆包搜索服务,面向企业开发者提供跨语言、多模态、多垂类联网搜索,为AI Agent注入实时可信信息,推动其从问答转向复杂任务执行。应对长流程任务趋势,传统单次搜索式微,新智能体需持续检索、理解网页、交叉验证并动态推进进程。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
-
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
$6
$24
Baidu
128
$8
$240
52
Qwen
Qwen3-VL-2B-Thinking是Qwen系列中最强大的视觉语言模型之一,采用GGUF格式权重,支持在CPU、NVIDIA GPU、Apple Silicon等设备上进行高效推理。该模型具备出色的多模态理解和推理能力,特别增强了视觉感知、空间理解和智能体交互功能。
Qwen3-VL-8B-Thinking是通义千问系列中最强大的视觉语言模型,具备增强推理能力的8B参数版本。该模型在文本理解、视觉感知、空间理解、长上下文处理等方面全面升级,支持多模态推理和智能体交互。
unsloth
Qwen3-VL是迄今为止Qwen系列中最强大的视觉语言模型,在文本理解与生成、视觉感知与推理、上下文长度、空间和视频动态理解以及智能体交互能力等方面都进行了全面升级。该模型采用混合专家(MoE)架构,提供卓越的多模态处理能力。
Qwen3-VL是阿里巴巴推出的最新一代视觉语言模型,在文本理解、视觉感知、空间理解、视频分析和智能体交互等方面均有显著提升。该模型支持多模态输入,具备强大的推理能力和长上下文处理能力。
ginipick
Gemma3-R1984-4B是基于谷歌Gemma-3-4B模型构建的强大智能体AI平台,支持多模态文件处理和深度研究能力。
OpenGVLab
InternVL3-8B是OpenGVLab推出的先进多模态大语言模型,具备强大的多模态感知与推理能力,支持工具调用、GUI智能体、工业图像分析、3D视觉感知等新领域。
InstaDeepAI
ChatNT是首个深度理解生物序列(DNA、RNA、蛋白质)的多模态对话智能体,支持自然语言交互处理生物数据。
yeliudev
VideoMind是一个多模态智能体框架,通过模拟类人的认知过程来增强视频推理能力。
VideoMind是一个多模态智能体框架,通过模拟人类思维过程来增强视频推理能力。
VideoMind是一个多模态智能体框架,通过模拟人类思维的处理流程(如任务拆解、时刻定位与验证和答案合成)来增强视频推理能力。
microsoft
Magma是一个多模态AI智能体基础模型,能够处理图像和文本输入并生成文本输出,具备虚拟与现实环境中的复杂交互能力。
lamm-mit
Cephalo是一系列专注于多模态材料科学的视觉大语言模型(V-LLMs),旨在整合视觉和语言数据,以促进人机交互或多智能体AI框架中的高级理解和交互。
Cephalo是一系列专注于多模态材料科学的视觉大语言模型(V-LLMs),旨在整合视觉和语言数据,以促进人机交互或多智能体AI框架中的高级理解和互动。