Moonshot AI旗下开源编码代理Kimi Code近日升级,主要亮点包括:极简安装(一行CLI命令,零配置启动)、视频上下文能力(支持拖入视频作为编码参考,实现LUT引用、长视频转短视频、屏幕录制转代码等多模态开发)以及丰富插件生态,显著提升易用性和功能扩展性。
谷歌推出基于Gemini 3.1Pro架构的Deep Research与Deep Research Max两款AI研究代理,现已开放付费预览。它们旨在自动化复杂研究流程,推动AI从简单搜索向具备深度推理的“长时计算”演进。标准版注重高效低延迟,适合实时对话;Max版则优先研究深度与准确性,适用于复杂任务。
阿里巴巴通义实验室发布MAI-UI多模态GUI智能代理家族,整合人机交互、工具使用与云端协作,在通用及移动GUI导航方面表现领先,超越多个同行模型。该系统基于Qwen3VL构建,提供多种规模模型,支持自然语言指令处理。
谷歌DeepMind CEO哈萨比斯在Axios AI+峰会上预测,2026年将是多模态AI、互动视频世界和可靠AI代理快速发展的关键一年。他特别提到,其最新模型Gemini在多模态能力上已取得显著进展,不仅能描述情节,还能深入理解场景深层含义。
最强大的代理和编码模型,具备最佳的多模态理解能力。
OneReach是一个用于创建高级多模态AI代理的平台,旨在提升员工和客户体验。
一个用于智能设备等的多模态原生代理框架。
下一代AI代理框架,全球首个真正的实时多模态AI代理框架。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
-
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
$8
$240
52
unsloth
InternVL3-78B-Instruct是一个先进的多模态大语言模型,在多模态感知、推理和语言处理等方面表现出色。该模型通过原生多模态预训练方法,将视觉和语言学习整合到统一训练阶段,在工具使用、GUI代理、工业图像分析、3D视觉感知等多个领域展现出卓越能力。
InternVL3-14B-Instruct 是一个先进的多模态大语言模型(MLLM),展示了卓越的多模态感知和推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等多种任务。
InternVL3-2B-Instruct是先进的多模态大语言模型,相比前代有更出色的多模态感知和推理能力,扩展了工具使用、GUI代理、工业图像分析、3D视觉感知等方面。采用原生多模态预训练方法,将语言和视觉学习整合到单个预训练阶段。
InternVL3-78B是一款先进的多模态大语言模型,具备卓越的多模态感知和推理能力,在工具使用、GUI代理、工业图像分析、3D视觉感知等领域表现出色,整体文本性能也十分优秀。
InternVL3-14B是一个先进的多模态大语言模型,在InternVL 2.5基础上显著提升了多模态感知和推理能力,并拓展了工具使用、GUI代理、工业图像分析、3D视觉感知等领域的应用。
InternVL3-1B是一款先进的多模态大语言模型,在多模态感知、推理等能力上表现出色,还拓展了工具使用、GUI代理等多模态能力。
OpenGVLab
InternVL3-38B是一个先进的多模态大语言模型(MLLM),在多模态感知和推理能力上有显著提升,支持工具使用、GUI代理、工业图像分析、3D视觉感知等领域。
InternVL3-9B是InternVL3系列中的一款多模态大语言模型,具备卓越的多模态感知与推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等多种应用场景。
InternVL3-2B是OpenGVLab推出的先进多模态大语言模型(MLLM),具备卓越的多模态感知和推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等。
InternVL3-78B是OpenGVLab推出的先进多模态大语言模型,展现卓越的综合性能。相比前代InternVL 2.5,具备更强大的多模态感知与推理能力,并将能力拓展至工具使用、GUI代理、工业图像分析、3D视觉感知等新领域。
InternVL3-8B-Instruct 是一个先进的多模态大语言模型(MLLM),展示了卓越的多模态感知和推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等多种功能。
InternVL3-38B-Instruct 是一个先进的多模态大语言模型(MLLM),展示了卓越的多模态感知和推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等多种任务。
InternVL3-78B-Instruct是OpenGVLab推出的先进多模态大语言模型,展示了卓越的多模态感知和推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等多种任务。
FriendliAI
InternVL3-38B 是一款先进的多模态大语言模型,在多模态感知、推理等能力上表现卓越,相较于前代模型有显著提升,还拓展了工具使用、GUI 代理等多模态能力。
InternVL3-8B是一款先进的多模态大语言模型,具备卓越的多模态感知和推理能力,在工具使用、GUI代理、工业图像分析等多领域表现出色。
Alhdrawi
Qwen2.5-VL-32B-Instruct是Qwen家族的最新视觉语言模型,具备强大的视觉理解和智能代理能力,支持多模态任务处理。
Benasd
Qwen2.5-VL是通义千问团队推出的多模态大语言模型,具备强大的视觉理解和智能代理能力,支持图像、视频、文本等多种输入格式。
fixie-ai
Ultravox是基于Llama3.3-70B和Whisper构建的多模态语音大语言模型,支持语音和文本输入,适用于语音代理、翻译等场景。
Ultravox 是一个基于 Mistral-Nemo 和 Whisper 的多模态模型,可同时处理语音和文本输入,适用于语音代理、语音翻译等任务。
adept
Fuyu-8B是Adept AI开发的多模态文本-图像转换器,专为数字代理设计,支持任意图像分辨率,响应迅捷且架构简洁。
一个高性能的MCP服务器,为LLM代理提供持久化的多模态上下文存储,支持线程隔离、元数据过滤、全文搜索和语义搜索,兼容SQLite和PostgreSQL后端。