微软研究院29日发布实验性多模态AI系统Project Quine,定位为面向生物学的“世界模型”,旨在连接计算建模与实验室实操。该系统由微软联合哈佛大学及MIT博德研究所打造,将基因组学、蛋白质、化学、细胞状态与生物成像纳入统一联合表征框架,并具交互式推理能力,可同时处理多领域信息。
Covonaut发布v1.1.4,新增滚动工具执行池、多模态读取及安全隔离增强。该Go语言Agent框架纯Go实现、MIT协议,覆盖主循环、工具调用、图编排与多协议互操作。升级无需改接口,新特性开箱即用,调度为本次核心。
xAI多模态负责人蔺旭东近日加入腾讯,任混元多模态内容生成算法负责人。他2018年毕业于清华,后赴哥伦比亚大学读博,研究方向为嵌入学习、视频分析与生成模型;曾实习于腾讯、Facebook AI及谷歌,并第一作者参与Vx2Text框架研发,提升字幕生成能力。
Black Forest Labs发布FLUX3多模态基础模型,采用统一架构联合学习图像、视频和音频。基于Self-Flow自监督流匹配框架,在FLUX系列基础上扩展多模态生成与理解。支持文生视频、图生视频,单次生成最长20秒视频并原生输出同步音频,性能全面超越前代。
OmniHuman-1 是一种基于单张人像和运动信号生成人类视频的多模态框架。
Janus-Pro-7B 是一个新型的自回归框架,统一多模态理解和生成。
Janus-Pro-1B 是一个统一多模态理解和生成的自回归框架。
一个用于智能设备等的多模态原生代理框架。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
-
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
$6
$24
Baidu
128
$8
$240
52
ExaltedSlayer
Gemma 3是谷歌推出的轻量级开源多模态模型,本版本为12B参数的指令调优量化感知训练模型,已转换为MLX框架的MXFP4格式,支持文本和图像输入并生成文本输出,具有128K上下文窗口和140+语言支持。
mlx-community
这是一个基于Qwen3-VL-32B-Thinking模型转换的4位量化版本,专门针对MLX框架优化。该模型是一个32B参数规模的多模态视觉语言模型,具备思维链推理能力,能够同时处理图像和文本输入,生成高质量的文本响应。
这是Qwen3-VL-4B-Instruct模型的4位量化版本,专门针对Apple Silicon芯片优化,使用MLX框架转换。该模型是一个视觉语言模型,支持图像理解和多模态对话任务。
inclusionAI
Ming-UniVision是一个多模态大语言模型,首次将连续视觉表征集成到下一令牌预测框架中,在单一自回归范式下统一了视觉和语言,无需离散量化或特定模态的头部。该模型支持联合图像理解与生成,在视觉语言训练中收敛速度更快,还支持多轮上下文视觉任务。
这是一个基于Huihui-GLM-4.5V-abliterated模型转换而来的视觉语言模型,采用MXFP4量化格式,专门针对Apple MLX框架优化,支持图像理解和多模态对话任务。
Alissonerdx
HuMo是一个统一的、以人为中心的视频生成框架,能够根据文本、图像和音频等多模态输入,生成高质量、细粒度且可控的人类视频。它支持强大的文本提示跟随、一致的主体保留以及同步的音频驱动运动。
VeryAladeen
HuMo是一个以人为中心的视频生成框架,能够利用文本、图像和音频等多模态输入生成高质量、细粒度且可控的人类视频,支持文本提示跟随、主体保留和音频驱动运动同步。
MiniCPM4.1-8B-8bit是基于MiniCPM4.1-8B模型转换的8位量化版本,专为MLX框架优化,提供高效的多模态语言处理能力
OpenGVLab
InternVL3_5-38B是开源多模态模型InternVL3.5系列中的一员,在多功能性、推理能力和推理效率方面取得了显著进展。它支持多语言,可应用于图像文本到文本的任务,采用级联强化学习框架和视觉分辨率路由器技术优化性能。
InternVL3.5-4B是开源多模态模型系列中的中等规模版本,在通用性、推理能力和推理效率上取得显著进展,支持GUI交互等新能力。该模型采用级联强化学习框架和视觉分辨率路由器技术,实现了高效的多模态理解与推理。
InternVL3.5-4B是开源多模态模型系列的中等规模版本,包含4.7亿参数,采用先进的级联强化学习框架和视觉分辨率路由器技术,显著提升了多模态推理能力和效率。
这是一个基于GLM-4.5V模型转换的4位量化版本,专门针对MLX框架优化。该模型是一个视觉语言模型,支持图像理解和多模态对话任务。
这是一个基于MLX框架转换的视觉语言模型,由huihui-ai/Huihui-GLM-4.5V-abliterated转换而来,支持图像理解和多模态对话任务。
DeepGlint-AI
UniME是一个基于多模态大模型的通用嵌入学习框架,通过文本判别知识蒸馏和硬负样本增强的指令调优策略,显著提升了多模态嵌入能力。
jobs-git
SkyReels V2是全球首个采用扩散强制框架的无限长度电影生成模型,融合多模态大语言模型、多阶段预训练、强化学习与扩散强制技术实现全面优化。
nonwhy
PURE是首个采用多模态大型语言模型(MLLM)作为主干网络来解决低级视觉任务的框架。
wusize
Harmon是一种创新的统一多模态理解与生成框架,通过共享的MAR编码器协调理解与生成的视觉表征,在文本生成图像和多模态理解任务中表现优异。
MLAdaptiveIntelligence
LLaVAction是一个面向动作识别的多模态大语言模型评估与训练框架,基于Qwen2语言模型架构,支持第一人称视角视频理解。
yeliudev
VideoMind是一个多模态智能体框架,通过模拟类人的认知过程来增强视频推理能力。
VideoMind是一个多模态智能体框架,通过模拟人类思维过程来增强视频推理能力。
基于MCP框架的多模态助手客户端,提供Python代码执行、实时天气查询等功能,包含Streamlit交互界面和SSE服务工具。