视觉大模型因隐形门槛——顶尖效果需天量数据与算力,长期仅为头部团队专属。7月21日,小鹏集团发布TuringViT高效视觉编码器,系统性重构架构、数据范式与训练流程,提供可复现、低成本的SOTA级视觉Transformer训练路径,推动先进视觉能力走向行业普惠。
蚂蚁集团Robbyant开源LingBot-Vision模型家族,通过自监督视觉Transformer与创新“边界建模”,在密集空间感知任务上表现卓越,多项指标超越数倍参数的大模型,突破了现有视觉基础模型偏重物体识别的局限,让机器人精准感知物理空间成现实。
Google发布全新开源大模型Gemma412B,采用“Unified”无编码器架构,突破端侧全模态AI。该模型无需传统视觉、音频外部编码器,直接输入文字、图像、音频、视频四种模态数据至同一Transformer主干网络处理,消除了外挂“翻译”模块带来的显存占用和高延迟问题。
英伟达发布全球首款全开源物理AI大模型Cosmos3,基于混合Transformer架构,融合视觉推理、世界生成与动作预测,将物理AI训练评估周期从数月缩短至数天,解决具身智能数据有限和仿真零散问题。
多模态大型语言模型,融合视觉与语言理解。
用于视觉合成的统一3D Transformer流水线
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$2
$20
-
$8
$240
52
Bytedance
$1.2
$3.6
4
$3.9
$15.2
64
$0.8
NyxKrage
Moondream 3 Preview HF是基于HuggingFace Transformers架构规范对Moondream 3 (Preview)模型的重新实现,使其能够与Hugging Face生态系统完全兼容。这是一个多模态视觉语言模型,采用专家混合(MoE)文本主干,约90亿参数,20亿活跃参数。
nvidia
NVIDIA-Nemotron-Nano-VL-12B-V2-FP4-QAD 是 NVIDIA 推出的自回归视觉语言模型,基于优化的 Transformer 架构,能够同时处理图像和文本输入。该模型采用 FP4 量化技术,在保持性能的同时显著减少模型大小和推理成本,适用于多种多模态应用场景。
NVIDIA-Nemotron-Nano-VL-12B-V2-FP8 是 NVIDIA 推出的量化视觉语言模型,采用优化的 Transformer 架构,在商业图像上进行了三阶段训练。该模型支持单图像推理,具备多语言和多模态处理能力,适用于图像总结、文本图像分析等多种场景。
birder-project
这是一个基于RoPE(旋转位置编码)的Vision Transformer模型,参数规模为150M,采用14x14的patch大小。该模型在约2100万张图像的多样化数据集上进行了预训练,可作为通用视觉特征提取器使用。
iszt
这是一个基于DINOv2预训练的视觉变换器模型,专门针对视网膜彩色眼底照片进行优化。该模型在MEH AlzEye数据集子集上训练,提供与Hugging Face Transformers兼容的格式,便于进行视网膜图像特征提取和下游医学影像任务。
timm
这是一个基于DINOv3框架的视觉Transformer模型,通过知识蒸馏技术从DINOv3 ViT-7B模型在LVD-1689M数据集上训练得到。该模型专门用于图像特征编码,能够高效提取图像特征表示,适用于各种计算机视觉任务。
这是一个基于DINOv3架构的视觉Transformer模型,采用小型(Small)配置,在LVD-1689M数据集上通过知识蒸馏训练而成。该模型专门用于高效提取图像特征,支持图像分类、特征图提取和图像嵌入等多种计算机视觉任务。
这是一个基于DINOv3架构的Vision Transformer图像特征编码器,通过从7B参数的DINOv3 ViT模型在LVD-1689M数据集上进行知识蒸馏得到。该模型专门用于图像特征提取任务,具有强大的视觉表示能力。
facebook
MapAnything是一个端到端训练的Transformer模型,能够以多种模态作为输入,直接回归场景的分解度量3D几何结构。该模型支持超过12种不同的3D重建任务,包括多图像SfM、多视图立体视觉、单目度量深度估计等。
DINOv3是Meta AI开发的一系列通用视觉基础模型,无需微调就能在多种视觉任务中超越专门的先进模型。该模型采用Vision Transformer架构,在16.89亿张网络图像上预训练,能生成高质量的密集特征,在图像分类、分割、检索等任务中表现出色。
MetaCLIP 2 (worldwide) 是一个基于Transformer架构的多语言零样本图像分类模型,支持全球范围内的视觉语言理解任务,能够实现无需训练即可对图像进行分类的能力。
abhilash88
一款先进的视觉Transformer模型,可同时进行高精度年龄估计和性别分类,在UTKFace数据集上实现了94.3%的性别分类准确率和4.5岁的年龄平均绝对误差。
mradermacher
Perseus-Doc-vl-0712量化模型是一个支持文本生成推理、图像字幕生成、光学字符识别等多领域应用的视觉与语言理解模型,基于transformers库构建。
Mungert
Holo1-3B是基于Transformer架构的多模态模型,专注于视觉文档检索任务,在WebVoyager基准测试中表现出色,平衡了准确性和成本。
google
Gemma 3n是谷歌推出的轻量级多模态模型,基于Transformer架构,支持文本、音频和视觉(图像和视频)输入,适用于低资源设备。
chs20
FuseLIP是一种创新的多模态嵌入模型,它通过一个单一的Transformer模型,使用扩展的词汇表同时处理文本和图像离散令牌,实现了模态间的早期深度融合。该方法解决了传统对比式语言-图像预训练模型无法原生编码多模态输入的问题,在视觉问答和文本引导的图像检索等任务上表现出色。
ByteDance-Seed
SAIL是一个专为视觉与语言设计的单一Transformer模型,作为统一的多模态大语言模型(MLLM),它在单一架构中无缝集成了原始像素编码和语言解码功能。
基于80亿MetaCLIP数据训练的70亿参数视觉Transformer模型,采用DINOv2自监督学习框架,无需语言监督
20亿参数的自监督视觉Transformer模型,基于严格筛选的网络图像数据训练,特别优化图表和文本理解能力
50亿参数的视觉Transformer模型,通过20亿网络图像的自监督学习训练而成,无需语言监督即可在各种视觉任务中表现优异。