视觉大模型因隐形门槛——顶尖效果需天量数据与算力,长期仅为头部团队专属。7月21日,小鹏集团发布TuringViT高效视觉编码器,系统性重构架构、数据范式与训练流程,提供可复现、低成本的SOTA级视觉Transformer训练路径,推动先进视觉能力走向行业普惠。
月之暗面CEO杨植麟透露,让开源模型逼近闭源前沿不能只堆参数算力,更要重构Transformer根基。他们重新设计了沿用近十年的优化器Adam、注意力机制和残差连接,悄然撬动大模型训练的地基。
通义实验室推出Wan-Streamer v0.2,彻底解决传统视频通话卡顿、延迟和声画不同步问题。该端到端全模态模型仅550毫秒响应,将听、看、说、演能力整合于单一Transformer架构,实现近乎真实的“面对面”自然交流。
蚂蚁集团Robbyant开源LingBot-Vision模型家族,通过自监督视觉Transformer与创新“边界建模”,在密集空间感知任务上表现卓越,多项指标超越数倍参数的大模型,突破了现有视觉基础模型偏重物体识别的局限,让机器人精准感知物理空间成现实。
基于 Diffusion Transformer 架构的十亿参数文生 3D 动作模型。
1.3B参数的图像转视频模型,用于生成3D一致的新场景视图
AI21 Jamba Large 1.6 是一款强大的混合 SSM-Transformer 架构基础模型,擅长长文本处理和高效推理。
基于Transformer实现的ViTPose模型集合
Openai
$2.8
输入tokens/百万
$11.2
输出tokens/百万
1k
上下文长度
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
chunchiliu
这是一个已发布在 Hugging Face Hub 上的 🤗 Transformers 模型,其模型卡片由系统自动生成。目前卡片中大部分详细信息(如开发者、模型类型、语言、许可证等)均处于待补充状态。
optimum-internal-testing
这是一个Hugging Face Hub上的🤗 Transformers模型,具体信息待补充。模型卡片为自动生成,需要模型发布者提供更多详细信息。
ryandono
本模型是 mixedbread-ai/mxbai-edge-colbert-v0-17m 的量化(Int8 / Q8)版本,专为与 transformers.js 配合使用而导出。它包含了48维ColBERT架构所需的自定义投影层,旨在提供高效的向量检索能力。
Sachin-0001
这是一个基于🤗 Transformers库的双向自回归Transformer模型,已上传至模型中心。模型卡片由系统自动生成,具体技术细节和应用信息需要进一步补充。
riverjiang
这是一个发布在Hugging Face模型中心的Transformer模型,具体信息待补充。模型卡片为自动生成,需要进一步补充详细信息。
onnx-community
Supertonic-TTS-ONNX是一个基于ONNX格式的文本到语音转换模型,能够将英文文本转换为自然流畅的语音。该模型基于Supertone/supertonic基础模型开发,专为Transformers.js库优化,支持在浏览器环境中高效运行。
allenai
Olmo 3是由Allen Institute for AI (Ai2)开发的一系列语言模型,包含7B和32B两种规格,有Instruct和Think两种变体。该模型基于Transformer架构,具有长链思维能力,可有效提升数学和编码等推理任务的表现。
SAM3是基于概念的任意分割模型,能够根据输入的点、框等提示信息生成精确的图像分割掩码。该版本是ONNX格式的SAM3跟踪器模型,通过Transformers.js库可在浏览器环境中高效运行。
peterant330
这是一个上传至Hugging Face模型中心的Transformer模型,具体功能和特性需要进一步补充信息。
Maxlegrec
BT4模型是LeelaChessZero引擎背后的神经网络模型,专门用于国际象棋对弈。该模型基于Transformer架构设计,能够根据历史走法预测最佳下一步走法、评估棋局形势并生成走法概率。
Olmo 3 32B Think SFT是基于Transformer架构的自回归语言模型,在长链思维推理方面表现出色,特别擅长处理数学和编码等复杂推理任务。该模型在Dolma 3数据集上进行预训练,并在Dolci数据集上进行监督微调。
NyxKrage
Moondream 3 Preview HF是基于HuggingFace Transformers架构规范对Moondream 3 (Preview)模型的重新实现,使其能够与Hugging Face生态系统完全兼容。这是一个多模态视觉语言模型,采用专家混合(MoE)文本主干,约90亿参数,20亿活跃参数。
JetBrains-Research
这是一个已发布在Hugging Face Hub上的🤗 Transformers模型,具体信息需要从模型页面获取。该模型基于Transformer架构,适用于多种自然语言处理任务。
Prior-Labs
TabPFN-2.5是基于Transformer架构的表格基础模型,利用上下文学习技术,能够在一次前向传播中解决表格预测问题,为结构化表格数据提供高效的回归和分类解决方案。
mitegvg
该模型是基于VideoMAE架构的暴力检测模型,在Kinetics数据集预训练的基础上,针对暴力检测任务进行了92轮微调。模型采用Vision Transformer架构,专门用于视频内容分析,能够识别视频中的暴力行为。
strangervisionhf
这是一个基于DeepSeek-OCR的图像文本识别模型,专门解决了在最新版本transformers库中的兼容性问题,使模型能够在transformers v4.57.1等最新版本中顺利运行。
bn22
这是一个发布在Hugging Face模型中心的Transformer模型,模型卡片由系统自动生成,具体模型信息需要进一步补充
ByteDance
Ouro-2.6B是一款拥有26亿参数的循环语言模型,通过迭代共享权重计算实现了卓越的参数效率,在仅用26亿参数的情况下达到了30-40亿标准Transformer模型的性能水平。
Ouro-1.4B是由字节跳动开发的具有14亿参数的循环语言模型,通过迭代共享权重计算实现了卓越的参数效率,仅用14亿参数就达到了30-40亿标准Transformer模型的性能水平。
danggia
这是一个已上传至Hugging Face模型中心的transformers模型,模型卡片由系统自动生成,详细信息需要进一步补充。