NVIDIA推出Nemotron3Embed嵌入向量模型系列,专为生产级RAG、智能体检索、代码检索和记忆场景设计。8B版本在RTEB基准测试中排名第一,成为性能最强的开源嵌入模型。系列包含三个开放检查点:精度优先的Nemotron-3-Embed-8B-BF16、轻量化的1B-BF16版,以及针对Blackwell架构优化的1B-NVFP4四比特版本,所有模型均采用双向注意力机制。
NVIDIA推出统一音频-文本大模型Audex,基于纯文本MoE架构,采用单一Transformer,解决多模态模型音频增强导致文本逻辑下降的难题,实现高效音频理解与文本能力的平衡。
英伟达发布Nemotron-Labs-TwoTower离散扩散语言模型,解决大模型逐token生成速度慢的痛点,权重已在Huggingface开源。该模型复用现有骨干网预训练权重,无需从头训练,显著降低成本。采用60B双塔架构,两座30B网络并行协同,每塔激活3B参数并搭载128个可路由专家模块,提升生成效率。
英伟达开源Nemotron-Labs-TwinTower扩散语言模型,通过“双塔”架构突破自回归模型的串行解码瓶颈。该模型将生成任务拆分为两个子网络,其中一个保持冻结,以并行方式提升文本生成吞吐量,为大规模合成任务提供高效新解法。
一款高效的推理与聊天大语言模型。
将Common Crawl转化为精细的长期预训练数据集
由NVIDIA定制的大型语言模型,提升查询回答的帮助性。
高效准确的AI语言模型
nvidia
NVIDIA Nemotron Parse v1.1 TC 是一款先进的文档语义理解模型,能够从图像中提取具有空间定位的文本和表格元素,生成结构化注释,包括格式化文本、边界框和语义类别。相比前一版本,速度提升20%,并保留无序元素的页面顺序。
NVIDIA Nemotron Parse v1.1 是一款先进的文档解析模型,专门用于理解文档语义并提取具有空间定位的文本和表格元素。它能够将非结构化文档转换为机器可读的结构化表示,克服了传统OCR在处理复杂文档布局时的局限性。
NVIDIA Nemotron Nano v2 12B VL是一款强大的多模态视觉语言模型,支持多图像推理和视频理解,具备文档智能、视觉问答和摘要功能,可用于商业用途。
Llama Nemotron Reranking 1B是NVIDIA开发的专门用于文本检索重排序的模型,基于Llama-3.2-1B架构微调,能够为查询-文档对提供相关性对数得分,支持多语言和长文档处理。
Llama Nemotron Embedding 1B模型是NVIDIA开发的专为多语言和跨语言文本问答检索优化的嵌入模型,支持26种语言,能够处理长达8192个标记的文档,并可通过动态嵌入大小大幅减少数据存储占用。
Nemotron-Flash-3B 是英伟达推出的新型混合小型语言模型,专门针对实际应用中的低延迟需求设计。该模型在数学、编码和常识推理等任务中展现出卓越性能,同时具备出色的小批量低延迟和大批量高吞吐量特性。
mlx-community
这是一个基于NVIDIA Nemotron架构的49B参数大语言模型,已转换为MLX格式并进行了4位量化,专门为Apple Silicon芯片优化,提供高效的文本生成能力。
unsloth
NVIDIA Nemotron Nano 9B v2 是 NVIDIA 开发的一款高性能大语言模型,采用 Mamba2-Transformer 混合架构,支持多语言推理和聊天任务,在多个基准测试中表现优异,特别支持运行时'思考'预算控制功能。
Mungert
NVIDIA Nemotron Nano 12B v2是由NVIDIA开发的大语言模型,采用Mamba2-Transformer混合架构,具有120亿参数。该模型支持多语言处理,在多个基准测试中表现出色,特别擅长推理任务,支持运行时推理预算控制。
cpatonn
NVIDIA Nemotron Nano 12B v2是由NVIDIA从头训练的大型语言模型,专为推理和非推理任务设计。采用混合Mamba2-Transformer架构,支持多语言,具备可控推理能力,可根据用户需求生成推理过程或直接给出答案。
QuantFactory
这是 NVIDIA Nemotron Nano 12B v2 模型的 GGUF 量化版本,采用混合 Mamba-2 和 Transformer 架构,支持多语言推理和聊天功能,具有 120 亿参数,支持长达 128K 的上下文长度。
bartowski
这是NVIDIA Nemotron-Nano-12B-v2模型的Llamacpp imatrix量化版本,提供多种量化选项,从BF16到极低比特率的IQ2量化,帮助用户在不同硬件条件下高效运行该模型。
这是NVIDIA Nemotron-H-47B-Reasoning-128K模型的量化版本,使用llama.cpp的imatrix技术进行优化。该模型支持128K上下文长度,专为推理任务设计,提供了从BF16到极低比特率的多种量化选项,适合不同硬件配置和性能需求。
这是NVIDIA Nemotron-H-8B-Reasoning-128K模型的Llamacpp imatrix量化版本,提供多种量化类型的模型文件,以满足不同硬件和性能需求。支持128K上下文长度,专为推理任务优化。
这是NVIDIA Nemotron-Nano-9B-v2模型的量化版本,使用llama.cpp b6317版本进行量化处理。该模型提供了多种量化选项,包括bf16、Q8_0、Q6_K_L等,适用于不同的硬件和使用场景,方便用户部署和使用。
这是NVIDIA Nemotron Nano 9B v2模型的4位量化版本,专为Apple Silicon优化,使用MLX框架转换。该模型是一个9B参数的大型语言模型,支持多语言文本生成任务。
NVIDIA Nemotron Nano 12B v2 是由 NVIDIA 从零开始训练的大语言模型,专为推理和非推理任务设计。该模型采用混合架构,结合 Mamba-2 和注意力层,支持多语言处理,并可通过系统提示控制推理能力。
NVIDIA OpenReasoning - Nemotron - 32B的量化版本,通过llama.cpp进行量化处理,减少模型存储和计算资源需求,便于部署。
lmstudio-community
这是英伟达OpenReasoning Nemotron 14B的量化版本,由bartowski基于llama.cpp提供GGUF量化。
这是英伟达OpenReasoning Nemotron 7B模型的GGUF量化版本,专门用于文本生成任务。该模型通过LM Studio社区模型亮点计划提供,支持高效的推理和部署。