NVIDIA推出Nemotron3Embed嵌入向量模型系列,专为生产级RAG、智能体检索、代码检索和记忆场景设计。8B版本在RTEB基准测试中排名第一,成为性能最强的开源嵌入模型。系列包含三个开放检查点:精度优先的Nemotron-3-Embed-8B-BF16、轻量化的1B-BF16版,以及针对Blackwell架构优化的1B-NVFP4四比特版本,所有模型均采用双向注意力机制。
6月29日,英伟达宣布微软Azure全面上线Anthropic的Claude系列大模型。部署基于最新的GB300 Blackwell Ultra超级芯片,旨在为开发者和企业提供顶级推理能力。此举再次凸显算力架构升级对AI应用落地的关键作用,也标志着微软AI生态建设迈出重要一步。
Anthropic的Claude模型已在微软Azure面向企业全面开放,部署采用英伟达最新Blackwell Ultra GB300 GPU平台,整合GB300NVL72系统。此举标志着企业级AI代理应用迈入高性能算力支撑的新阶段。
特斯拉下一代AI5芯片已完成流片,预计2027年量产,将接替AI4成为自动驾驶和人形机器人的核心算力平台。其单芯片性能媲美英伟达Hopper架构,双芯配置表现更优。
NVIDIA GeForce RTX 5070 Ti显卡,采用Blackwell架构,支持DLSS 4技术,为游戏和创作带来强大性能。
开创计算新时代的NVIDIA Blackwell平台现已发布
mratsim
GLM-4.5-Iceblink-v2-106B-A12B-FP8是基于GLM-4.5-Iceblink-v2-106B-A12B模型,采用最先进的混合专家量化方法进行FP8量化的版本。该模型专门针对支持硬件FP8的Ada、Hopper或Blackwell系列GPU优化,在保持高质量输出的同时显著提升推理效率。
QuantStack
这是基于Danrisi的Flux架构文本到图像模型UltraReal Fine-Tune的Nunchaku量化(SVDQ)版本。该模型提供了两种量化格式:INT4适用于非Blackwell架构GPU(50系列之前),NVFP4适用于Blackwell架构GPU(50系列),旨在降低硬件需求同时保持图像生成质量。
spooknik
这是UltraReal Fine-Tune模型的SVDQ量化版本,由Danrisi基于Flux开发,是一款文本到图像生成模型。该版本提供了多种量化方案,适配不同GPU硬件,特别针对非Blackwell系列和Blackwell系列GPU进行了优化。
这是Project0模型的SVDQ量化版本,基于Flux Dev和Flux Krea创建的文本到图像模型。该模型提供了多种量化格式,针对不同GPU架构进行了优化,包括INT4和FP4量化版本,适用于Blackwell和非Blackwell GPU用户。