字节跳动 Seed 团队与清华 AIR 联合发布 CUDA Agent,这是一套训练大模型编写高性能 GPU 内核的智能体强化学习系统。该系统针对大模型生成 CUDA 代码效率低、难超传统编译器的痛点,标志着 AI 在底层代码优化领域取得重要进展,并以 KernelBench 为评测基准。
SpaceX AI推出旗舰模型Grok4.6,专注复杂长程Agent任务,多项基准测试比肩或超越OpenAI GPT-5.6 Sol。此前7月联合Cursor推出基于数万张英伟达GB300 GPU训练的Grok4.5,Grok4.6在其基础上进一步优化长程复杂任务能力。
Quantinuum与Oracle达成战略合作,将Helios量子计算机部署至Oracle Cloud Infrastructure AI数据中心,作为托管云服务提供。客户无需自购硬件,即可通过OCI量子服务直接访问,并与本地GPU及高性能计算资源协同使用,应用于药物研发、材料科学、金融建模及大规模优化等领域。
Meta 正加速推进自研AI芯片计划,与博通、台积电合作开发代号“Iris”的处理器,预计2026年9月量产。该芯片为MTIA项目核心,已通过初期测试,旨在优化平台推荐与生成式算法,降低数据中心成本,逐步摆脱对第三方GPU的依赖。
RunInfra优化开源模型用于生产,提供可导出的部署堆栈和API。
AI 驱动的 CUDA 代码优化平台,快速提升 GPU 性能,无需手动优化复杂代码。
Wan2GP 是一个优化后的开源视频生成模型,专为低配置 GPU 用户设计,支持多种视频生成任务。
一个用于专家并行负载均衡的开源算法,旨在优化多GPU环境下的专家分配和负载平衡。
Openai
$2.8
输入tokens/百万
$11.2
输出tokens/百万
1k
上下文长度
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
-
$0.7
Alibaba
Moonshot
$4
$16
256
Bytedance
$0.8
$2
128
Baidu
32
Tencent
$1
$0.4
$8.75
$70
400
$1.75
$14
$0.35
64
$0.63
$3.15
131
$15
Huawei
$8
silveroxides
基于 black-forest-labs/FLUX.2-dev 的优化版本图像生成模型,支持图像到图像的生成和编辑任务,采用 fp8_scaled 量化技术提升推理速度,特别适合在低显存 GPU 上使用。
mratsim
GLM-4.5-Iceblink-v2-106B-A12B-FP8是基于GLM-4.5-Iceblink-v2-106B-A12B模型,采用最先进的混合专家量化方法进行FP8量化的版本。该模型专门针对支持硬件FP8的Ada、Hopper或Blackwell系列GPU优化,在保持高质量输出的同时显著提升推理效率。
hum-ma
Wan2.2-TI2V-5B-Turbo-GGUF是基于quanhaol/Wan2.2-TI2V-5B-Turbo基础模型转换而来的图像转视频模型,经过优化可在4GB GPU上运行,具有出色的通用性和高效推理能力。
QuantStack
本项目是基于Flux架构的文本到图像模型Nepotism的量化版本,采用SVDQuant技术进行优化。提供了INT4和FP4两种量化格式,分别适用于不同世代的GPU硬件,在保持图像生成质量的同时显著减少模型大小和内存占用。
spooknik
这是UltraReal Fine-Tune模型的SVDQ量化版本,由Danrisi基于Flux开发,是一款文本到图像生成模型。该版本提供了多种量化方案,适配不同GPU硬件,特别针对非Blackwell系列和Blackwell系列GPU进行了优化。
TheStageAI
TheWhisper-Large-V3是OpenAI Whisper Large V3模型的高性能微调版本,由TheStage AI针对多平台(NVIDIA GPU和Apple Silicon)的实时、低延迟和低功耗语音转文本推理进行了优化。
这是Project0模型的SVDQ量化版本,基于Flux Dev和Flux Krea创建的文本到图像模型。该模型提供了多种量化格式,针对不同GPU架构进行了优化,包括INT4和FP4量化版本,适用于Blackwell和非Blackwell GPU用户。
Project0 SVDQ 是基于 Flux Dev 和 Flux Krea 的文本到图像模型的量化版本,采用 SVDQuant 技术进行优化,提供 INT4 和 FP4 两种量化格式,分别适用于不同世代的 GPU 硬件。
基于J1B的Flux.1-Dev开发的文本到图像生成模型的量化版本,采用SVDQuant技术进行优化,提供INT4和FP4两种量化格式,适用于不同GPU架构的用户。
基于Flux.1开发的文本到图像生成模型的SVDQ量化版本,提供INT4和FP4两种量化格式,针对不同GPU架构优化,在保持图像质量的同时显著减少显存占用和提升推理速度。
PixelWave是基于Flux.1开发的文本到图像模型,经过Nunchaku量化(SVDQ)优化,为不同GPU配置的用户提供了高效的图像生成解决方案。
CenKreChro-SVDQ是基于CenKreChro文本到图像模型的量化版本,采用SVDQuant技术进行优化。该模型结合了Chroma和Flux Krea的优势,提供了高效的图像生成能力,特别针对不同GPU架构进行了优化。
CenKreChro-SVDQ 是基于 Chroma 和 Flux Krea 合并的文本到图像生成模型的量化版本,采用 SVDQuant 技术进行优化,提供 INT4 和 FP4 两种量化格式,分别适用于不同世代的 GPU 硬件。
Downtown-Case
GLM 4.6是一款专为128GB内存+单GPU配置优化的量化模型,采用IQ_K量化方式,相比主流llama.cpp在相同大小下提供更好的质量和性能。该模型需要配合ik_llama.cpp使用,在128GB双通道DDR5内存、单CCD Ryzen 7000处理器+单张3090显卡配置下,文本生成速度可达每秒约6.8个token。
RedHatAI
这是NVIDIA-Nemotron-Nano-9B-v2模型的FP8动态量化版本,通过将权重和激活量化为FP8数据类型实现优化,显著减少磁盘大小和GPU内存需求约50%,同时保持出色的文本生成性能。
bartowski
这是TheDrummer/Snowpiercer-15B-v3模型的GGUF量化版本,提供了多种量化选项,从高质量到低内存占用,支持在CPU和GPU上高效运行。模型使用llama.cpp进行量化,并针对不同硬件进行了优化。
nvidia
NVIDIA Qwen2.5-VL-7B-Instruct-FP4是阿里巴巴Qwen2.5-VL-7B-Instruct模型的量化版本,采用优化的Transformer架构,支持多模态输入(文本和图像),适用于多种AI应用场景。该模型通过TensorRT Model Optimizer进行FP4量化,在NVIDIA GPU上提供高效的推理性能。
NVIDIA Qwen3-14B FP4模型是阿里巴巴Qwen3-14B模型的量化版本,采用FP4数据类型进行优化,通过TensorRT-LLM进行高效推理。该模型专为NVIDIA GPU加速系统设计,适用于AI Agent系统、聊天机器人、RAG系统等多种AI应用场景,支持全球范围内的商业和非商业使用。
NVIDIA Qwen3-14B FP4 模型是阿里云 Qwen3-14B 模型的量化版本,采用优化的 Transformer 架构,是一个自回归语言模型。该模型使用 TensorRT Model Optimizer 进行量化,将权重和激活量化为 FP4 数据类型,可在 NVIDIA GPU 加速系统上实现高效推理。
NVIDIA Qwen3-8B FP8 是阿里巴巴Qwen3-8B模型的量化版本,采用优化的Transformer架构,属于自回归语言模型。该模型通过FP8量化技术优化,可在NVIDIA GPU上实现高效推理,支持商业和非商业用途。
Forge MCP服务器是一个通过32个并行AI代理将PyTorch模型自动优化为高性能CUDA/Triton内核的工具,可将推理速度提升高达14倍,支持多种MCP兼容的AI编程助手。