蚂蚁集团百灵大模型系列更新,Ling-2.6-flash正式开放。该模型总参数104B,激活参数7.4B,提供BF16、FP8、INT4等多精度版本,适配不同硬件环境并降低部署门槛。此前以“Elephant Alpha”匿名在OpenRouter平台测试。
国产AI芯片与大模型协同优化取得重要进展。摩尔线程与硅基流动基于国产GPU MTT S5000,成功完成对千亿参数大模型DeepSeek V3 671B的深度适配。通过应用FP8低精度推理技术,实现单卡预填充吞吐量超4000 tokens/秒,解码吞吐量超1000 tokens/秒,推理速度已接近国际主流高端AI加速器水平。
蚂蚁集团开源万亿参数大模型Ling-1T,采用FP8低精度训练,为当前最大基座模型。该模型由"百灵"团队开发,属于Ling2.0家族,包含Ling、Ring、Ming三大系列。其中Ling系列专注通用任务,强调速度与效率优势。
智谱发布GLM-4.6模型,采用寒武纪国产芯片,首次实现FP8+Int4混合量化部署。该技术突破在保持模型精度的同时显著降低推理成本,为国产芯片支持大模型本地化运行开辟新路径。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
Bytedance
$1.2
$3.6
4
kyr0
这是一个专为苹果硅芯片设备优化的自动语音识别模型,通过转换为MLX框架并量化为FP8格式,实现在苹果设备上的快速端上语音转录。该模型针对逐字精度进行微调,特别适用于需要高精度转录的场景。
ibm-granite
Granite 4.0 H-Small (FP8) 是IBM开发的Granite系列语言模型的小型FP8量化版本,专为提供专业、准确和安全的回复而设计。该模型采用FP8精度格式,在保持性能的同时优化了推理效率。
nvidia
NVIDIA Qwen3-235B-A22B FP8模型是阿里云Qwen3-235B-A22B模型的量化版本,采用优化的Transformer架构,是一个自回归语言模型。该模型通过FP8量化技术显著减少了磁盘空间和GPU内存需求,同时保持较高的推理精度,适用于各种AI应用场景。
nm-testing
QwQ-32B的FP8量化版本,通过动态量化技术减少50%存储和内存需求,同时保持99.75%的原模型精度
RedHatAI
QwQ-32B的FP8量化版本,通过动态量化技术减少50%存储和内存需求,同时保持99.75%的原始模型精度
lllyasviel
Omost 的 phi-3-mini 模型,具有 128k 上下文长度,采用 fp8 精度。
FriendliAI
由FriendliAI量化为FP8精度的Mistral-7B-Instruct-v0.2模型,在保持高精度的同时显著提升推理效率。