Liquid AI 与 Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型检查点,覆盖 1.2B、2.6B、8B-A1B 三款模型。其采用全新投机解码路径,不改变输出质量,大幅提升推理吞吐量。实测 GPU 端最高提速 3.18 倍,端侧设备也有明显加速。
北大与DeepSeek联合开源大模型推理加速框架DSpark,针对自回归生成中每词元均需全算力导致的高并发延迟与算力浪费,提供突破性解决方案。
Iflytek
$2
输入tokens/百万
-
输出tokens/百万
上下文长度
8
$8