Liquid AI 與 Hugging Face 發佈 LFM2.5 系列 DSpark 草稿模型檢查點,覆蓋 1.2B、2.6B、8B-A1B 三款模型。其採用全新投機解碼路徑,不改變輸出質量,大幅提升推理吞吐量。實測 GPU 端最高提速 3.18 倍,端側設備也有明顯加速。
北大與DeepSeek聯合開源大模型推理加速框架DSpark,針對自迴歸生成中每詞元均需全算力導致的高併發延遲與算力浪費,提供突破性解決方案。
Iflytek
$2
輸入tokens/百萬
-
輸出tokens/百萬
上下文長度
8
$8