日前,Liquid AI 与 Hugging Face 正式发布了 LFM2.5系列三款核心模型的 DSpark 草稿模型检查点,包括 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 以及 LFM2.5-8B-A1B。通过引入全新的投机解码路径,该技术在完全不改变模型输出质量的前提下,大幅提升了推理吞吐量。
核心性能提升与应用表现
在实际测试中,DSpark 草稿模型展现出了亮眼的加速效果。在 GPU 端,整体吞吐量最高可提升3.18倍;在端侧设备上,最高提升幅度也能达到2.87倍。
特别是在端侧智能体(Agent)推理场景中,LFM2.5-2.6B 的函数调用延迟平均降低了57%。以 M4Max MacBook Pro 作为端侧测试平台时,其输出速度最高可达每秒139个 token,这使得本地运行智能体应用的门槛大幅降低,用户体验甚至超越了部分专有云模型。

DSpark 的工作原理与架构设计
传统的大语言模型推理阶段主要受限于内存带宽,绝大部分延迟来自于将模型权重从 DRAM 流式加载到 SRAM 的过程。投机解码的出现正是为了解决这一痛点,它利用一个轻量级的草稿模型快速生成候选 token,再由目标模型在单次前向传播中对其进行统一验证,从而将加载权重的成本有效分摊。
DSpark 在现有方法的基础上进行了深度融合,主要包含三个核心组件:
- 并行主干网络:采用类 DFlash 的风格,以目标模型的上下文特征为条件,在单次前向传播中为所有草稿 token 统一生成隐藏状态。
- 顺序头(Markov 头):通过模拟相邻 token 之间的马尔可夫链增加依赖关系,从而有效提高了后续位置的接受率。
- 置信度调度验证器:负责预测每个 token 的存活概率,并在验证成本高于节省成本时,自动剪除低置信度的后缀。
在模型训练方面,该草稿模型采用了包含 SFT、聊天、代码和函数调用在内的大规模且多样化的数据混合。经过严格的消融实验,最终确定的初始版本为仅注意力(attention-only)架构,包含5层和9个块,整体参数量控制在大约3亿左右。

质量对齐与推理生态支持
由于投机解码机制的特性,在贪心解码下,草稿 token 只有在与目标模型分布完全一致时才会被接受,一旦被拒绝就会由目标模型自身的 token 取代。因此,生成的输出序列在结构上与基线贪心解码完全保持一致,各项基准测试的准确率没有任何下降。
生态支持方面,DSpark 在发布首日便实现了对主流推理框架的兼容:
- SGLang:通过专门的集成与启动配置,支持在加速器上运行。
- llama.cpp:实现了官方构建支持,并可通过命令行加载相应的 GGUF 权重与草稿模型文件。
目前,相关的 Safetensors 和 GGUF 格式检查点均已在 Hugging Face 平台上开源,为开发者在从云端大规模加速器到端侧边缘设备的广泛部署提供了强有力的支持。


