英伟达研究团队实现KV缓存跨模型迁移,让目标模型跳过预填充阶段,转换速度比重新处理上下文快2.7到25倍。KV缓存解释了聊天机器人首词延迟现象:生成第一个词前需预处理全部输入,后续词可复用缓存快速生成,该突破能大幅减少响应等待。
MiniMax M3模型正式发布,京东云JoyBuilder平台同步接入并开放服务。核心亮点是推理性能大幅提升,通过自研推理框架结合PD分离部署、KV Cache缓存及投机采样等优化技术,实现更高效的实际运行效果。
谷歌推出TurboQuant技术,通过压缩KV缓存,有效解决大语言模型推理中的内存瓶颈问题,可在不降低精度的前提下大幅减少内存占用,提升处理长文本和复杂任务的效率。
腾讯微信AI团队推出新型扩散语言模型WeDLM,旨在提升文本生成效率。该模型结合扩散模型与因果注意力机制,通过拓扑重排技术兼容KV缓存,解决了传统扩散模型因双向注意力导致的推理效率问题,突破了GPT等大模型在并行推理上的限制。
Openai
$0.35
输入tokens/百万
$2.8
输出tokens/百万
400
上下文长度
Moonshot
$2
$10
8
$30
131
sudeshmu
基于LLaMA架构并采用MoR(混合递归)技术的3.6亿参数语言模型,在FineWeb-Edu去重数据集上微调,通过动态路由机制和递归式KV缓存实现高效的文本生成能力。
RedHatAI
Meta-Llama-3-8B-Instruct模型经过FP8权重和激活值的逐张量量化,适用于vLLM >= 0.5.0进行推理。该模型检查点还包含FP8量化KV缓存的逐张量缩放参数。