AMD發佈vLLM-ATOM插件,旨在不改變現有工作流的前提下,充分挖掘硬件潛力,爲DeepSeek-R1、Kimi-K2等主流大語言模型推理顯著提速。vLLM本身是優化高併發場景吞吐量與顯存利用率的開源框架,專注請求調度和緩存管理,ATOM插件則進一步強化了這一能力。
AMD發佈vLLM-ATOM插件,專爲大語言模型部署優化,在不改變現有工作流下,顯著提升DeepSeek-R1、Kimi-K2等國產大模型在AMD硬件上的推理性能。該插件針對Instinct系列GPU定製,利用vLLM框架的高顯存利用率優勢,讓開發者以低學習成本實現技術遷移,獲得性能平滑升級。