大模型服务主战场正转向检索增强问答、多文档摘要和长程Agent。请求prompt由几十到上百个语义独立的片段(检索文档、技能说明、记忆、历史轮次)拼接,形成数万至数十万token的超长上下文,预填充阶段占据主导算力开销,成为服务商最突出的成本来源,且引发更棘手的难题。