MInference 1.0 é um método de computação esparsa projetado para acelerar a fase de preenchimento do processamento de sequências longas. Ele implementa um método de atenção esparsa dinâmica para modelos de linguagem grandes de longo contexto (LLMs), identificando três padrões distintos na matriz de atenção de longo contexto. Isso acelera a fase de preenchimento de prompts de 1M tokens, mantendo as capacidades dos LLMs, especialmente a capacidade de recuperação.