Mistral-Nemo-Base-2407 é um modelo de linguagem grande pré-treinado para geração de texto, com 12 bilhões de parâmetros, treinado em conjunto pela Mistral AI e NVIDIA. Treinado em dados multilíngues e de código, supera significativamente modelos existentes de tamanho semelhante ou menor. Seus principais recursos incluem: licença Apache 2.0, versões pré-treinadas e com instruções, janela de contexto de 128k, suporte para diversos idiomas e códigos, e serve como alternativa ao Mistral 7B. A arquitetura do modelo inclui 40 camadas, 5120 dimensões, 128 cabeças, 14364 dimensões ocultas, 32 cabeças, 8 cabeças kv (GQA), vocabulário de aproximadamente 128k e embeddings rotacionais (theta=1M). O modelo apresentou excelente desempenho em vários benchmarks, como HellaSwag, Winogrande e OpenBookQA.