Mistral-Nemo-Base-2407は、Mistral AIとNVIDIAが共同でトレーニングした、120億パラメータの大規模事前学習済みテキスト生成モデルです。多言語およびコードデータでトレーニングされており、同規模またはそれ以下の既存モデルを大幅に上回ります。主な特徴として、Apache 2.0ライセンスによる公開、事前学習済みバージョンと指示追従バージョンの両方をサポート、128kコンテキストウィンドウでのトレーニング、多言語およびコードデータのサポート、Mistral 7Bの後継モデルなどが挙げられます。モデルアーキテクチャは、40層、5120次元、128ヘッド次元、14364隠れ次元、32ヘッド数、8個のkvヘッド(GQA)、約128kの語彙、回転埋め込み(theta=1M)です。HellaSwag、Winogrande、OpenBookQAなどの複数のベンチマークテストで優れた性能を示しています。