タートルベンチマークは、『タートルスープ』ゲームをベースにした、不正行為が不可能な新しいベンチマークです。大規模言語モデル(LLM)の論理的推論能力とコンテキスト理解能力の評価に重点を置いています。背景知識を必要としないことで客観的で公平なテスト結果を提供し、定量化可能な結果を持ち、リアルユーザーが作成した問題を使用することでモデルの「ゲーム化」を防ぎます。