AI大規模言語モデルの幻覚ランキング:Gemini 2.0 Flashが幻覚率最低
最近、Vectaraは「幻覚ランキング」と題するレポートを発表し、様々な大規模言語モデル(LLM)が短い文書を要約する際に生じる幻覚を比較しました。このランキングは、VectaraのHughes幻覚評価モデル(HHEM-2.1)を利用しており、このモデルは定期的に更新され、要約に虚偽の情報が含まれる頻度を評価することを目的としています。最新のデータによると、このレポートは、いくつかの一般的なモデルの幻覚率、事実の一貫性率、応答率、平均要約の長さなどの重要な指標を示しています。