OpenAIのo3モデル、テスト結果に疑問の声 実際の性能は宣伝よりはるかに低い
先日、OpenAIが発表したo3人工知能モデルのベンチマークテスト結果が、大きな論争を呼んでいます。OpenAIは昨年12月、o3モデルが非常に難しいFrontierMath数学問題集で4分の1以上の問題に正答すると自信満々に発表していましたが、最近の独立したテスト結果とは大きく食い違っています。Epoch研究所がo3モデルについて独立テストを実施したところ、その得点はわずか10%で、発表された内容をはるかに下回ることが判明しました。