幻方量化、DeepSeek-V3を発表:GPT-4に匹敵する性能、大幅に低減された訓練コスト
幻方量化は12月26日夜、次世代大規模言語モデルDeepSeek-V3を発表し、驚異的な技術的ブレークスルーを示しました。MoE(Mixture of Experts)アーキテクチャを採用したこのモデルは、トップレベルのクローズドソースモデルに匹敵する性能を示すだけでなく、低コストで高効率である点が業界の注目を集めています。主要なパラメーターとしては、DeepSeek-V3は6710億パラメーター(活性化パラメーター370億)を備え、14.8兆トークンのデータ規模で事前学習が行われました。前世代モデルと比較して、新モデルの生成速度は3倍に向上しています。