清華大學聯合面壁智能在《自然・機器智能》發文,提出“能力密度”指標,強調模型性能應注重單位參數的有效智能而非規模。研究發現,能力密度約每3.5個月翻倍,同等任務所需參數可指數級減少。高密度需數據、算力、算法協同設計,而非簡單壓縮。面壁智能據此推出0.5B-2B系列模型。
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$6
$24
$4
$16
$2
$20
Baidu
128
Bytedance
$1.2
$3.6
4
brucethemoose
這是一個基於Yi-34B-200K基礎模型,通過DARE Ties方法合併多個同源模型的高密度合併模型,具有200K長上下文處理能力。