螞蟻集團百靈大模型系列更新,Ling-2.6-flash正式開放。該模型總參數104B,激活參數7.4B,提供BF16、FP8、INT4等多精度版本,適配不同硬件環境並降低部署門檻。此前以“Elephant Alpha”匿名在OpenRouter平臺測試。
國產AI芯片與大模型協同優化取得重要進展。摩爾線程與硅基流動基於國產GPU MTT S5000,成功完成對千億參數大模型DeepSeek V3 671B的深度適配。通過應用FP8低精度推理技術,實現單卡預填充吞吐量超4000 tokens/秒,解碼吞吐量超1000 tokens/秒,推理速度已接近國際主流高端AI加速器水平。
螞蟻集團開源萬億參數大模型Ling-1T,採用FP8低精度訓練,爲當前最大基座模型。該模型由"百靈"團隊開發,屬於Ling2.0家族,包含Ling、Ring、Ming三大系列。其中Ling系列專注通用任務,強調速度與效率優勢。
智譜發佈GLM-4.6模型,採用寒武紀國產芯片,首次實現FP8+Int4混合量化部署。該技術突破在保持模型精度的同時顯著降低推理成本,爲國產芯片支持大模型本地化運行開闢新路徑。
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$6
$24
256
$4
$16
Baidu
128
Bytedance
$1.2
$3.6
4
$2
Moonshot
$0.8
kyr0
這是一個專為蘋果硅芯片設備優化的自動語音識別模型,通過轉換為MLX框架並量化為FP8格式,實現在蘋果設備上的快速端上語音轉錄。該模型針對逐字精度進行微調,特別適用於需要高精度轉錄的場景。
ibm-granite
Granite 4.0 H-Small (FP8) 是IBM開發的Granite系列語言模型的小型FP8量化版本,專為提供專業、準確和安全的回覆而設計。該模型採用FP8精度格式,在保持性能的同時優化了推理效率。
nvidia
NVIDIA Qwen3-235B-A22B FP8模型是阿里雲Qwen3-235B-A22B模型的量化版本,採用優化的Transformer架構,是一個自迴歸語言模型。該模型通過FP8量化技術顯著減少了磁盤空間和GPU內存需求,同時保持較高的推理精度,適用於各種AI應用場景。
nm-testing
QwQ-32B的FP8量化版本,通過動態量化技術減少50%存儲和內存需求,同時保持99.75%的原模型精度
RedHatAI
QwQ-32B的FP8量化版本,通過動態量化技術減少50%存儲和內存需求,同時保持99.75%的原始模型精度
lllyasviel
Omost 的 phi-3-mini 模型,具有 128k 上下文長度,採用 fp8 精度。
FriendliAI
由FriendliAI量化為FP8精度的Mistral-7B-Instruct-v0.2模型,在保持高精度的同時顯著提升推理效率。