英美AI安全機構聯合評測Kimi K3:在漏洞利用和模擬網絡攻擊能力上遜於美國前沿模型,但優於智譜GLM-5.2,成爲開放權重模型中的新標杆。
國產大模型密集爆發,拉近與美國旗艦閉源AI差距。千問、Kimi之後,智譜創始人唐傑親口透露GLM-5.5將迎“史詩級pl”升級,國產AI追趕步伐加快。
Hugging Face遭黑客AI攻擊後,先用美國商業大模型API分析1.7萬條日誌,卻因無法區分攻防人員遭安全機制誤判拒阻;隨後轉向自身基礎設施部署中國開源模型GLM5.2,成功完成海量日誌取證。事件突顯不同AI模型在安全場景下的表現差異。
智譜創始人唐傑發內部信,宣佈啓動“摸高”計劃,未來兩年將戰略投入長程任務、自治智能體系統、完全自我訓練及極致安全治理四大核心引擎,全力衝擊下一代通用人工智能(AGI)。同期,智譜發佈了開源模型GLM-5.2,支持百萬token上下文並在長程任務上保持領先,以MIT協議全量開源。
GLM-5是智譜AI第五代大模型,7450億參數,具多項前沿能力,現已開放。
GLM-PC是基於CogAgent視覺語言大模型構建的電腦智能體,旨在提升電腦使用體驗。
為GPT/GLM等LLM大語言模型提供實用化交互接口
GLM-4和CogView3,智能大模型與圖像生成AI
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$6
$24
$4
$16
$2
$20
Baidu
128
Bytedance
$1.2
$3.6
4
bartowski
這是ArliAI的GLM-4.5-Air-Derestricted模型的GGUF量化版本,使用llama.cpp和imatrix技術進行優化量化處理,提供多種量化級別選擇,適用於不同硬件配置和性能需求。
nightmedia
GLM-4.5-Air-REAP-82B-A12B-mxfp4-mlx是基於GLM-4.5-Air模型通過REAP方法壓縮的82B參數大語言模型,採用MXFP4量化格式,專為Mac設備優化,在保持核心任務性能的同時顯著減少內存佔用。
mratsim
GLM-4.5-Iceblink-v2-106B-A12B-FP8是基於GLM-4.5-Iceblink-v2-106B-A12B模型,採用最先進的混合專家量化方法進行FP8量化的版本。該模型專門針對支持硬件FP8的Ada、Hopper或Blackwell系列GPU優化,在保持高質量輸出的同時顯著提升推理效率。
這是一個基於REAP方法對MiniMax-M2中40%專家進行均勻剪枝得到的139B參數大語言模型,採用GLM架構和專家混合(MoE)技術,通過llama.cpp進行多種量化處理,適用於文本生成任務。
cyankiwi
GLM-4.6 AWQ - INT4是GLM-4.6模型的4位量化版本,採用AWQ量化方法,在保持模型性能的同時顯著減少了存儲和計算資源需求。該模型支持200K上下文長度,在編碼、推理和智能體任務方面相比GLM-4.5有顯著提升。
Wwayu
這是一個基於GLM-4.6架構的混合專家模型,使用REAP方法對專家進行了40%的均勻剪枝,參數量為218B,並轉換為MLX格式的3位量化版本,適用於蘋果芯片設備高效運行。
noctrex
這是GLM-4.5-Air-REAP-82B-A12B模型的MXFP4_MOE量化版本,專門針對文本生成任務進行了優化。該模型基於cerebras的GLM-4.5-Air-REAP-82B-A12B基礎模型,通過MXFP4混合專家量化技術實現,在保持性能的同時顯著減小模型體積和推理成本。
gghfez
這是GLM-4.6-REAP-266B-A32B模型的Q4_K_M gguf量化版本,基於transformers庫構建,具有文本生成能力。該模型使用了REAP(路由加權專家激活剪枝)方法,能夠選擇性地移除冗餘專家,同時保留路由器對剩餘專家的獨立控制。
這是GLM-4.6-REAP-266B-A32B模型的Q2_K_M gguf量化版本,基於REAP(路由器加權專家激活剪枝)方法創建,能夠在保留路由器對剩餘專家獨立控制的同時,選擇性移除冗餘專家,實現高效的文本生成。
manasmisra
該模型是基於GLM-4.5-Air使用REAP方法進行25%均勻剪枝後的專家混合模型,已轉換為MLX格式的4位量化版本,適用於蘋果芯片設備的高效推理。
Daemontatox
Zirel-3是基於GLM-4.5-Air-REAP-82B-A12B的特定微調模型,採用REAP(路由加權專家激活剪枝)技術壓縮的820億參數混合專家模型,在保持高性能的同時顯著減少模型體積。
基於GLM-4.5-Air模型使用REAP方法進行25%專家剪枝的優化版本,轉換為MLX格式以便在Apple Silicon設備上高效運行
本項目為 GLM-4.6 模型提供了創意寫作控制向量,通過控制向量技術調節模型在特定維度上的表現,如誠實度與馬基雅維利主義傾向、溝通風格等。
mlx-community
這是一個基於GLM-4.6模型轉換的MLX格式版本,採用8位量化技術,分組大小為32,專為蘋果芯片優化,提供高效的文本生成功能。
anikifoss
GLM-4.6的高質量量化版本,採用先進的量化技術在不使用imatrix的情況下實現,保持了良好的模型性能和兼容性,適用於對話等多種應用場景。
bullpoint
GLM-4.6-AWQ是對智譜AI的GLM-4.6(357B MoE)進行高性能AWQ量化的模型,專為vLLM推理進行了優化,能有效提升生產部署的吞吐量。該模型採用4位量化技術,在保持高精度的同時顯著減少顯存佔用。
QuantTrio
GLM-4.6-GPTQ-Int4-Int8Mix是基於zai-org/GLM-4.6基礎模型的量化版本,在文本生成任務上表現出色。該模型通過GPTQ量化技術實現了模型大小的優化,同時保持了良好的性能表現。
DevQuasar
本項目提供了zai-org/GLM-4.6的量化版本,旨在讓知識為每個人所用。這是一個文本生成模型,基於原始GLM-4.6模型進行優化,提供更高效的推理性能。
GLM-4.6-AWQ是基於zai-org/GLM-4.6基礎模型的量化版本,具備高效的文本生成能力。相比GLM-4.5,該模型在上下文窗口、編碼性能、推理能力和智能體功能等方面都有顯著提升。
Downtown-Case
GLM 4.6是一款專為128GB內存+單GPU配置優化的量化模型,採用IQ_K量化方式,相比主流llama.cpp在相同大小下提供更好的質量和性能。該模型需要配合ik_llama.cpp使用,在128GB雙通道DDR5內存、單CCD Ryzen 7000處理器+單張3090顯卡配置下,文本生成速度可達每秒約6.8個token。
基於GLM-4.5V模型的MCP服務器,提供智能圖片分析功能,支持從文件路徑或剪貼板獲取圖片,專門用於代碼內容提取、架構分析、錯誤檢測和文檔生成。
GLM-4.6 MCP服務器是一個企業級架構諮詢協議橋接服務,通過模型上下文協議連接Claude 4.5 Sonnet和GLM-4.6,提供系統設計、可擴展性模式和技術決策支持,支持代碼架構分析、系統架構設計和決策審查等功能。
這是一個讓本地AI獲取遠程AI指導的MCP服務器,支持多輪對話、文件上傳和智能對話管理,特別針對GLM-4.7模型優化。