国产大模型密集爆发,拉近与美国旗舰闭源AI差距。千问、Kimi之后,智谱创始人唐杰亲口透露GLM-5.5将迎“史诗级pl”升级,国产AI追赶步伐加快。
美国AI服务成本飙升,逼使Coinbase等美企转用中国开源模型降本。Coinbase将智谱GLM5.2、月之暗面Kimi K2.7设为工程师默认工具,在不限用量的同时大幅压缩AI开支。降本已成核心驱动力。
Coinbase转向中国AI模型降本增效。通过采用GLM5.2和Kimi2.7,公司AI支出减半,代币用量大增。新自动路由系统智能分发任务,将缓存命中率从5%大幅提升,同时开发者仍保留模型选择自由。
百度智能云千帆大模型平台于2026年6月25日终止“Coding Plan”AI编码订阅服务的续费,该产品上线仅四个月。其曾主打多模型驱动,支持一键切换GLM-4.7等主流模型,并深度兼容Cursor等编程工具。此次停续标志着重大战略转型。
GLM-5是智谱AI第五代大模型,7450亿参数,具多项前沿能力,现已开放。
GLM-PC是基于CogAgent视觉语言大模型构建的电脑智能体,旨在提升电脑使用体验。
为GPT/GLM等LLM大语言模型提供实用化交互接口
GLM-4和CogView3,智能大模型与图像生成AI
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
$8
$240
52
Bytedance
$1.2
$3.6
4
nightmedia
GLM-4.5-Air-REAP-82B-A12B-mxfp4-mlx是基于GLM-4.5-Air模型通过REAP方法压缩的82B参数大语言模型,采用MXFP4量化格式,专为Mac设备优化,在保持核心任务性能的同时显著减少内存占用。
bartowski
这是一个基于REAP方法对MiniMax-M2中40%专家进行均匀剪枝得到的139B参数大语言模型,采用GLM架构和专家混合(MoE)技术,通过llama.cpp进行多种量化处理,适用于文本生成任务。
mlx-community
这是一个基于GLM-4.6模型转换的MLX格式版本,采用8位量化技术,分组大小为32,专为苹果芯片优化,提供高效的文本生成功能。
QuantTrio
GLM-4.6-GPTQ-Int4-Int8Mix是基于zai-org/GLM-4.6基础模型的量化版本,在文本生成任务上表现出色。该模型通过GPTQ量化技术实现了模型大小的优化,同时保持了良好的性能表现。
Downtown-Case
GLM 4.6是一款专为128GB内存+单GPU配置优化的量化模型,采用IQ_K量化方式,相比主流llama.cpp在相同大小下提供更好的质量和性能。该模型需要配合ik_llama.cpp使用,在128GB双通道DDR5内存、单CCD Ryzen 7000处理器+单张3090显卡配置下,文本生成速度可达每秒约6.8个token。
unsloth
GLM-4.6是智谱AI开发的新一代大语言模型,相比GLM-4.5在上下文处理、编码能力和推理性能方面有显著提升。该模型支持200K上下文长度,在多个公开基准测试中表现出色,特别在代码生成、推理和代理任务方面具有竞争优势。
这是 GLM-4.6 模型的 5位量化版本,使用 mlx-lm 工具转换,专为 Apple Silicon 设备优化,提供高效的大语言模型推理能力。
AIgotahole
这是一个基于GLM架构的9B参数大语言模型,专门针对推理任务进行了优化,采用GGUF格式便于在llama.cpp中部署使用。模型经过消除处理,具有无审查特性。
mrtoots
基于unsloth/GLM-4.5模型转换的MLX格式3位量化版本,专为Apple Silicon优化的高效大语言模型
基于智谱AI GLM-4.5-Air模型转换的3位深度量化权重(Deep Weight Quantization)版本,专为MLX框架优化,在保持较高性能的同时显著减少模型大小和推理资源需求
GLM-4.5-Air-AWQ-FP16Mix是基于GLM-4.5-Air模型进行量化处理后的高效文本生成模型,采用AWQ和FP16混合量化技术,适用于多GPU环境的大规模语言模型推理场景。
基于GLM-4.5-Air模型使用mlx-lm 0.26.1版本转换的3位深度权重量化版本,专为Apple Silicon芯片优化,提供高效的大语言模型推理能力
GLM-4.5-Air-q5-hi-mlx是一个基于zai-org/GLM-4.5-Air转换的文本生成模型,采用特定的量化方式,在性能和模型大小之间取得平衡,可通过mlx库使用。
GLM-4.5-Air-6bit是基于智谱AI的GLM-4.5-Air模型转换而来的6位量化版本,专为MLX框架优化,提供高效的大语言模型推理能力。
Remnant-GLM4-32B 是一个基于 GLM4 架构的 32B 参数大语言模型,支持角色扮演和对话式交互,特别适合蝾螈相关的应用场景。
Dans-DiscountModels
基于THUDM/GLM-4-32B-Base-0414模型在Dans-DiscountModels/pretokenization-test-4数据集上微调的大语言模型
DevQuasar
GLM-4-32B-0414-abliterated 是一个基于 GLM 架构的大规模语言模型,参数规模为 32B,适用于文本生成任务。
GLM-4-32B-0414是拥有320亿参数的大语言模型,性能媲美GPT-4o和DeepSeek-V3,支持中文和英语,具备卓越的代码生成、函数调用和复杂任务处理能力。
该模型是从THUDM/GLM-4-32B-0414转换而来的8位量化MLX格式大语言模型,支持中英文文本生成任务。
GLM-4-9B-0414-abliterated 是一个基于 GLM 架构的 9B 参数规模的大型语言模型,适用于文本生成任务。