2026骁龙峰会上,高通与PrismML在骁龙AR1 Gen 1智能眼镜平台本地运行20亿参数1-bit量化Bonsai视觉模型,实现离线识图问答。该模型基于Bonsai 1.7B构建,精度压缩至1-bit,内存占用仅为4-bit模型四分之一,同等内存可容纳约4倍参数,显著降低存储与推理资源需求。
Xai
$1.4
Input tokens/M
$3.5
Output tokens/M
2k
Context Length
Openai
$0.4
-
128
Huawei
32
Chatglm
Tencent
$0.5
$2
224
$1
$3
4
Bytedance
Deepseek
8
Alibaba
$6
$18
256
Baidu
$0.8
$3.2
01-ai
$0.99
legraphista
这是 DeepSeek-Coder-V2-Instruct 模型的 GGUF 量化版本,使用 llama.cpp 的 IMatrix 技术进行优化量化。该模型专门针对代码生成和编程任务进行了优化,提供了从 1-bit 到 8-bit 的多种量化选项,适用于不同硬件环境下的高效推理。