随着人工智能技术爆发式增长,作为大模型计量与结算核心单位的Token(词元)使用量激增。截至2026年3月,我国日均词元调用量突破140万亿次,较2024年初增长千倍,较2025年底三个月内增幅超四成,显示国内大模型应用正极速扩张。
面壁智能联合清华大学及OpenBMB开源社区发布MiniCPM-V 4.6端侧多模态大模型,仅1.3B参数、6G内存即可流畅运行,性能卓越,在内存涨价背景下实现“低内存、极速跑”,为AI应用拓展新可能。
Google DeepMind发布Gemini 3.1 Flash-Lite预览版,作为该系列速度最快、性价比最高的模型。它在保持每秒超360个token的极速输出和5.1秒平均响应时间的同时,智能水平显著提升。据评测,其得分较前代提高12分至34分,并在Arena.ai排行榜中以1432的Elo分数展现强大竞争力。
阶跃星辰发布开源基座模型Step3.5Flash,专为智能体场景设计,具备强大推理能力和极速响应,旨在成为更聪明、稳定且成本可控的“Agent大脑”。该轻量化模型在推理速度上表现突出,最高可达350TPS,尤其在代码任务中优势显著。
聚合全网优质 AI 大模型,提供极速、高效的 AI 解决方案。
Inception Labs 推出新一代扩散式大语言模型,提供极速、高效和高质量的语言生成能力。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
leeminwaan
这是Qwen3-MOE-4x0.6B-2.4B-reasoning-v1-full模型的GGUF量化版本,专为在消费级硬件上高效运行而设计。提供多种量化级别,从极速的Q2_K到高质量的Q8_0,用户可根据硬件条件和质量需求灵活选择。
erax-ai
专为越南语优化的Whisper Large-v3 Turbo语音识别模型,支持多语言,具有极速响应和高准确度
Felladrin
专为极速重排序设计的模型,基于JinaBERT架构,支持长文本序列处理(最高8,192令牌)。
NeurixYUFI
极速LoRA模型,采用不同数据集训练方法并修复潜在偏移点问题,适合快速生成照片风格图像。
Infinigence
Megrez-3B是由无问芯穹完全自主训练的大语言模型,通过软硬协同理念,打造出极速推理、小巧精悍、极易上手的端侧智能解决方案。该模型将14B模型的能力压缩进3B大小的模型中,在主流榜单上取得了优异的性能表现。
sd-community
SDXL极速版是由Fluently项目联合开发的快速文本生成图像模型,在保持较高质量的同时实现快速生成。
briaai
BRIA 2.3极速版是BRIA 2.3的LCM加速版本,代表2.X系列中质量与速度的最佳平衡。该模型基于合法数据专项训练,将技术创新与伦理责任、法律保障完美结合。
ByteDance
极速文本生成视频模型,生成速度比原版AnimateDiff快十倍以上
fluently
Fluently V4.0-LCM 是一个全能任务模型,通过融合多模型和LCM技术实现极速图像生成,具备精准解剖结构和高艺术表现力。
SDXL-闪电是一款极速文本生成图像模型,仅需几步即可生成高质量的1024像素图像
thibaud
结合SDXL极速版与直接偏好优化(DPO)技术的文本生成图像模型,支持快速高质量图像生成