国产大模型参数规模持续攀升,Qwen3.8Max、Kimi K3已分别达2.4万亿和2.8万亿。字节跳动计划训练超5万亿参数模型,有望成为国内最大,但项目尚处早期,未必发布。5万亿参数被视为GPT-5.6或Opus5级别,标志着能力进一步跃升。
据《晚点》报道,字节跳动正讨论训练参数超5万亿的大语言模型,若落地将超越阿里通义千问(2.4万亿)和月之暗面Kimi K3(2.8万亿),成为国内最大。项目由Seed Foundation负责人项亮主导,尚处早期,涉及预训练数据,发布时间未定。
8月5日,Liquid AI发布专为智能体工作流设计的26亿参数端侧模型LFM2.5-2.6B,可完全本地运行于手机等终端,提供低成本、低延迟与隐私保护方案。其基于34万亿词元预训练,词表容量128K,后训练融合监督微调、教师特化与多领域策略。
月之暗面于7月28日开源2.8万亿参数大模型Kimi K3,支持100万token上下文与视觉理解,采用KDA混合注意力机制。同日,摩尔线程宣布基于MTT S5000智算卡完成对其的快速适配与稳定运行,实现国产算力与开源大模型的协同突破。
Google
$0.49
输入tokens/百万
$2.1
输出tokens/百万
1k
上下文长度
$0.7
$2.8
$17.5
Alibaba
-
$2
$20
$6
$24
256
$8
$240
52
Moonshot
$4
$16
Bytedance
Tencent
$1
32
Baidu
Openai
$0.4
128
$0.75
64
almanach
Gaperon-1125-24B是一个拥有240亿参数的双语(法语-英语)语言模型,经过约2万亿标记的训练,能够熟练处理法语、英语和编码任务。该模型采用OLMo-2架构,旨在实现大规模、高质量文本生成和出色任务性能之间的最佳平衡。
inclusionAI
LLaDA-MoE是基于扩散原理构建的新型混合专家语言模型,是首个开源的MoE扩散大语言模型,在约20万亿个标记上从头预训练,总参数70亿,推理时仅激活14亿参数,在代码生成和数学推理等任务中表现卓越。
microsoft
微软研究院开发的首个开源、原生1比特的大语言模型,参数规模达20亿,在4万亿token的语料库上训练而成。
微软研究院开发的首个开源20亿参数规模原生1比特大语言模型,在4万亿token语料上训练完成,证明了原生1比特大语言模型在保持与同规模全精度开源模型相当性能的同时,能显著提升计算效率。
由微软研究院开发的开源原生1位大语言模型,参数规模达20亿,在4万亿token的语料库上训练而成,显著提升计算效率。
openGPT-X
Teuken 7B-base-v0.6是一个拥有70亿参数的多语言大语言模型,在OpenGPT-X研究项目中基于6万亿个标记进行了预训练。该模型专为欧盟24种官方语言的私有、非商业、研究和教育用途设计,能在多语言环境中提供稳定的性能。
CofeAI
Tele-FLM是一个拥有520亿参数的开源多语言大语言模型,基于仅解码器的Transformer架构构建,在约2万亿个标记上进行训练。具备稳定高效的预训练范式和强大的事实判断能力,在同等规模下表现卓越,有时甚至超越更大的模型。
LumiOpen
维京7B是一个70亿参数的Transformer模型,专注于处理芬兰语、北欧语言及编程代码,基于2万亿token训练。
duoqi
Nanbeige-16B是由南贝格大模型实验室开发的160亿参数语言模型,采用2.5万亿token进行预训练,支持中文和英文。
ahxt
LiteLlama是Meta AI的LLaMa 2精简版,仅含4.6亿参数并使用1万亿token训练的开源语言模型
TheBloke
TinyLlama 1.1B Chat v1.0 的 GPTQ 量化版本,是一个紧凑的 11 亿参数语言模型,采用与 Llama 2 相同的架构。该模型经过 3 万亿标记的预训练,支持对话任务,并通过 GPTQ 量化技术显著减少内存占用,适合在资源有限的设备上运行。
TinyLlama
TinyLlama是一个轻量级的大语言模型,在3万亿个标记上预训练,仅具有11亿参数。该模型采用与Llama 2相同的架构和分词器,能够无缝集成到基于Llama的开源项目中,适合计算和内存要求较低的应用场景。
sharpbai
Llama 2是Meta发布的70亿参数预训练生成式文本模型,采用优化的Transformer架构,在2万亿标记数据上训练。该版本为Hugging Face格式的7B预训练模型,支持英语文本生成任务。