微博推出开源大模型Vibe Thinker,仅15亿参数却在数学竞赛基准测试中击败6710亿参数的DeepSeek R1,准确率更高且训练成本仅7800美元。采用轻量化MoE架构与知识蒸馏技术,仅需5GB数学语料即可微调,支持Hugging Face下载和商用。该模型在AIME等国际数学竞赛中表现优异。
微软开源140亿参数rStar2-Agent模型,通过智能体强化学习技术实现突破。该模型在数学推理基准测试中超越6710亿参数的DeepSeek-R1,核心创新在于采用智能体交互机制替代传统思维链方法,能自主规划推理、调用Python代码验证并动态调整步骤,有效避免推理错误。
微软开源rStar2-Agent AI推理模型,仅140亿参数却在AIME24数学测试中取得80.6%准确率,超越6710亿参数的DeepSeek-R1。这一突破重新定义模型规模与性能关系,展现小参数模型的高效潜力。
DeepSeek关联公司公开大语言模型部署专利,创新采用分布式架构:将预填充和解码阶段分别部署在高性能计算和大内存机器上。该方法能均衡负载、减少计算闲置,显著降低延迟并提升吞吐量。专利突显系统扩展性和容错性优化,其MoE语言模型DeepSeek-V3拥有6710亿参数,单token激活370亿参数,将推动AI技术在各行业的应用落地。核心突破在于通过硬件资源合理配置实现高效智能部署。
Alibaba
$4
Input tokens/M
$16
Output tokens/M
1k
Context Length
$1
$10
256
$6
$24
$2
$20
-
Moonshot
Baidu
32
Xai
$1.4
$10.5
Tencent
Deepseek
$12
128
Openai
$0.4
$0.75
64
$0.63
$3.15
131
24
richardyoung
这是一个高性能的4位量化版本的Kimi K2 Instruct模型,专为使用MLX框架在Apple Silicon(M1/M2/M3/M4)Mac上运行而优化。该模型拥有6710亿参数,支持128K上下文窗口,在质量和效率之间实现了出色的平衡,是大多数实际部署的理想选择。
deepcogito
Cogito v2.1是经过指令微调的6710亿参数混合专家生成式模型,采用开放许可发布,支持商业用途。该模型能有效解决复杂的推理和指令遵循问题,支持30多种语言和128k上下文长度。