OpenAI前CTO穆拉蒂的初创公司发布首款模型Inkling,其架构与数据大量借鉴DeepSeek和月之暗面等中国模型,却在评测中表现落后且价格更高。这家中美角色“互换”的公司估值竟高达120亿美元,反差巨大。
微软正评估将月之暗面开发的Kimi K3开源模型引入Copilot服务,以大幅降低AI运营成本。作为全球参数规模最大的开源模型,Kimi K3在编程等多项评测中性能媲美顶尖模型,有望替代此前主要依赖的OpenAI与Anthropic技术,重塑底层架构。微软内部测算显示,此举每年最高可节省6亿美元。
商汤发布并开源“日日新SenseNova-Vision”视觉大模型,核心是将视觉能力原生融入通用基础模型,打破传统将检测、分割等专家模型打包的割裂模式。该模型以单模型在多项评测中实现了四大领域的性能碾压,标志着视觉任务向统一原生架构的关键升级。
百川智能与清华团队发布医疗大模型Baichuan-M4,在权威HealthBench评测中包揽三项子榜单第一,表现超越GPT-5.5。其核心突破在于彻底变革交互模式,实现更贴近临床的智能诊疗能力。
大型语言模型 (LLM) 性能评测的众包开放平台
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
MarkoRadojcic
YugoGPT-Florida 是一个基于塞尔维亚语的大语言模型,在多个评测基准中表现优异。
openbmb
MiniCPM是面壁智能与清华大学自然语言处理实验室联合研发的端侧大语言模型系列,核心模型仅含12亿非词嵌入参数,在多项评测中超越更大规模的开源模型。
CausalLM
CausalLM/14B-DPO-α是一个基于因果语言模型的大规模语言模型,支持中英文文本生成任务,在MT-Bench评测中表现优异。
Skywork
天工 Skywork-13B 是在高质量清洗过滤的 3.2 万亿个多语言和代码数据上预训练的大语言模型,在多种评测和基准测试中展现出优异效果。它兼顾中文和英文表现,代码能力也有保障,为自然语言处理领域提供了强大支持。
xverse
XVERSE-7B-Chat是由深圳元象科技自主研发的70亿参数多语言大语言模型,基于XVERSE-7B模型对齐而来。该模型支持8K上下文长度,能够满足多轮对话、知识问答与摘要等需求,在多项评测中表现优异。