腾讯混元发布语音识别模型Hy ASR3.0preview,首次将大语言模型Hy3的语义理解融入识别,实现从逐字转写向“理解语境、一键直出”跨越。在开源评测集上,中文普通话、英语、粤语词错误率分别为3.34%、2.62%、3.12%,整体约3%,多维度表现亮眼。
阿里发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,专注精准识别专业词汇。模型优化上下文一致性、行业词与热词定制,支持语音润色并直接输出结构化文本。团队构建了覆盖医疗、IT、股票等领域的多行业高质量词库,评测显示行业词识别效果显著提升。
医疗人工智能加速迈向专科化与安全化。中文医疗大模型评测基准MedBench近日升级至5.0版本,由上海人工智能实验室联合广州实验室钟南山院士团队、复旦大学附属中山医院葛均波院士团队等顶尖力量共同构建,致力打造更专业可靠的中文医疗AI评测体系。
OpenAI前CTO穆拉蒂的初创公司发布首款模型Inkling,其架构与数据大量借鉴DeepSeek和月之暗面等中国模型,却在评测中表现落后且价格更高。这家中美角色“互换”的公司估值竟高达120亿美元,反差巨大。
大型语言模型 (LLM) 性能评测的众包开放平台
Openai
$2.8
输入tokens/百万
$11.2
输出tokens/百万
1k
上下文长度
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
$6
$24
Baidu
128
MarkoRadojcic
YugoGPT-Florida 是一个基于塞尔维亚语的大语言模型,在多个评测基准中表现优异。
openbmb
MiniCPM是面壁智能与清华大学自然语言处理实验室联合研发的端侧大语言模型系列,核心模型仅含12亿非词嵌入参数,在多项评测中超越更大规模的开源模型。
CausalLM
CausalLM/14B-DPO-α是一个基于因果语言模型的大规模语言模型,支持中英文文本生成任务,在MT-Bench评测中表现优异。
Skywork
天工 Skywork-13B 是在高质量清洗过滤的 3.2 万亿个多语言和代码数据上预训练的大语言模型,在多种评测和基准测试中展现出优异效果。它兼顾中文和英文表现,代码能力也有保障,为自然语言处理领域提供了强大支持。
xverse
XVERSE-7B-Chat是由深圳元象科技自主研发的70亿参数多语言大语言模型,基于XVERSE-7B模型对齐而来。该模型支持8K上下文长度,能够满足多轮对话、知识问答与摘要等需求,在多项评测中表现优异。