巴西里约热内卢市政府推出的开源大模型Rio 3.5 397B在AI圈引发关注,宣称在多项基准测试中达到SOTA。但发布不足24小时,Nex-AGI联盟通过数学分析指出该模型实为套壳缝合模型,核心权重被起底,引发行业争议。
美团龙猫大模型团队开源商用级数字人视频生成模型LongCat-Video-Avatar1.5,实现从开源SOTA到商业应用的跨越。该版本在唇形同步、物理合理性、长视频稳定性、多人互动及高效推理等核心维度显著提升,旨在解决传统数字人视频痛点,推动数字人向千人千面的真实场景应用。
网易有道发布“子曰”大模型4.0版本,全面升级至全模态时代,支持文本、图片、音频融合交互。核心的多模态模型和语音合成(TTS)模型正式开源,翻译模型经技术重构,翻译质量与效率显著提升。多模态模型在视觉和数理领域达到SOTA水平,纯文本数理难题性能行业领先。
小米Kaldi团队开源OmniVoice模型,支持超600种语言,在中文和多语言TTS基准测试中多项指标达到SOTA。中文WER低至0.84%,多语言性能超越主流商用模型,实现语音合成新突破。
B站开源的SOTA动画视频生成模型,支持多种二次元风格视频一键生成。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$2
$20
$6
$24
XiaomiMiMo
MiMo Audio是一款基于大规模预训练的音频语言模型,在语音智能和音频理解基准测试中取得了开源模型的SOTA性能。该模型展现出强大的少样本学习能力,能够泛化到训练数据中未包含的任务,支持语音转换、风格迁移和语音编辑等多种音频任务。
JetLM
SDAR是一种新型大语言模型,集成了自回归和离散扩散建模策略,结合了AR模型高效训练和扩散模型并行推理的优势。在通用任务上与SOTA开源AR模型相当,在科学推理任务上表现出色,成为最强大的扩散语言模型。
FireRedTeam
FireRedASR是一系列支持普通话、中国方言和英语的开源工业级自动语音识别(ASR)模型,在公开的普通话ASR基准测试中实现了新的最先进水平(SOTA),同时具备出色的歌词识别能力。
FireRedASR是一系列支持普通话、汉语方言和英语的开源工业级自动语音识别(ASR)模型,在公开普通话ASR基准测试中达到最新最优(SOTA)水平,同时具备卓越的歌词识别能力。
llava-hf
LLaVA-NeXT-Video是一个开源多模态聊天机器人,通过视频和图像数据混合训练获得优秀的视频理解能力,在VideoMME基准上达到开源模型SOTA水平。
WizardLMTeam
WizardCoder-33B-V1.1是基于deepseek-coder-33b-base训练的开源代码大语言模型,在HumanEval和MBPP等基准测试上表现优异,成为SOTA开源代码LLM。
THUDM
CogVLM 是一个强大的开源视觉语言模型(VLM),在多个跨模态基准测试上取得了SOTA性能。
zai-org
CogVLM是一个强大的开源视觉语言模型,拥有100亿视觉参数和70亿语言参数,在10个经典跨模态基准测试上取得了SOTA性能,在多个视觉语言任务中表现优异。