月之暗面官宣第一代万亿参数多模态模型Kimi K2.5将于本月底结束服役。该模型今年1月推出并开源,是Kimi迄今最全能模型,采用原生多模态架构,支持视觉与文本输入、思考/非思考模式、对话与Agent任务,在Agent、代码、图像、视频及通用智能取得开源SOTA。K3将接力,参数规模再上台阶。
Mistral AI发布开源内容审核模型Shieldstral,3B参数,Apache2.0许可,支持12种语言,可在单张16GB GPU运行。号称性能媲美7倍大模型,并在多模态审核达SOTA,但指出多数防护模型将伤害类别体系固化。
视觉大模型因隐形门槛——顶尖效果需天量数据与算力,长期仅为头部团队专属。7月21日,小鹏集团发布TuringViT高效视觉编码器,系统性重构架构、数据范式与训练流程,提供可复现、低成本的SOTA级视觉Transformer训练路径,推动先进视觉能力走向行业普惠。
巴西里约热内卢市政府推出的开源大模型Rio 3.5 397B在AI圈引发关注,宣称在多项基准测试中达到SOTA。但发布不足24小时,Nex-AGI联盟通过数学分析指出该模型实为套壳缝合模型,核心权重被起底,引发行业争议。
基于OpenAI Sora 2的AI视频生成器,可从文本或图像生成带声音的高清视频。
B站开源的SOTA动画视频生成模型,支持多种二次元风格视频一键生成。
VSCode扩展,基于最新的代理框架进行代码编辑
基于llama3 8B的SOTA视觉模型
Alibaba
-
输入tokens/百万
输出tokens/百万
上下文长度
Bytedance
$0.5
Chatglm
Minimax
01-ai
4
Nanbeige
楠米色4-3B-思维-2511是楠米色系列的最新增强版本,通过先进的蒸馏技术和强化学习优化,在紧凑的3B参数规模下实现了强大的推理能力。该模型在Arena-Hard-V2和BFCL-V4等基准测试中,在参数小于32B的模型中取得了最先进(SOTA)成果。
noctrex
Gelato-30B-A3B是针对GUI计算机使用任务进行微调的最先进(SOTA)模型,提供了量化版本以优化部署效率。该模型专门设计用于理解和处理图形用户界面相关的任务。
unsloth
Apriel-1.5-15b-Thinker是ServiceNow Apriel SLM系列中的多模态推理模型,具有150亿参数,能够在文本和图像推理任务上与规模大10倍的模型竞争。该模型通过中期训练方案实现了卓越的推理能力,无需图像SFT训练或强化学习即可达到SOTA性能。
XiaomiMiMo
MiMo Audio是一款基于大规模预训练的音频语言模型,在语音智能和音频理解基准测试中取得了开源模型的SOTA性能。该模型展现出强大的少样本学习能力,能够泛化到训练数据中未包含的任务,支持语音转换、风格迁移和语音编辑等多种音频任务。
cpatonn
GLM-4.5V-AWQ-4bit是基于智谱AI下一代旗舰文本基础模型构建的量化版本多模态模型,通过AWQ-4bit量化技术优化,在保持优异性能的同时显著降低计算资源需求。该模型在42个公开视觉语言基准测试中达到同规模模型的SOTA性能,具备强大的视觉推理能力。
JetLM
SDAR是一种新型大语言模型,集成了自回归和离散扩散建模策略,结合了AR模型高效训练和扩散模型并行推理的优势。在通用任务上与SOTA开源AR模型相当,在科学推理任务上表现出色,成为最强大的扩散语言模型。
tcpipuk
dots.ocr是一款强大的多语言文档解析器,将布局检测和内容识别统一在单一视觉语言模型中,基于17亿参数实现SOTA性能,支持多语言文档解析和良好的阅读顺序保持。
lingshu-medical-mllm
灵枢是医疗领域的SOTA多模态大语言模型,在医疗视觉问答和报告生成任务中表现卓越。
RiverZ
ICEdit是一种创新的指令式图像编辑方法,通过大规模扩散变换器实现高效编辑,仅需0.5%的训练数据和1%的参数规模即可达到SOTA效果。
ubergarm
Qwen3-30B-A3B的量化版本,采用先进的非线性SotA量化技术,在给定内存占用下提供同类最佳的质量。
Skywork
SkyReels V2是一个无限长度电影生成模型,采用自回归扩散强制架构,支持720P高清视频生成,在公开模型中达到SOTA性能。
all-hands
基于Qwen2.5-Coder-32B-Instruct微调的评审模型,用于评估代码解决方案质量,助力SWE-Bench基准测试取得SOTA成绩
UCSC-VLAA
VLAA-Thinker-Qwen2.5-3B是一个类似R1的推理大视觉语言模型,专注于多模态推理任务。该模型在OpenCompass多模态推理排行榜上达到了SOTA性能,支持图像理解和复杂推理能力。
qihoo360
Light-R1-32B-DS是一款近SOTA水平的32B数学模型,基于DeepSeek-R1-Distill-Qwen-32B微调,仅使用3K SFT数据即实现高性能。
Light-R1-14B-DS是一个14B参数的数学SOTA模型,采用强化学习训练,在AIME24/25和GPQA基准测试中表现优异。
xingyang1
Distill-Any-Depth是一种新的SOTA单目深度估计模型,采用知识蒸馏算法训练而成。
Distill-Any-Depth是一种基于知识蒸馏算法训练的SOTA单目深度估计模型,能够高效准确地进行深度估计。
FireRedTeam
FireRedASR是一系列支持普通话、中国方言和英语的开源工业级自动语音识别(ASR)模型,在公开的普通话ASR基准测试中实现了新的最先进水平(SOTA),同时具备出色的歌词识别能力。
FireRedASR是一系列支持普通话、汉语方言和英语的开源工业级自动语音识别(ASR)模型,在公开普通话ASR基准测试中达到最新最优(SOTA)水平,同时具备卓越的歌词识别能力。
ragraph-ai
这是一个专门用于生成CYPHER查询语句的30亿参数模型,在生成CYPHER方面超越了GPT4-o等SOTA模型。该模型基于特定数据集进行微调,能够将文本转换为CYPHER查询语句,用于查询GraphDB(如Neo4j)。
XiYan MCP Server是一个基于XiYan-SQL的模型上下文协议服务器,支持通过自然语言查询数据库,提供多种模型配置选项,包括通用大模型、SOTA文本转SQL模型及本地模型,适用于不同安全性和性能需求场景。