Artificial Analysis联合Liquid AI发布手机端本地AI性能基准,聚焦iPhone 17 Pro真实表现。前者测智能水平,后者测推理性能,涵盖函数调用、指令遵循、知识认知、高难问答与数学五类。测试对象为4bit量化、体积不超8GB的端侧模型,旨在验证小模型也能实现高智能。
OpenRouter于8月20日上线匿名新模型Ox Alpha,开发方身份神秘。该模型在多项基准测试中表现亮眼,迅速引发海外技术社区热议。其定位为专注代码编写、长时智能体任务及实际生产环境的前沿AI模型。
SpaceX AI推出旗舰模型Grok4.6,专注复杂长程Agent任务,多项基准测试比肩或超越OpenAI GPT-5.6 Sol。此前7月联合Cursor推出基于数万张英伟达GB300 GPU训练的Grok4.5,Grok4.6在其基础上进一步优化长程复杂任务能力。
CodeBuddy全系产品适配DeepSeek-V4-Flash正式版,新模型强化AI Agent能力,在基准测试中显著超越前代预览版。优化代码生成、任务执行与复杂开发流程,为开发者提供更高效的智能编程体验。
Speko为语音AI模型提供路由服务,跨语言基准测试并智能选优。
强大的开源Kimi K2聊天平台,通过Kimi AI在编程和数学基准测试中超越GPT-4。企业级Kimi AI,成本降低95%。
用于评估Windows PC或Apple Mac上AI推理引擎性能的基准测试工具。
用于衡量设备 AI 加速器推理性能的基准测试工具。
Anthropic
$105
Input tokens/M
$525
Output tokens/M
200
Context Length
$21
Alibaba
-
Bytedance
Baidu
Tencent
$2
64
$0.8
$8
256
moonshotai
Kimi K2 Thinking 是月之暗面(Moonshot AI)开发的最新一代开源思维模型,具有强大的深度推理能力和工具调用功能。该模型采用混合专家架构,支持原生INT4量化,拥有256k上下文窗口,在多个基准测试中表现出色。
unsloth
GLM-4.6是智谱AI推出的新一代文本生成模型,相比GLM-4.5在多个方面有显著改进,包括更长的上下文窗口、更优的编码性能和更强的推理能力。该模型在多个公开基准测试中表现出色,与国内外领先模型相比具有竞争优势。
GLM-4.6是智谱AI开发的新一代大语言模型,相比GLM-4.5在上下文处理、编码能力和推理性能方面有显著提升。该模型支持200K上下文长度,在多个公开基准测试中表现出色,特别在代码生成、推理和代理任务方面具有竞争优势。
cpatonn
GLM-4.5V-AWQ-4bit是基于智谱AI下一代旗舰文本基础模型构建的量化版本多模态模型,通过AWQ-4bit量化技术优化,在保持优异性能的同时显著降低计算资源需求。该模型在42个公开视觉语言基准测试中达到同规模模型的SOTA性能,具备强大的视觉推理能力。
Devstral 1.1是由Mistral AI和All Hands AI合作开发的智能大语言模型,专为软件工程任务设计。该模型在SWE-bench基准测试中表现出色,位列开源模型榜首,拥有240亿参数和128k tokens的长上下文窗口。
Devstral是一款专为软件工程任务打造的大语言模型,由Mistral AI和All Hands AI合作开发。在SWE-bench基准测试中表现优异,是排名第一的开源模型。
qihoo360
Light-R1-7B-DS是基于DeepSeek-R1-Distill-Qwen-7B微调的开源7B数学模型,在AIME24和25等数学基准测试中表现优异。
Light-R1-14B-DS是一个14B参数的数学SOTA模型,采用强化学习训练,在AIME24/25和GPQA基准测试中表现优异。
desklib
由Desklib开发的AI生成文本检测模型,用于区分人类撰写和AI生成的英文文本,在RAID基准测试中表现领先。
RUC-AIBOX
STILL-3-1.5B-preview是一款采用强化学习技术增强推理能力的慢思考模型,在AIME基准测试中达到39.33%准确率
scb10x
台风T1 3B是SCB 10X开发的新型开放推理模型系列的首款产品。该模型基于Llama 3.2架构,具备跨领域推理能力,在GPQA、MMLU Pro和AI数学奥林匹克等基准测试中表现优异,特别支持泰语推理过程生成。
apple
AIMv2是采用多模态自回归目标预训练的视觉模型系列,在多项多模态理解基准测试中表现优异。
AIMv2是一个采用多模态自回归目标预训练的视觉模型系列,在多项多模态理解基准测试中表现优异。
AIMv2是基于多模态自回归目标预训练的视觉模型系列,在多模态理解基准测试中表现优异
AIMv2是通过多模态自回归目标预训练的视觉模型系列,在多模态理解基准测试中表现优异。
AIMv2是通过多模态自回归目标预训练的视觉模型系列,在多个视觉理解基准测试中表现优异。
AIMv2 是通过多模态自回归目标预训练的视觉模型系列,在多个视觉理解基准测试中表现优异。
AIMv2是通过多模态自回归目标预训练的视觉模型系列,在多个基准测试中表现优异。
AIMv2是基于多模态自回归目标预训练的视觉模型系列,在多个基准测试中表现优异
AIMv2 是一个通过多模态自回归目标预训练的视觉模型系列,在多个多模态理解基准测试中表现优异。
MCP服务器测试工具是一个配置驱动的测试解决方案,用于验证、基准测试和确保与AI模型集成的MCP服务器的可靠性。它支持自动发现工具、生成智能测试用例、执行验证并生成详细报告。
MeshSeeks是一个基于多代理并行处理技术的AI任务解决平台,通过创建专业化的AI代理网络,实现复杂编码问题的快速分解与协同解决。项目提供4倍上下文容量、实时状态面板和智能任务协调功能,显著提升开发效率(基准测试显示速度提升3.64倍)。
AutoGPT是一个开源AI代理框架,旨在让每个人都能轻松构建和使用AI代理。项目提供Forge工具链简化开发流程,包含基准测试、用户界面和CLI工具,支持通过Agent Protocol标准实现兼容性,并设有竞技场排行榜激励开发者优化代理性能。
一个MCP服务器,用于从rival.tips查询AI模型比较数据,包括基准测试、价格和功能,供Claude、Cursor等AI编码助手使用。