蚂蚁集团联合中金公司等发布蚂蚁百灵首个金融增强大模型Ling-3.0-flash-Fin。该模型沿用原有架构参数,经海量金融语料深度训练,显著强化投研能力,聚焦信息检索等四大核心能力,多项基准测试显示专业表现突出,通用能力同步提升。
Midjourney近日开放测试首款V8.2图像编辑模型,打破仅靠文本生成图像的单一模式,深度融合指令微调、多图参考、局部重绘等功能,为创作者提供更精准、可控的专业级视觉创作体验。
小鹏汽车8月27日宣布,搭载第二代VLA大模型的Robotaxi正式开启全无人道路测试,已获广州市智能网联汽车远程测试资质,可在指定测试道路开展无人驾驶。自6月启动员工内测以来,两个月完成超2000单订单,验证线上下单、接驾到行程服务完整流程。
智谱开源原生多模态模型GLM-5.3-Flash(320B-A18B),以领先性能和极致定价推动AI普惠。该模型测评获57分,与Claude Opus4.8持平,编程能力相当,综合性能超越GLM-5.2。发布前以匿名“Ox-Alpha”公开测试,登顶OpenCode、OpenRouter平台调用。
为大语言模型提供一次性测试环境,运行应用、验证更改并返回多种结果。
Currai提供LLM可观测性、追踪、评估和提示A/B测试等功能。
提供语音AI的ASR、TTS和LLM模型,可测试部署用于实时应用。
使用Scorecard简单构建和测试LLM应用,提供可预测且不断改进的AI体验。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
Baidu
128
$6
$24
prithivMLmods
ActIO-UI-7B-RLVR 是由 Uniphore 发布的 70 亿参数视觉语言模型,专门用于计算机界面自动化任务。它基于 Qwen2.5-VL-7B-Instruct,通过监督微调和可验证奖励的强化学习进行优化,在 GUI 导航、元素定位和交互规划等任务上表现出色,在 WARC-Bench 基准测试中达到了开源 7B 模型的领先水平。
open-thoughts
OpenThinker-Agent-v1 是一个基于 Qwen3-8B 进行后续训练的开源智能体模型,专为终端操作和软件工程任务而设计。它首先在高质量监督微调数据集上进行训练,然后通过强化学习进一步优化,在 Terminal-Bench 2.0 和 SWE-Bench 等智能体基准测试中表现出色。
DavidAU
Qwen3-4B-Hivemind-Instruct-NEO-MAX-Imatrix-GGUF 是一款基于 Qwen3 架构的 4B 参数指令微调大语言模型,采用 NEO Imatrix 与 MAX 量化技术,具备 256k 的超长上下文处理能力。该模型在多个基准测试中表现出色,是一款性能强劲的通用型模型。
PrimeIntellect
INTELLECT-3是一个拥有1060亿参数的混合专家(MoE)模型,通过大规模强化学习训练而成。在数学、编码和推理基准测试中展现出卓越性能,模型、训练框架和环境均以宽松许可协议开源。
TomoroAI
TomoroAI/tomoro-colqwen3-embed-4b是一款先进的ColPali风格多模态嵌入模型,能够将文本查询、视觉文档(如图像、PDF)或短视频映射为对齐的多向量嵌入。该模型结合了Qwen3-VL-4B-Instruct和Qwen3-Embedding-4B的优势,在ViDoRe基准测试中表现出色,同时显著减少了嵌入占用空间。
Justin331
SAM 3 是 Meta 推出的第三代可提示分割基础模型,统一支持图像和视频分割任务。相比前代 SAM 2,它引入了开放词汇概念分割能力,能够处理大量文本提示,在 SA-CO 基准测试中达到人类表现的 75-80%。
VibeThinker-1.5B是微博AI推出的15亿参数密集语言模型,基于Qwen2.5-Math-1.5B微调,专门针对数学和算法编码问题设计。采用'频谱到信号原理'框架训练,在多个数学竞赛测试中超越规模更大的模型,训练成本约7800美元,支持最长约40k词元的输出。
Nanbeige
楠米色4-3B-思维-2511是楠米色系列的最新增强版本,通过先进的蒸馏技术和强化学习优化,在紧凑的3B参数规模下实现了强大的推理能力。该模型在Arena-Hard-V2和BFCL-V4等基准测试中,在参数小于32B的模型中取得了最先进(SOTA)成果。
OpenMMReasoner
OpenMMReasoner是一个完全透明的两阶段多模态推理方案,涵盖有监督微调(SFT)和强化学习(RL)。该方案通过精心构建高质量数据集,在多个多模态推理基准测试中超越了强大的基线模型,为未来大规模多模态推理研究奠定了坚实的实证基础。
Mungert
MiroThinker v1.0是一个开源研究智能体,通过模型级别的交互式扩展提升工具增强推理和信息搜索能力。该模型在多个基准测试中表现出色,支持长上下文和深度多步分析。
tencent
混元OCR是由混元原生多模态架构驱动的端到端OCR专家VLM模型,仅用10亿参数的轻量级设计,在多个行业基准测试中取得最先进成绩。该模型擅长处理复杂的多语言文档解析,在文本定位、开放域信息提取、视频字幕提取和图片翻译等实际应用场景中表现出色。
sensenova
SenseNova-SI是基于多模态基础模型构建的空间智能增强模型系列,通过精心策划的800万样本数据训练,在多个空间智能基准测试中取得了优异表现,同时保持了强大的通用多模态理解能力。
inferencerlabs
Kimi - K2 - Thinking 3.825bit MLX 是一款用于文本生成的量化模型,通过不同的量化方式在测试中取得不同的困惑度表现,其中q3.825bit量化能达到1.256的困惑度。
ZygAI
ZygAI 是一款专为立陶宛语和英语任务设计的快速本地大语言模型,处于测试阶段。它作为轻量级的双语助手,能够在本地硬件上实时运行,为用户提供高效、准确的双语服务。
SenseNova-SI是基于成熟多模态基础模型构建的空间智能增强模型系列,通过精心策划的800万数据样本训练,在多个空间智能基准测试中展现出卓越性能,同时保持强大的通用多模态理解能力。
aquif-3.5系列中的顶尖模型,具备先进推理能力和100万标记的大上下文窗口,在多个基准测试中表现卓越,AAII综合得分达到60分。
moonshotai
Kimi K2 Thinking 是月之暗面(Moonshot AI)开发的最新一代开源思维模型,具有强大的深度推理能力和工具调用功能。该模型采用混合专家架构,支持原生INT4量化,拥有256k上下文窗口,在多个基准测试中表现出色。
amazon
Chronos-2是一个拥有1.2亿参数的时间序列基础模型,支持零样本预测。它在单一架构内支持单变量、多变量和协变量感知任务,在多个基准测试中实现了零样本预测的最先进精度,且推理效率极高。
MiniMax-M2 6.5bit MLX是基于MiniMax-M2模型的量化版本,在文本生成任务中表现出色,支持多种量化级别,其中q6.5bit量化在测试中能达到1.128的困惑度,与q8相当。
almanach
Gaperon-Young-1125-1B 是一个拥有15亿参数的双语(法语-英语)语言模型,由法国国家信息与自动化研究所(Inria Paris)的ALMAnaCH团队开发。该模型在约3万亿个高质量令牌上训练,特别注重语言质量和通用文本生成能力,而非基准测试优化。
MCP Appium是一个基于模型上下文协议的智能移动自动化服务器,为AI助手提供跨平台移动应用测试工具,支持iOS和Android平台,具备智能元素定位、会话管理和自动化测试生成等功能。
MCPwner是一个基于模型上下文协议的安全研究自动化服务器,集成了多种安全测试工具(SAST、SCA、秘密扫描等),为LLM驱动的安全分析工作流提供统一接口。
OpenManus是一个无需邀请码即可实现各种想法的开源项目,由MetaGPT团队成员在3小时内构建完成。它提供了一个简单的实现,允许用户创建自己的智能代理,并支持多种语言和配置。项目欢迎建议、贡献和反馈,未来计划包括更好的规划、实时演示、回放功能、RL微调模型和全面的基准测试。
该项目是一个概念验证(POC),展示了如何通过自定义主机实现模型上下文协议(MCP),用于测试代理系统。核心功能包括OpenAI兼容API、Google Gemini集成、流式响应支持及工具调用能力。
一个基于JSON的统一接口dbt模型控制协议(MCP)服务器,支持通过CLI、API或AI工具触发dbt模型运行和测试,并提供Slack通知功能。
Nano Agent是一个实验性的小型工程代理MCP服务器,支持多提供商LLM模型,用于测试和比较云端与本地LLM在性能、速度和成本方面的代理能力。项目包含多模型评估系统、嵌套代理架构和统一工具接口,支持OpenAI、Anthropic和Ollama等提供商。
一个基于Playwright和TypeScript的强大测试自动化框架,采用页面对象模型设计模式,支持数据驱动测试,并集成了MCP服务以增强测试录制与回放功能。
MCP互联网速度测试是一个实验性项目,通过标准化的MCP协议为AI模型提供网络性能测试工具,包括下载/上传速度、延迟和抖动测量等功能。
一个用于DICOM连接测试的模型上下文协议服务器
Zebbern Kali MCP服务器是一个基于模型上下文协议(MCP)的综合性渗透测试平台,为AI助手(如GitHub Copilot)提供通过标准化API直接在Kali Linux系统上执行安全工具的139个功能,涵盖网络侦察、Web应用测试、密码破解、漏洞利用和活动目录攻击等。
CircleCI MCP Server是一个基于模型上下文协议(MCP)的服务,允许通过自然语言与CircleCI平台交互,实现构建日志查询、不稳定测试检测和配置验证等功能。
FFUF MCP是一个连接高速Web模糊测试工具FFUF与模型上下文协议(MCP)生态系统的桥梁,通过标准化协议将FFUF功能集成到MCP兼容应用中,支持自动化安全测试和AI辅助工作流。
Hoverfly MCP Server是一个基于Spring Boot的模型上下文协议(MCP)服务器,将Hoverfly模拟工具集成到AI助手生态中,支持动态模拟第三方API以解决开发和测试中的外部服务依赖问题。
一个基于模型上下文协议(MCP)的文档管理系统,提供资源模板、文档处理、任务管理和集成测试等功能。
plugged.in App是一个用于管理模型上下文协议(MCP)服务器的综合Web应用,提供统一界面来发现、配置和使用跨多个MCP服务器的AI工具。它支持多工作区、交互式测试平台、工具管理、资源发现等功能,可与各种MCP客户端集成,并支持自托管部署。
Pop MCP Server 是一个为 Polkadot 生态提供全面开发支持的模型上下文协议服务器,集成了 Pop CLI 工具链,支持智能合约、平行链、运行时模块的创建、构建、测试和部署,并提供完整的 Polkadot、ink! 和 XCM 文档资源,让开发者能够通过自然语言与 AI 助手交互完成整个开发流程。
MCP服务器测试工具是一个配置驱动的测试解决方案,用于验证、基准测试和确保与AI模型集成的MCP服务器的可靠性。它支持自动发现工具、生成智能测试用例、执行验证并生成详细报告。
AutoSpectra是一个全能AI代理自动化平台,提供浏览器自动化、API测试、调试工具等一体化解决方案,兼容多种AI模型系统。
该项目是一个为Metasploit框架设计的MCP服务器,提供大语言模型与渗透测试平台的集成接口,支持通过自然语言控制复杂的安全测试流程。
mcp-chat是一个开源的通用MCP客户端工具,用于测试和评估MCP服务器与代理。支持命令行交互和网页模式,可连接各类MCP服务器(JS/Python/Docker),提供聊天历史记录、模型选择、系统提示定制等功能,帮助开发者调试MCP服务。