阿里云上线灵骏真武M890超节点实例,首批在乌兰察布开售。企业无需自建机房,即可云端开通64卡高速互联算力单元,支持最高十万亿参数级MoE大模型推理。该实例是国内首个成功运行超2万亿参数模型的超节点算力,Kimi K3与Qwen3.8Max已基于其提供服务,内置FP8/FP4低精度计算,并采用ICN Switch1.0芯片。
DeepSeek宣布近期将大幅上调API服务价格,提醒用户提前规划。此次涨价将冲击使用其模型的开发者和企业。该公司凭借低成本强推理优势快速普及,已广泛用于应用开发、智能客服、代码生成等场景。
无问芯穹与稀宇科技(MiniMax)签署战略合作,铺设四方向:共优模型推理效能体系、共建大模型Token服务与AI基础设施、联合创新应用范式、共拓行业智能化场景。双方优势互补,无问芯穹长于算力调度与推理基础设施,MiniMax手握自研大模型与海量应用流量,前者以底层算力支撑后者提升推理效率,打通从技术到落地的闭环。
北京AGI Bar酒吧推出“Token免费畅饮”服务,消费者连接店内Wi-Fi后可免费不限量调用DeepSeek V4 Flash模型API。酒吧配备英伟达DGX Spark AI工作站实现本地推理,顾客获取Base URL和API Key即可在代码工具中使用。
全球最快的AI推理服务提供商,部署模型速度无与伦比
免费开源AI模型推理服务
快速易用的LLM推理和服务平台
提供模型探索体验、推理、训练、部署和应用服务
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
$2
$20
$6
$24
Baidu
128
Bytedance
$1.2
$3.6
4
prithivMLmods
基于Qwen3架构构建的专业模型,专注于科学、人工智能设计和通用推理领域。该模型在高难度科学推理数据集上进行了微调,具备出色的通用和创造性推理能力,体积小巧适合本地设备和服务器部署。
ValiantLabs
埃斯珀 3 是基于千问 3 构建的编码、架构和开发运维推理专家模型,适用于本地和服务器部署。
埃斯佩尔3是基于千问3构建的代码、架构和开发运维推理专家模型,适用于本地和服务器推理。
squeeze-ai-lab
TinyAgent是为边缘设备设计的小型语言模型(SLM),专注于函数调用和复杂推理能力,提供隐私保护和低延迟服务。
oblivious
Vikhr-7B-instruct-GGUF 是一个基于 Mistral 架构的 70 亿参数大语言模型,专门针对俄语和英语的文本生成任务进行了优化。该模型采用 GGUF 量化格式,支持高效的推理部署,能够为用户提供多语言的文本交互服务。
Deepseek R1的MCP服务器实现,支持Node.js环境,提供强大的语言模型推理服务。
一个基于量子场计算模型的Claude多实例协同推理服务器,通过场一致性优化实现增强型AI推理能力。
Forge MCP服务器是一个通过32个并行AI代理将PyTorch模型自动优化为高性能CUDA/Triton内核的工具,可将推理速度提升高达14倍,支持多种MCP兼容的AI编程助手。
一个增强AI模型推理能力的MCP服务器,通过结构化检索和动态思维链提升问题解决能力。
Deepseek R1的MCP服务器实现,支持与Claude Desktop集成,提供强大的语言模型推理服务。
RLM MCP服务器是一个基于递归语言模型模式的大规模上下文处理工具,允许Claude代码通过外部变量处理超过1000万token的文本,避免直接将海量内容输入提示词。它通过加载、分块、子查询和聚合的流程,支持自动分析和程序化执行,可连接Claude API或本地Ollama进行免费推理。
一个基于Replicate API的FastMCP服务器实现,专注于提供资源化的AI模型推理访问,特别擅长图像生成功能。
MCP Thought Server是一个为AI代理提供高级思维工具的服务,通过模型上下文协议(MCP)增强推理、规划和迭代优化能力。它包含结构化思维、迭代草稿和集成思维等工具,支持SQLite持久化和高级置信度评分系统,可配置环境变量以适应不同需求。
mcp-scaffold是一个用于验证模型上下文协议(MCP)服务器的开发沙箱,提供本地LLM(如LLaMA 7B)和云端推理支持,包含聊天界面和参考架构。
一个连接本地LLM与MCP服务器的TypeScript桥梁项目,提供Web界面使开源模型能使用类似Claude的工具能力,支持文件系统、网络搜索和复杂推理等功能。
一个利用Deepseek R1模型的思维链进行推理的MCP服务工具,支持在Claude Desktop等客户端中使用。
MindBridge是一个AI模型路由服务器,支持多LLM提供商,实现智能模型调度与协作,适用于复杂推理任务和多模型工作流。
Groq MCP Server是一个通过Model Context Protocol(MCP)提供快速模型推理的服务,支持文本生成、语音转换、图像分析和批量处理等多种功能。
mirror-mcp是一个基于模型上下文协议(MCP)的服务器,它提供了一个“reflect”工具,使大型语言模型能够通过递归提问和MCP采样进行自我反思和内省,从而实现自我分析、推理验证和迭代问题解决。
mcp-scaffold是一个用于验证模型上下文协议(MCP)服务器的沙盒环境,支持本地和云端LLM推理,提供聊天界面和参考架构。
一个自包含的MCP服务器,用于一阶逻辑推理,支持定理证明、模型查找和反例检测,采用多引擎架构自动选择最佳推理引擎。
Fluent MCP是一个用于构建具有智能推理能力的模型上下文协议(MCP)服务器的现代框架,支持AI集成、工具分离和复杂推理卸载,采用双层LLM架构实现高效推理。
为Claude Desktop提供Gemini语言模型推理能力的MCP服务器实现
一个基于MCP协议的AI软件架构师服务器,能够分析代码库生成产品需求文档(PRD)并为复杂编码任务提供推理辅助,采用多模型架构和智能代理设计。
vLLM是一个高效、易用的LLM推理和服务库,支持多种模型架构和优化技术,提供高性能的LLM服务。