大模型服务主战场正转向检索增强问答、多文档摘要和长程Agent。请求prompt由几十到上百个语义独立的片段(检索文档、技能说明、记忆、历史轮次)拼接,形成数万至数十万token的超长上下文,预填充阶段占据主导算力开销,成为服务商最突出的成本来源,且引发更棘手的难题。
亚马逊调整Anthropic模型服务定价,由按“计算小时”转为按“Token数量”计费,标志AI算力成本管理更趋精细化。此举升级了成本核算方式,能更精准反映不同任务的实际算力消耗,克服传统模式单一粗放的局限。
字节跳动战略重心转向大模型底层能力,CEO梁汝波定调“勇攀高峰”,将火山引擎PaaS作为基础业务,长期押注MaaS。截至2026年6月,豆包大模型日均token调用量增长迅猛,凸显其模型即服务领域的扩张决心。
MiniMax最新大模型M3已接入支付宝TokenPay解决方案,实现企业“批量购买、一键分发”的Token席位管理。用户通过支付宝AI付,在MiniMax Agent的Mix Claw服务中语音即可完成应用内结账。MiniMax成为全球首批将Token Pay融入核心订阅体系的大模型厂商,标志着支付宝国内首个MaaS支付方案投入规模化应用。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
Anthropic
$105
$525
200
$0.7
$7
$35
Alibaba
$4
$16
Baidu
-
128
$6
$24
256
$2
$20
$15.8
$12.7
64
Bytedance
$0.8
$0.15
$1.5
32
$10.5
Tencent
$1
$8
HiveChat是一个专为中小团队设计的AI聊天应用,支持多种大模型服务商,提供分组管理、Token限额、第三方登录等功能。
这是一个实现MCP代码执行模式的服务器,通过单工具桥接和零上下文发现机制,将MCP工具调用开销从数万token降至约200token,并在根容器中安全执行Python代码,支持数据科学和安全隔离。
MCP文本编辑器服务器是一个基于Model Context Protocol的文本文件编辑服务,提供行导向的文本文件操作能力,支持高效的部分文件访问以减少LLM工具的token消耗。具备并发编辑检测、多文件原子操作和多种编码支持等特性。
钉钉MCP服务是一个基于Model Control Protocol的钉钉API访问服务,提供获取token、部门及用户信息等功能。
godoc-mcp是一个高效的Go文档访问工具,通过MCP协议为LLM提供结构化、低token消耗的Go项目文档访问服务,支持本地和远程包文档查询。
OneTool是一个统一的MCP服务器,通过Python API暴露100多种工具,大幅减少AI调用工具时的token消耗和成本,避免上下文污染,支持Web搜索、数据库、文件操作、图表绘制等多种功能。
一个与AI代码编辑器集成的MCP服务器,通过Gemini 2.5的百万token上下文窗口和任务管理功能,优化Cursor的代理能力。
用于对xcstrings(字符串目录)文件进行增删改查操作的CLI工具和MCP服务器,提供针对性的本地化键值管理,避免AI助手处理大型文件时消耗过多token。
一个MCP服务器项目,提供基于token数量自动选择OpenAI O3或Google Gemini 2.5 Pro模型的服务,支持文件路径递归嵌入提示词,适用于代码审查和复杂问题解决。
基于Gemini的上下文管理与缓存MCP服务器,支持2M token大上下文窗口,提供会话管理和API缓存功能。
一个基于MCP协议的内存缓存服务器,通过高效缓存语言模型交互数据来减少token消耗,支持自动管理和配置优化。
NCP是一个MCP协议智能编排器,将多个MCP服务器统一管理,通过语义理解自动路由工具调用,大幅减少AI工具的认知负担和token消耗,提升AI助手的工作效率和响应速度。
Token Minter MCP是一个支持21条区块链的ERC-20代币铸造服务,提供代币部署、转账、查询等工具集。
基于Notion的Markdown导航MCP服务,实现无token访问与智能笔记管理
RLM MCP服务器是一个基于递归语言模型模式的大规模上下文处理工具,允许Claude代码通过外部变量处理超过1000万token的文本,避免直接将海量内容输入提示词。它通过加载、分块、子查询和聚合的流程,支持自动分析和程序化执行,可连接Claude API或本地Ollama进行免费推理。
MCP BatchIt是一个MCP工具调用批处理服务器,通过聚合多个MCP工具调用到一个请求中,显著减少AI代理的通信开销和token消耗。
一个用于Claude Code的MCP服务器,通过结构化增量快照实现90%以上的上下文压缩,显著节省token使用量
一个封装V2EX官方API 2.0的服务器,提供通知管理、用户信息、节点话题等接口功能,支持通过npm全局安装并配置token使用。
Token Optimizer MCP是一个智能令牌优化MCP服务器,通过智能缓存、压缩和工具替换,可将上下文窗口使用量减少60-90%,支持Claude Code和Claude Desktop等AI工具。
一个优化的Playwright MCP服务器,采用客户端-服务端架构实现浏览器自动化,通过创新的语义快照算法大幅减少页面内容传输量,保留关键元素的同时降低90%的token消耗。