微软被曝收紧Token使用管理,将监控用量并把内部默认工作负载逐步切换至GPT-5.6 Sol以降本。导火索是泄露表格显示,部分员工为抬高数据排名大量调用AI,单人在28天内产生约2.8万美元Token成本,引发高层担忧;各部门差异明显,CoreAI最“烧钱”。
阿里千问发布多模态MoE模型Qwen3.8-Flash,并开源下一代架构Qwen3.8-Flash-Next(Qwen4雏形)。模型总参数125B,搭载51B N-gram Embedding,每token仅激活6B;原生支持26万token,可扩展至100万。训练成本为前代1/9,API定价输入每百万Tokens 1元、输出3元。
AI服务商Writer推出旗舰模型Palmyra X6,基于开源模型GLM-5.2后训练变体,并升级智能代理运行框架,可将企业基础任务的Token成本降低高达50%,旨在破解AI“越用越贵”困境。
DeepSeek-V4-Pro-0813在硅基流动Day-0首发,主打1M上下文、低/高/最大三档推理强度,重心转向编码、工具调用与智能体工作流,维持MIT开源。定价为输入每百万token 1.32美元、输出3.96美元,缓存命中仅0.44美元,缓存成本优势显著。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
-
$4
$16
$2
$20
$6
$24
256
Bytedance
$0.8
128
$0.15
$1.5
Baidu
32
OneTool是一个统一的MCP服务器,通过Python API暴露100多种工具,大幅减少AI调用工具时的token消耗和成本,避免上下文污染,支持Web搜索、数据库、文件操作、图表绘制等多种功能。
基于cursor-agent CLI的MCP服务器,提供代码分析、搜索、规划和编辑等工具,帮助Claude Code减少token使用和成本