据OpenRouter最新数据,9月14日至20日,全球AI大模型总调用量达129万亿Token,环比增长1.57%。其中,中国大模型周调用量达67.46万亿Token,环比增长10.28%;美国大模型为14.21万亿Token,环比下降34.7%。中国大模型周调用量已连续21周超过美国。

上周全球调用量排名前五中有4款来自中国。DeepSeek V4.1-Flash以15.8万亿Token跃居第一,环比增长219%。该模型9月10日发布,重点提升Coding、Agent和多模态理解能力,采用Causal-Encoder-Decoder架构,全局KV Cache降至V4-Flash约1/4。其闲时每百万Token输入缓存命中、未命中及输出价格分别为0.02元、1元和4元,较前代分别下降60%、33.3%和11.1%。

不过,Token单价下降并不意味着单项任务成本同步下降。Artificial Analysis测试显示,V4.1-Flash平均每项任务使用约8.9万输出Token,高于V4Flash0731的约6.2万Token,并被评价为输出较为冗长。

此外,智谱GLM5.3Flash周调用量14.1万亿Token,排名第二;腾讯混元Hy4preview以12.5万亿Token排名第三;DeepSeek-V4-Flash-0731以9.44万亿Token排名第五。