7月21日,谷歌DeepMind发布三款中轻量级AI模型。主力Gemini 3.6 Flash增强代码、知识及多模态能力,Token用量减少17%以降低成本;3.5 Flash-Lite主打极致性价比;3.5 Flash Cyber专攻网络安全。系列全面提升效率与应用落地。
据The Information报道,Alphabet研发代号“Frozen v2”的AI芯片,为Gemini模型优化,预计2028年推出,每瓦生成token效率可能达现有芯片6-10倍。谷歌回应称项目未必量产。
OpenAI CEO奥尔特曼公布,受GPT-5.6系列模型上线推动,旗下AI智能体产品Tokens周用量激增2.5倍。新模型大幅提升编程能力,使Tokens效率提高54%。
马斯克旗下SpaceXAI发布Grok 4.5,为上市后首个重大更新。模型定位通用主力,可完成代码编写等任务。马斯克称其达到Opus级水平,但速度更快、Token效率更高且成本更低。
Openai
$2.8
输入tokens/百万
$11.2
输出tokens/百万
1k
上下文长度
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
Anthropic
$105
$525
$0.7
$7
$35
$17.5
Alibaba
-
$4
$16
$2
$20
$6
$24
256
Bytedance
$0.8
128
$0.15
$1.5
Baidu
32
$10.5
$8
nvidia
Llama-3.3-Nemotron-Super-49B-v1.5是基于Meta Llama-3.3-70B-Instruct的大语言模型,经过多阶段后训练增强了推理和非推理能力。支持128K token上下文长度,在准确性和效率之间取得了良好平衡,适用于推理、聊天和代理任务。
microsoft
微软研究院开发的首个开源20亿参数规模原生1比特大语言模型,在4万亿token语料上训练完成,证明了原生1比特大语言模型在保持与同规模全精度开源模型相当性能的同时,能显著提升计算效率。
由微软研究院开发的开源原生1位大语言模型,参数规模达20亿,在4万亿token的语料库上训练而成,显著提升计算效率。
Llama-3.1-Nemotron-Ultra-253B-CPT-v1是基于Meta Llama-3.1-405B-Instruct的大型语言模型,支持128K tokens上下文长度,经过神经架构搜索优化,在准确性和效率之间取得良好平衡。
OneMCP是一个通用的MCP协议聚合器,通过元工具架构将多个外部MCP服务器的工具统一管理,采用渐进式发现和语义搜索技术,显著降低LLM的token消耗并提高工具发现效率。
Notion MCP服务器是一个中间件服务,通过Notion API实现LLM与Notion工作区的交互,支持Markdown转换优化token使用效率。