OpenAI与开发平台Kiro合作,将GPT-5.6模型家族(含Sol、Terra、Luna)嵌入软件规划、构建、审查、测试全流程。新模型每Token产出效率大幅提升,性能更强、性价比更高,并能按需处理复杂任务。
无问芯穹与稀宇科技(MiniMax)签署战略合作,铺设四方向:共优模型推理效能体系、共建大模型Token服务与AI基础设施、联合创新应用范式、共拓行业智能化场景。双方优势互补,无问芯穹长于算力调度与推理基础设施,MiniMax手握自研大模型与海量应用流量,前者以底层算力支撑后者提升推理效率,打通从技术到落地的闭环。
OpenAI 发布 GPT-5.6 模型家族,包括旗舰 Sol、均衡 Terra 与高性价比 Luna。新一代通过底层技术栈深度优化,大幅提升每 token 智能效率,在降低 API 成本的同时增强性能。其中,旗舰 Sol 开启最大推理能力后,在编码智能体基准测试中表现超越竞品。
7月21日,谷歌DeepMind发布三款中轻量级AI模型。主力Gemini 3.6 Flash增强代码、知识及多模态能力,Token用量减少17%以降低成本;3.5 Flash-Lite主打极致性价比;3.5 Flash Cyber专攻网络安全。系列全面提升效率与应用落地。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
Anthropic
$105
$525
$0.7
$7
$35
$17.5
Alibaba
-
$4
$16
$2
$20
$6
$24
256
Bytedance
$0.8
128
$0.15
$1.5
Baidu
32
$10.5
$8
nvidia
Llama-3.3-Nemotron-Super-49B-v1.5是基于Meta Llama-3.3-70B-Instruct的大语言模型,经过多阶段后训练增强了推理和非推理能力。支持128K token上下文长度,在准确性和效率之间取得了良好平衡,适用于推理、聊天和代理任务。
microsoft
微软研究院开发的首个开源20亿参数规模原生1比特大语言模型,在4万亿token语料上训练完成,证明了原生1比特大语言模型在保持与同规模全精度开源模型相当性能的同时,能显著提升计算效率。
由微软研究院开发的开源原生1位大语言模型,参数规模达20亿,在4万亿token的语料库上训练而成,显著提升计算效率。
Llama-3.1-Nemotron-Ultra-253B-CPT-v1是基于Meta Llama-3.1-405B-Instruct的大型语言模型,支持128K tokens上下文长度,经过神经架构搜索优化,在准确性和效率之间取得良好平衡。
OneMCP是一个通用的MCP协议聚合器,通过元工具架构将多个外部MCP服务器的工具统一管理,采用渐进式发现和语义搜索技术,显著降低LLM的token消耗并提高工具发现效率。
Notion MCP服务器是一个中间件服务,通过Notion API实现LLM与Notion工作区的交互,支持Markdown转换优化token使用效率。