下一代Gemini模型因内部分歧、算力紧张及审批流程繁琐,发布时间推迟两个月。尽管有自研TPU,但模型训练、云业务及消费端、企业级AI需求叠加,算力仍不足。高层已启动组织架构调整以缓解资源分配问题。
在生成式人工智能浪潮推动下,算力成为科技巨头角逐的关键资源。谷歌的Gemini AI平台因需求激增,自2025年春季以来API调用请求量翻倍,导致核心算力捉襟见肘,被迫收紧资源分配。为平衡开发者和企业的激增负载,并保障生态系统公平,谷歌于2026年5月17日正式实施基于算力额度的使用限制,采用类似流量套餐的分级模式。这一举措不仅缓解了供应压力,也折射出整个AI领域对算力需求的失控性增长。
微软旗下GitHub于2026年4月28日宣布,AI编程工具Copilot将于6月1日起从固定额度订阅制改为按使用量计费,引入“GitHub AI Credits”积分体系。此举旨在应对Copilot向多步骤自主编码智能体平台演进带来的算力压力。新规废除原有“高级请求”计数,基础订阅价不变,改为每月分配积分。
大语言模型推理效率迎来突破。清华大学与Moonshot AI联合提出“预填充即服务”新架构,通过将推理过程拆分为预填充和解码两个阶段,并优化算力资源分配,有效解决硬件限制问题,显著提升模型服务性能。
Anthropic
$21
Input tokens/M
$105
Output tokens/M
200
Context Length
Iflytek
$2
-
Baichuan
4