下一代Gemini模型因內部分歧、算力緊張及審批流程繁瑣,發佈時間推遲兩個月。儘管有自研TPU,但模型訓練、雲業務及消費端、企業級AI需求疊加,算力仍不足。高層已啓動組織架構調整以緩解資源分配問題。
在生成式人工智能浪潮推動下,算力成爲科技巨頭角逐的關鍵資源。谷歌的Gemini AI平臺因需求激增,自2025年春季以來API調用請求量翻倍,導致核心算力捉襟見肘,被迫收緊資源分配。爲平衡開發者和企業的激增負載,並保障生態系統公平,谷歌於2026年5月17日正式實施基於算力額度的使用限制,採用類似流量套餐的分級模式。這一舉措不僅緩解了供應壓力,也折射出整個AI領域對算力需求的失控性增長。
微軟旗下GitHub於2026年4月28日宣佈,AI編程工具Copilot將於6月1日起從固定額度訂閱制改爲按使用量計費,引入“GitHub AI Credits”積分體系。此舉旨在應對Copilot向多步驟自主編碼智能體平臺演進帶來的算力壓力。新規廢除原有“高級請求”計數,基礎訂閱價不變,改爲每月分配積分。
大語言模型推理效率迎來突破。清華大學與Moonshot AI聯合提出“預填充即服務”新架構,通過將推理過程拆分爲預填充和解碼兩個階段,並優化算力資源分配,有效解決硬件限制問題,顯著提升模型服務性能。
Anthropic
$21
輸入tokens/百萬
$105
輸出tokens/百萬
200
上下文長度
Iflytek
$2
-
Baichuan
4