最初のトークン遅延を3.25倍短縮:小紅書が北京大学・上海交通大学と共同してHYPICを開発、混合注目大モデルに位置に依存しないキャッシュを搭載
大モデルサービスの主要な戦場は検索強化Q&A、多文書要約、長距離エージェントへと移行しています。要求されるpromptは数十から百以上の意味的に独立した断片(検索ドキュメント、スキル説明、記憶、履歴ラウンド)によって構成され、数万から数十万トークンに及ぶ非常に長いコンテキストとなります。このため、プレフィルの段階が主な計算コストを占め、サービス提供者にとって最も顕著なコスト源となり、さらに深刻な問題も引き起こしています。