WEKA は、推論需要の増大により AI インフラストラクチャの非効率性が増大すると指摘しています。 KV キャッシュのエビクションが頻繁に行われると、隠れたオーバーヘッドが発生し、GPU サイクルが無駄になり、レイテンシが増加し、ユーザー エクスペリエンスが損なわれ、トークンごとの運用コストが増加します。 100,000 トークンを超える入力を伴うロングコンテキストのエージェント AI ワークロードの場合、このようなオーバーヘッドは、本番 AI デプロイメントのユニットエコノミクスに深刻なダメージを与えます。