調査会社SemiAnalysisは9月22日、AI大規模モデル推論サービスの基盤アーキテクチャを体系的に分解した詳細な技術レポートを発表した。同レポートは、推論サービスが単一の全体ではなく、プリフィル(Prefill)、ミッドフィル(Midfill)、デコードアテンション(Decode Attention)、デコードエキスパート(Decode Experts)の4つの作業段階からなる「トークンファクトリー」であると指摘している。

この分析フレームワークは、各段階でハッシュレート、メモリ帯域幅、ネットワークに対する要求が大きく異なり、これらを混同して処理すると、混合エキスパート(MoE)モデルアーキテクチャの構造的利点が失われることを強調している。また、多くの推論シナリオにおいて、メモリ容量よりもメモリ帯域幅の方が収益を生み出す可能性があり、アクセラレータのHBMの最適な用途は、アイドル状態のコンテキストを保存するのではなく、現在アクティブなバッチデータを保持することであると結論付けている。レポートはNVIDIA BlackwellシリーズGPUをケーススタディとして推論を展開しており、その結論はハードウェア設計者、クラウドサービスプロバイダー、モデル展開者にとって直接的な指針となる。