研究機構SemiAnalysis於9月22日發佈深度技術報告,系統拆解了AI大模型推理服務的底層架構。報告指出,推理服務並非一個整體,而是由預填充(Prefill)、中間填充(Midfill)、解碼注意力(Decode Attention)和解碼專家(Decode Experts)四個工作階段構成的“Token工廠”。

該分析框架強調,每個階段對算力、內存帶寬和網絡的需求截然不同,混同處理將損失混合專家(MoE)模型架構的結構性優勢。報告還得出結論,在許多推理場景下,內存帶寬比內存容量更能創造收益,加速器HBM的最優用途是承載當前活躍批次數據,而非存儲閒置上下文。報告以英偉達Blackwell系列GPU為案例進行推演,其結論對硬件設計者、雲服務商和模型部署方均具有直接指導意義。