研究机构SemiAnalysis于9月22日发布深度技术报告,系统拆解了AI大模型推理服务的底层架构。报告指出,推理服务并非一个整体,而是由预填充(Prefill)、中间填充(Midfill)、解码注意力(Decode Attention)和解码专家(Decode Experts)四个工作阶段构成的“Token工厂”。

该分析框架强调,每个阶段对算力、内存带宽和网络的需求截然不同,混同处理将损失混合专家(MoE)模型架构的结构性优势。报告还得出结论,在许多推理场景下,内存带宽比内存容量更能创造收益,加速器HBM的最优用途是承载当前活跃批次数据,而非存储闲置上下文。报告以英伟达Blackwell系列GPU为案例进行推演,其结论对硬件设计者、云服务商和模型部署方均具有直接指导意义。