연구 기관 SemiAnalysis는 9월 22일 AI 대규모 모델 추론 서비스의 기본 아키텍처를 체계적으로 분석한 심층 기술 보고서를 발표했습니다. 보고서는 추론 서비스가 단일체가 아니라 사전 채우기(Prefill), 중간 채우기(Midfill), 디코드 어텐션(Decode Attention), 디코드 전문가(Decode Experts)의 네 가지 작업 단계로 구성된 "토큰 팩토리"라고 지적했습니다.

이 분석 프레임워크는 각 단계가 해시레이트, 메모리 대역폭 및 네트워크에 대한 요구 사항이 현저히 다르며, 이를 혼합하여 처리하면 MoE(혼합 전문가) 모델 아키텍처의 구조적 이점을 잃게 될 것이라고 강조했습니다. 보고서는 또한 많은 추론 시나리오에서 메모리 대역폭이 메모리 용량보다 더 많은 수익을 창출하며, 가속기 HBM의 최적 용도는 현재 활성 배치 데이터를 로드하는 것이지 유휴 컨텍스트를 저장하는 것이 아니라는 결론을 내렸습니다. 보고서는 엔비디아 Blackwell 시리즈 GPU를 사례로 들어 추론했으며, 그 결론은 하드웨어 설계자, 클라우드 서비스 제공업체 및 모델 배포자 모두에게 직접적인 지침을 제공합니다.