AI
[기술분석] AI 추론 메모리 병목과 서버 아키텍처 변화
두줄요약
장문 컨텍스트와 RAG, AI 에이전트 확산으로 추론 병목이 메모리와 데이터 이동 경로로 옮겨가고 있습니다. GPU 중심 설계보다 HBM, DRAM, SSD를 함께 보는 계층형 아키텍처가 중요하다고 설명했습니다.
핵심 내용
- 장문 컨텍스트, RAG, AI 에이전트 확산으로 추론 단계의 메모리 병목이 GPU HBM을 넘어 Host DRAM, NVMe SSD, 공유 스토리지, 네트워크까지 확장되는 흐름 정리
- KV Cache 누적과 세션 상태 관리로 인해 추론 인프라가 연산 중심에서 데이터 이동과 메모리 효율 중심 구조로 전환되는 점 설명
- HBM, DRAM, SSD, CPU, DPU, NIC를 계층형으로 구성하고, Time to First Token·캐시 적중률·메모리 사용률 같은 지표로 병목을 봐야 한다는 관점 제시
적용해볼 점
- GPU 사양만이 아니라 KV Cache 배치, 요청 스케줄링, 데이터 이동 경로까지 함께 설계
- 추론 서비스 운영 시 첫 토큰 지연시간과 캐시 재사용률, HBM·DRAM 사용량을 함께 관찰
- RAG와 Agentic AI 워크로드에 맞춰 SSD와 공유 스토리지의 지연시간·대역폭까지 검토


