목록 보기
레거시 GPU에 날개 달기: 극한의 서빙 최적화 가이드
AI

레거시 GPU에 날개 달기: 극한의 서빙 최적화 가이드

네이버 D2
네이버 D2
2025년 7월 17일

두줄요약

BERT 기반 SPLADE 모델의 대규모 실시간 서빙 최적화 방법을 소개했습니다. FlashTokenizer와 전/후처리, 추론 최적화로 레거시 GPU 성능을 끌어올린 사례입니다.

핵심 내용

  • BERT 기반 SPLADE 모델의 대규모 실시간 서비스 최적화 사례
  • FlashTokenizer 개발 배경과 성능 소개
  • 모델 단순화, 전/후처리, 추론 최적화, 서비스 적용까지의 흐름
  • 레거시 GPU 환경에서 서빙 성능 개선 중심의 발표 세션

다음 읽기

#LLM 주제를 이어서 읽기

Ray를 활용한 GPU Util 100% MLOps: 배치처리부터 모델 서빙까지

Ray를 활용해 GPU Util 100% 배치 처리와 확장 가능한 모델 서빙 아키텍처를 소개했습니다. Ray Serve와 vLLM 기반 LLM 추론 파이프라인 및 운영 사례도 다뤘습니다.

네이버 D2
네이버 D2
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...