Velopers
모든 블로그모든 태그채용정보NEW공지주간 인기글주간 기술 흐름

국내 IT 기업 기술 블로그 최신 글

오늘 새 글

7개

오늘 조회수

1,166회

최근 7일 인기 글Jev로 AI 글 냄새 잡기 - 판정 모델을 교정 파이프라인 세 곳에 붙인 기록데보션 · 119회최근 30일 활발한 블로그넥스트리38개 발행 · 총 140개 · 10,052회
필터 1
새로운 루다를 지탱하는 모델 서빙 아키텍처 — 3편: 안정적인 LLM 서비스를 위한 서빙 최적화 기법
스캐터랩 핑퐁
2023년 8월 16일
AI

새로운 루다를 지탱하는 모델 서빙 아키텍처 — 3편: 안정적인 LLM 서비스를 위한 서빙 최적화 기법

LLM 서빙 비용을 줄이기 위한 추론 최적화 기법과 CPU·GPU·IPU 서빙 방식을 정리했습니다. Latency-RPS 부하 테스트로 지연시간·처리량·인스턴스 비용을 평가하는 방법을 제시합니다.

#LLM#GPU
000

Powered by Velopers

이용약관개인정보처리방침공지사항