국내 IT 기업 기술 블로그 최신 글

NEW FEATURE

기술을 읽던 곳에서, 다음 기회를 만나세요.

채용 검색부터 관심사 기반 추천, 내 적합도까지.

새로운 기술 블로그가 추가되었어요

필터 1
새로운 루다를 지탱하는 모델 서빙 아키텍처 — 3편: 안정적인 LLM 서비스를 위한 서빙 최적화 기법
스캐터랩 핑퐁
AI

새로운 루다를 지탱하는 모델 서빙 아키텍처 — 3편: 안정적인 LLM 서비스를 위한 서빙 최적화 기법

LLM 서빙 비용을 줄이기 위한 추론 최적화 기법과 CPU·GPU·IPU 서빙 방식을 정리했습니다. Latency-RPS 부하 테스트로 지연시간·처리량·인스턴스 비용을 평가하는 방법을 제시합니다.

#LLM#GPU
000
샘 알트만과 따로 만나 1시간 동안 나눈 이야기
스캐터랩 핑퐁
AI

샘 알트만과 따로 만나 1시간 동안 나눈 이야기

OpenAI 서울 라운드테이블에서 API 플랫폼 전략과 LLM 제품화 과제를 공유했습니다.\nGPU, 환각, 비용, 데이터, 경쟁력 관점의 실무적 논의를 정리했습니다.

#OpenAI#LLM
000
Kurly만의 MLOps 구축하기 - 초석 다지기
마켓컬리
AI

Kurly만의 MLOps 구축하기 - 초석 다지기

Kubernetes 기반 MLOps 환경에서 GPU 자원 운영 부담을 줄이기 위한 기반을 설계했습니다. Karpenter와 NVDP로 GPU 노드의 자동 생성·회수 흐름을 구성했습니다.

#MLOps#Kubernetes
000
Kurly만의 MLOps 구축하기 - 초석 다지기
마켓컬리
데브옵스

Kurly만의 MLOps 구축하기 - 초석 다지기

컬리의 MLOps 구축 초기에 GPU 노드 자동화와 Karpenter 도입 과정을 소개했습니다. NVDP, affinity, consolidation 이슈까지 포함해 운영 포인트를 정리했습니다.

#MLOps#Kubernetes
3900
온프레미스 쿠버네티스에서 NAS, GPU 사용하기 (with RKE2, NFS, gpu-operator)
오토피디아
데브옵스

온프레미스 쿠버네티스에서 NAS, GPU 사용하기 (with RKE2, NFS, gpu-operator)

온프레미스 쿠버네티스에서 NAS와 GPU를 함께 쓰는 구성을 다뤘습니다. RKE2, NFS, gpu-operator를 활용한 클러스터 구축 맥락을 소개했습니다.

#Kubernetes#Docker
3800
AWS Inferentia 를 이용한 모델 서빙 비용 최적화: 모델 서버 비용 2배 줄이기 1탄
스캐터랩 핑퐁
AI

AWS Inferentia 를 이용한 모델 서빙 비용 최적화: 모델 서버 비용 2배 줄이기 1탄

AWS Inferentia로 TensorFlow RoBERTa 모델을 컴파일하고 GPU 인스턴스와 비용·성능을 비교했습니다. 1000RPS 기준 Inferentia의 높은 비용 효율과 동적 그래프 제약을 함께 정리했습니다.

#AWS Inferentia#TensorFlow
000
쿠팡 파트너스

광고

개발자를 위한 서적을 확인해 보세요

이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

#개발서적#프로그래밍
온프레미스 쿠버네티스 프로덕션 환경 10개월 운영기
오토피디아
데브옵스

온프레미스 쿠버네티스 프로덕션 환경 10개월 운영기

RKE2 기반 온프레미스 Kubernetes 클러스터의 고가용성 설계와 10개월 운영 경험을 공유했습니다.\n노드 역할 분배, NAS·Cloud SQL 스토리지 분리, Route53 장애 대응의 한계도 정리했습니다.

#Kubernetes#RKE2
4300