AI Platform Engineer (Infra)
온프레미스·AWS·GCP 환경의 GPU 기반 Kubernetes 클러스터와 LLM 분산 서빙 인프라를 설계·구축·최적화합니다. Kubernetes 플랫폼 및 대규모 GPU 클러스터 운영, vLLM·SGLang 기반 분산 추론 운영 경험이 필요합니다.
게시일 2026년 9월 29일
공고 내용
합류하게 될 팀에 대해 알려드려요
- ML/AI Infra 팀은 토스의 모든 ML/AI 워크로드가 안정적으로 동작하도록, 든든한 인프라를 구축하고 운영하고 있어요.
- 우리가 운영하는 인프라는 단순한 클러스터 관리가 아니라, 대용량 데이터와 GPU 등 ML 고유의 요구사항을 반영해 온프레미스의 ML 전용 Kubernetes 클러스터와 AWS(EKS, EKS Hybrid), GCP를 유연하게 아우르는 멀티 클라우드 환경으로 설계돼요.
- 클라우드 GPU를 온프레미스에 편입하는 등 아직 정답이 정해지지 않은 복잡한 인프라 문제들을 다루는 만큼, 최적의 기술적 방향을 함께 고민하고 구조화해나가는 역할이 중요해요.
- 대형 LLM의 분산 서빙 구조 등 새롭고 도전적인 AI 시스템이 빠르고 안정적으로 돌아갈 수 있도록, 아키텍처들을 직접 검증하고 플랫폼 팀에 제공하고 있어요.
- 이 포지션은 토스의 대규모 LLM 모델들이 실서비스에 빠르고 안정적으로 제공될 수 있도록 분산 서빙 인프라를 구축하고 최적화하는 역할을 핵심으로 맡아요. 온프레미스와 멀티 클라우드를 아우르는 GPU 기반 Kubernetes 환경에서, LLM 서빙 아키텍처를 주도적으로 설계해 나갑니다.
합류하면 함께 할 업무에요
- 온프레미스와 멀티 클라우드(AWS, GCP) 를 아우르는 하이브리드 GPU Kubernetes 클러스터와 Istio, Cilium 기반의 네트워크 환경을 구축해요
- GPU Operator 스택을 활용한 딥다이브 트러블슈팅과 선제적인 용량 계획으로 최적의 리소스 효율을 달성해요.
- 대규모 LLM 서빙을 위해 vLLM, SGLang 등의 엔진을 다루고, NVIDIA Dynamo 기반의 분산 추론 아키텍처를 설계해요. 복잡한 서빙 워크로드를 K8s Custom Resource와 Operator 패턴을 활용해 배포 자동화 체계를 구축해요.
- LLM 분산 추론 시 발생하는 노드 간 통신과 I/O 병목을 해결하기 위해 RDMA(IB/RoCE) 기반의 고속 GPU 네트워크를 설계해요. 대용량 모델 로딩과 KV Cache 관리에 최적화된 VAST 등 고성능 AI 스토리지를 도입해 클러스터의 성능을 극대화해요.
이런 분과 함께하고 싶어요
- 5년 이상 또는 그에 준하는 인프라 역량으로, Kubernetes 기반의 공용 플랫폼을 직접 설계하고 운영해 본 분과 함께하고 싶어요.
- 대규모 GPU 클러스터 및 GPU Operator 스택 프로덕션 운영 경험이 있는 분과 함께하고 싶어요
- vLLM, SGLang 등 LLM 서빙 엔진을 활용한 대용량 트래픽 처리 및 분산 추론 인프라의 프로덕션 운영 을 해본 분과 함께하고 싶어요
- Python, Go 등을 활용한 인프라 자동화, 또는 K8s CRD/Controller 패턴을 직접 구현해 시스템을 구조적으로 추상화해 본 분이면 좋아요
- AI/ML 모델링에 대한 완벽한 도메인 지식이 없어도 괜찮아요. 탄탄한 K8s 역량과 인프라 최적화 경험을 바탕으로, 데이터 및 AI 조직과 협업하며 토스의 압도적인 LLM 시스템 생태계를 함께 고도화해 나갈 수 있으면 충분해요.
이런 분이면 더 좋아요
- NVIDIA Dynamo 등 분산 추론 아키텍처나 RDMA(IB/RoCE), NCCL 기반의 고속 GPU 네트워크 환경을 이해하고 계신 분이면 잘 맞아요.
- Volcano, Kueue 등을 활용해 대규모 멀티테넌트 GPU 자원을 스케줄링해 보셨으면 더욱 환영해요.
- 온프레미스와 퍼블릭 클라우드가 결합된 하이브리드 환경, 혹은 VAST 등 고성능 AI 스토리지를 다뤄본 경험이 있으시면 더욱 좋아요.
- 단순 운영을 넘어 DCGM 지표, XID, NVLink 등 GPU 하드웨어 레벨의 장애를 깊이 있게 분석하고 진단해 본 분이면 ML/AI Infra 팀의 방향과 완벽하게 잘 맞을 거예요.
이력서는 이렇게 작성하시는 걸 추천해요
- 진행했던 과제가 조직에 큰 영향력을 미쳤다면 그 내용을 자세히 작성해 주세요.
- 단순히 어떤 언어, 플랫폼, 프레임워크, 기술 등을 사용했는지보다는, 어떤 목적을 가진 과제였는지, 이를 해결하기 위해 무엇을 사용했는지, 어떻게 문제를 해결했는지에 대해 자세히 작성해 주세요.
- 플랫폼을 운영하면서 발생한 치명적인 장애를 해결해 보았거나, 성능/리소스 최적화를 해 본 경험이 있다면 작성해 주세요.
- 오픈소스 사용 중에 발생한 버그나 이슈를 해결해 보았거나, 부족한 기능을 개선하기 위해 오픈소스에 기여했던 경험이 있다면 작성해 주세요.
토스로의 합류여정
- 서류 접수 > 프리 인터뷰 > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런스 체크 > 처우 협의 > 최종 합격
- 프리 인터뷰에서는 지원서 기반의 주요 경험과 직무 적합도를 중심으로 면접이 진행될 예정이에요.
- 직무 인터뷰에서는 심층 기술 면접과 ML 시스템 설계를 주제로 면접이 진행될 예정이에요.
함께할 동료를 위한 한마디 > "이 포지션에 합류하시면, 단순한 GPU 클러스터 관리를 넘어 대규모 프론티어 LLM 서빙 인프라 전문가로 성장하는 경험을 얻어갈 수 있습니다.”
- NVIDIA Dynamo와 같은 최신의 분산 추론 프레임워크가 완벽하게 동작하도록 GPU 고속 네트워크와 시스템 자원을 직접 제어하고, 거대한 프론티어 모델들이 한계 없이 서빙될 수 있도록 하드웨어와 K8s 인프라 레벨에서 극한의 최적화를 이끌어내는 경험을 내 것으로 만들 수 있어요.
- 금융, 추천, 검색 등 토스의 다양한 도메인에서 쏟아지는 수천만 유저의 트래픽을 든든하게 지탱하며, LLM 서비스가 멈춤 없이 안착할 수 있는 프로덕션 레벨의 대규모 GPU 인프라 생태계를 토스에서 함께 완성해 갈 수 있습니다.


