목록 보기
TFX 머신러닝 파이프라인 사용하기
AI

TFX 머신러닝 파이프라인 사용하기

스캐터랩 핑퐁
스캐터랩 핑퐁
2022년 9월 13일

두줄요약

TFX 커스텀 컴포넌트로 신규 데이터부터 학습·모델 등록까지의 파이프라인을 구성했습니다. Apache Beam과 사내 레지스트리를 연동하는 구현·운영 주의점을 설명합니다.

문제 상황

  • 신규 데이터마다 학습·평가 과정을 수동 수행해야 하는 Continual Learning 운영 부담
  • 사내 Dataset Registry·Model Registry와 결합 가능한 학습 파이프라인 필요

구조와 흐름

  • ComponentSpec, Executor, Component Interface로 구성되는 TFX 커스텀 컴포넌트
  • 채널을 통한 아티팩트 전달과 MLMD 기반 메타데이터·실제 데이터 경로 관리
  • Dataset Registry 입력, TFRecord 변환, 스키마·변환·학습, Model Registry 등록으로 이어지는 흐름

해결 방법

  • BaseBeamComponent와 BaseBeamExecutor 기반 Apache Beam 데이터 처리 컴포넌트 구성
  • InputProcessor 확장으로 Dataset Registry의 최신 span·version 감지
  • 학습 모델 업로드와 Inferentia Neuron Compile을 위한 별도 TFX 컴포넌트 구현

주의할 점

  • Executor에서 protobuf·JSON 파라미터 역직렬화 필요
  • 아티팩트 URI의 로컬·GCS 환경 차이를 고려한 GFile 또는 io_utils 사용
  • Transform 내 Dataset·모델 객체 생성 시 tft.make_and_track_object 사용

다음 읽기

#Apache Beam 주제를 이어서 읽기

Apache Beam으로 머신러닝 데이터 파이프라인 구축하기 2편 - 개발 및 최적화

Apache Beam 파이프라인을 Composite PTransform으로 모듈화하고 병렬 처리 병목을 최적화했습니다.\nShared Object, 배치, Side Input으로 ML 추론과 Faiss 벡터 검색의 메모리·처리 문제를 다뤘습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...