TensorFlow TPU 학습 101
두줄요약
TensorFlow 2.0에서 XLA와 TPUStrategy로 TPU 학습을 구성하는 과정을 정리했습니다.\nColab·GCP 사용법과 연결 불안정, 과금 관리 시 주의점을 설명합니다.
구조와 흐름
- TPU의 대규모 선형대수 연산 가속과 온칩 고대역폭 메모리 기반 데이터 처리
- XLA의 JIT 컴파일 기반 그래프 분석, 연산 결합, 중간 메모리 할당 감소
- TPUClusterResolver 연결·초기화 후 TPUStrategy 범위에서 Keras 모델 컴파일 및 학습
선택 이유
- TensorFlow 2.0의 권장 방식인 TPUStrategy 활용
- Colab의 무료 TPU 환경과 GCP의 유료 Cloud TPU 환경 구분
- 연구자 대상 TFRC의 TPU 리소스 지원 프로그램 소개
주의할 점
- Metric 초기화와 모델 compile·fit 작업의 strategy.scope() 내부 배치 필요
- Colab TPU의 선점형 제공 및 연결 불안정으로 인한 세션 종료 가능성
- GCP TPU 생성 시점부터 과금 시작, 학습 후 ctpu delete를 통한 리소스 종료 필요

