
Beauty Domain-Specific Pre-trained Language Model 개발하기
두줄요약
뷰티 리뷰·제품 정보와 공개 데이터를 학습한 도메인 특화 ELECTRA 기반 PLM 개발 과정을 소개했습니다.\n리뷰 분류 성능을 높이고 검수 자동화와 제품 속성 추출에 적용했습니다.
구조와 흐름
- 한국어 공개 데이터와 화해 리뷰·제품 정보로 구성한 약 60GB 뷰티 말뭉치
- 도메인 특성을 반영한 전처리, WordPiece 토크나이저 학습, 7만 5천 개 vocab 선정
- ELECTRA-Base 사전학습, Hugging Face 포팅, downstream task fine-tuning 흐름
선택 이유
- 문맥 이해와 적은 task-specific 데이터 기반 전이학습이 가능한 PLM 활용
- 일반 도메인 데이터와 뷰티 도메인 데이터를 함께 학습하는 도메인 특화 접근
- BERT와 유사한 성능 대비 전체 토큰 학습 구조로 학습 효율이 높은 ELECTRA 선택
성능/운영 포인트
- [UNK] 비율, special token 보존율, biLSTM 벤치마크 기반 vocab 품질 평가
- TPU 기반 200만 step 학습과 약 10일의 학습 시간
- 리뷰 장단점 분류 정확도 96.03%, 일반 PLM 대비 약 3~4% 향상
적용해볼 점
- 미사용 리뷰 확률 기반 정렬과 블라인드 처리로 검수 대상 축소
- 리뷰 속성 추출 기반 제품 메타데이터 확보
- 추천·검색 영역으로의 자연어처리 활용 확대


