목록 보기
Beauty Domain-Specific Pre-trained Language Model 개발하기
AI

Beauty Domain-Specific Pre-trained Language Model 개발하기

화해
화해
2021년 6월 29일

두줄요약

뷰티 리뷰·제품 정보와 공개 데이터를 학습한 도메인 특화 ELECTRA 기반 PLM 개발 과정을 소개했습니다.\n리뷰 분류 성능을 높이고 검수 자동화와 제품 속성 추출에 적용했습니다.

구조와 흐름

  • 한국어 공개 데이터와 화해 리뷰·제품 정보로 구성한 약 60GB 뷰티 말뭉치
  • 도메인 특성을 반영한 전처리, WordPiece 토크나이저 학습, 7만 5천 개 vocab 선정
  • ELECTRA-Base 사전학습, Hugging Face 포팅, downstream task fine-tuning 흐름

선택 이유

  • 문맥 이해와 적은 task-specific 데이터 기반 전이학습이 가능한 PLM 활용
  • 일반 도메인 데이터와 뷰티 도메인 데이터를 함께 학습하는 도메인 특화 접근
  • BERT와 유사한 성능 대비 전체 토큰 학습 구조로 학습 효율이 높은 ELECTRA 선택

성능/운영 포인트

  • [UNK] 비율, special token 보존율, biLSTM 벤치마크 기반 vocab 품질 평가
  • TPU 기반 200만 step 학습과 약 10일의 학습 시간
  • 리뷰 장단점 분류 정확도 96.03%, 일반 PLM 대비 약 3~4% 향상

적용해볼 점

  • 미사용 리뷰 확률 기반 정렬과 블라인드 처리로 검수 대상 축소
  • 리뷰 속성 추출 기반 제품 메타데이터 확보
  • 추천·검색 영역으로의 자연어처리 활용 확대

다음 읽기

#NLP 주제를 이어서 읽기

딥러닝으로 리뷰에서 제품 속성 정보 추출하기

비정형 화장품 리뷰에서 약 80개 제품 속성을 추출하는 멀티 출력 딥러닝 모델을 개발했습니다.\n토픽 추가와 운영 부담을 줄이고, 0.85~0.95 정확도 및 제품 특성 검증 결과를 확인했습니다.

화해
화해
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...