목록 보기
Metric & Loss for Multi-label Problem
AI

Metric & Loss for Multi-label Problem

모히톡
모히톡
2020년 9월 10일

두줄요약

Multi-label 분류에서 Prec@k와 Rec@k를 높이는 최적 점수 순위의 차이를 설명했습니다.\n목표 지표에 따라 OVA·PAL 또는 정규화 reduction을 선택해야 함을 정리했습니다.

구조와 흐름

  • 다중 클래스와 달리 하나의 샘플에 여러 레이블이 공존하는 multi-label classification
  • 레이블 조합 전체 확률 예측의 지수적 출력 크기 문제를 레이블별 점수 예측으로 축소
  • 상위 k개 레이블 선택을 기준으로 Prec@k와 Rec@k 정의

선택 이유

  • Prec@k 최적화에 필요한 레이블별 조건부 확률 순위
  • Rec@k 최적화에 필요한 양성 레이블 수를 반영한 조건부 확률 순위
  • 지표별 최적 scorer 순서 차이

해결 방법

  • 레이블별 이진 분류 기반 OVA와 multi-class 접근 PAL
  • 양성 레이블 개수로 영향을 정규화한 OVA-n과 PAL-n
  • OVA·PAL과 Prec@k, OVA-n·PAL-n과 Rec@k의 최적 scorer 대응

적용해볼 점

  • 문제의 핵심 평가 기준을 Prec@k 또는 Rec@k 중 우선 선택
  • 목표 지표에 맞춘 reduction과 logistic loss·softmax cross entropy 조합 구성

다음 읽기

#ML 주제를 다룬 다른 회사 글

오픈챗 해시태그 예측을 위한 다중 레이블 분류 모델 개발하기

오픈챗 이름과 설명을 바탕으로 해시태그를 예측하는 다중 레이블 분류 모델 개발 과정을 소개했습니다. 또한 MMR과 임계치 조정으로 실시간 추천과 오프라인 태깅의 요구를 각각 맞췄습니다.

라인
라인
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...