목록 보기
알라꿍달라꿍의 대화요약 이모저모
AI

알라꿍달라꿍의 대화요약 이모저모

스캐터랩 핑퐁
스캐터랩 핑퐁
2022년 5월 25일

두줄요약

외부 데이터 제한 환경에서 BART 기반 한국어 대화요약 모델을 개선한 경진대회 사례를 공유했습니다. 사전학습·R3F·강화학습을 조합해 ROUGE-L 기준 성능을 높이고 본선 1위를 달성했습니다.

문제 상황

  • 한국어 대화의 분산된 핵심 정보, 잦은 주제 전환, 지시어·화자 특성으로 인한 추상 대화요약 난이도
  • 외부 데이터 사용 제한과 ROUGE-L 기반 경진대회 평가 환경

구조와 흐름

  • mecab 기반 형태소 분절과 Unigram 토크나이저, [SEP] 기반 발화 연결
  • Hugging Face BART 기반 Encoder-Decoder 생성 모델과 빔 서치 후보 생성
  • 대화 텍스트의 Token Masking·턴 단위 Sentence Permutation 사전학습 후 요약 미세조정

해결 방법

  • R3F 정규화로 입력 노이즈 전후 출력의 KL Divergence 반영
  • ROUGE-L F1 보상 기반 강화학습으로 학습 목표와 평가 지표 정렬
  • SimCLS 기반 후보 재순위화 실험과 공개 평가 형태소 분석기 차이에 따른 성능 저하 확인

성능/운영 포인트

  • Token Masking·Sentence Permutation 사전학습과 R3F, 강화학습 조합으로 본선 1위
  • Type·Topic 특수 토큰과 데이터 전처리의 성능 개선 실패
  • Ranker의 높은 내부 지표와 실제 제출 점수 간 불일치, ROUGE 계산 라이브러리 정확성 이슈

다음 읽기

#NLP 주제를 이어서 읽기

핑퐁팀과 함께하는 ACL 2020 리뷰

ACL 2020의 제출·합격률과 Generation, Dialogue 등 주요 NLP 연구 경향을 분석했습니다. 대화, 생성, BERT 최적화 관련 논문 24편의 핵심 방법과 성과를 리뷰했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...