AI
알라꿍달라꿍의 대화요약 이모저모
두줄요약
외부 데이터 제한 환경에서 BART 기반 한국어 대화요약 모델을 개선한 경진대회 사례를 공유했습니다. 사전학습·R3F·강화학습을 조합해 ROUGE-L 기준 성능을 높이고 본선 1위를 달성했습니다.
문제 상황
- 한국어 대화의 분산된 핵심 정보, 잦은 주제 전환, 지시어·화자 특성으로 인한 추상 대화요약 난이도
- 외부 데이터 사용 제한과 ROUGE-L 기반 경진대회 평가 환경
구조와 흐름
- mecab 기반 형태소 분절과 Unigram 토크나이저,
[SEP]기반 발화 연결 - Hugging Face BART 기반 Encoder-Decoder 생성 모델과 빔 서치 후보 생성
- 대화 텍스트의 Token Masking·턴 단위 Sentence Permutation 사전학습 후 요약 미세조정
해결 방법
- R3F 정규화로 입력 노이즈 전후 출력의 KL Divergence 반영
- ROUGE-L F1 보상 기반 강화학습으로 학습 목표와 평가 지표 정렬
- SimCLS 기반 후보 재순위화 실험과 공개 평가 형태소 분석기 차이에 따른 성능 저하 확인
성능/운영 포인트
- Token Masking·Sentence Permutation 사전학습과 R3F, 강화학습 조합으로 본선 1위
- Type·Topic 특수 토큰과 데이터 전처리의 성능 개선 실패
- Ranker의 높은 내부 지표와 실제 제출 점수 간 불일치, ROUGE 계산 라이브러리 정확성 이슈
