멀티턴 이미지 대화: 조규성 vs 안정환, 루다야 누가 더 잘생겼어?
두줄요약
생성형 VLM과 멀티턴 이미지 대화 데이터를 구축해 포토챗의 문맥 이해를 개선했습니다. 언어 모델 고정과 이미지-캡션 사전학습으로 리트리벌 모델보다 높은 성능을 확인했습니다.
문제 상황
- 후보 문장만 선택하는 리트리벌 포토챗의 제한된 표현력과 이미지·텍스트 문맥 불일치
- 단일 이미지·단일 발화 학습 데이터로 실제 멀티턴 대화 흐름 반영의 어려움
해결 방법
- 2.3B GPT-2 기반 언어 모델 고정, 비전 인코더·프로젝션 레이어 중심의 VLM 구성
- 번역 공개 데이터셋과 AI Hub 데이터를 포함한 15M 이미지-캡션 데이터 기반 Vision-Language Pre-training
- 비식별화 챗 로그에서 이전 10턴·이후 3턴을 활용한 2만 건 멀티턴 이미지 대화 레이블링
성능/운영 포인트
- 이미지 코멘팅 SSA 기준 신규 생성 모델의 리트리벌 모델 대비 In-domain 0.85 대 0.76, Out-of-domain 0.80 대 0.62
- 이미지-코멘트 데이터 선학습 후 멀티턴 데이터 학습 전략의 Sensibleness 0.76
- 언어 모델 고정 및 비전 인코더·프로젝션 레이어 튜닝 조합의 최고 성능
적용해볼 점
- 이미지와 텍스트를 함께 고려하도록 레이블링하고 시간·프로필 메타데이터와의 모순 방지
- 사전학습 입력에 복수 이미지-캡션을 결합해 멀티턴 문맥 반영 성능 강화


