AI
루다, 눈을 뜨다! 포토챗 베타의 멀티모달 기술 소개
두줄요약
친구 같은 이미지 반응을 위한 이미지 코멘팅 데이터셋과 리트리벌·생성 모델을 비교했습니다.\nSwin Transformer 기반 리트리벌 모델을 포토챗 베타에 적용하고 멀티턴·Scene Text 활용을 과제로 제시했습니다.
문제 상황
- 사진을 인식하지 못해 정해진 무관한 답변만 가능했던 기존 루다
- 이미지 캡셔닝이 아닌 친구 간 메신저 반응을 목표로 한 이미지 코멘팅 태스크 정의
구조와 흐름
- AI Hub와 Open Images Dataset 기반 이미지 수집 및 친구 같은 응답 가이드라인 레이블링
- CLIP 기반 듀얼 인코더 리트리벌 모델과 Vision encoder-Text decoder 생성 모델 비교
- ViT·Swin Transformer·BEiT·DeiT Vision encoder별 정량·정성 평가
선택 이유
- 리트리벌 모델의 후보 문장 선택 방식으로 구체적이고 이미지에 부합하는 답변 확보
- Swin Transformer 기반 리트리벌 모델의 가장 높은 정량 성능 및 SSA 결과
트레이드오프
- 리트리벌 모델의 높은 적합성·구체성 대비 답변 DB 표현력과 Out-domain 대응 한계
- 생성 모델의 자유로운 표현 가능성 대비 범용적 답변 경향과 낮은 구체성
- 멀티턴 멀티모달 문맥 및 Scene Text 활용을 통한 자연스러운 후속 대화 연구 방향
