목록 보기
루다, 눈을 뜨다! 포토챗 베타의 멀티모달 기술 소개
AI

루다, 눈을 뜨다! 포토챗 베타의 멀티모달 기술 소개

스캐터랩 핑퐁
스캐터랩 핑퐁
2022년 11월 9일

두줄요약

친구 같은 이미지 반응을 위한 이미지 코멘팅 데이터셋과 리트리벌·생성 모델을 비교했습니다.\nSwin Transformer 기반 리트리벌 모델을 포토챗 베타에 적용하고 멀티턴·Scene Text 활용을 과제로 제시했습니다.

문제 상황

  • 사진을 인식하지 못해 정해진 무관한 답변만 가능했던 기존 루다
  • 이미지 캡셔닝이 아닌 친구 간 메신저 반응을 목표로 한 이미지 코멘팅 태스크 정의

구조와 흐름

  • AI Hub와 Open Images Dataset 기반 이미지 수집 및 친구 같은 응답 가이드라인 레이블링
  • CLIP 기반 듀얼 인코더 리트리벌 모델과 Vision encoder-Text decoder 생성 모델 비교
  • ViT·Swin Transformer·BEiT·DeiT Vision encoder별 정량·정성 평가

선택 이유

  • 리트리벌 모델의 후보 문장 선택 방식으로 구체적이고 이미지에 부합하는 답변 확보
  • Swin Transformer 기반 리트리벌 모델의 가장 높은 정량 성능 및 SSA 결과

트레이드오프

  • 리트리벌 모델의 높은 적합성·구체성 대비 답변 DB 표현력과 Out-domain 대응 한계
  • 생성 모델의 자유로운 표현 가능성 대비 범용적 답변 경향과 낮은 구체성
  • 멀티턴 멀티모달 문맥 및 Scene Text 활용을 통한 자연스러운 후속 대화 연구 방향

다음 읽기

#멀티모달 주제를 이어서 읽기

멀티턴 이미지 대화: 조규성 vs 안정환, 루다야 누가 더 잘생겼어?

생성형 VLM과 멀티턴 이미지 대화 데이터를 구축해 포토챗의 문맥 이해를 개선했습니다. 언어 모델 고정과 이미지-캡션 사전학습으로 리트리벌 모델보다 높은 성능을 확인했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...