목록 보기
멀티턴 이미지 대화: 조규성 vs 안정환, 루다야 누가 더 잘생겼어?
AI

멀티턴 이미지 대화: 조규성 vs 안정환, 루다야 누가 더 잘생겼어?

스캐터랩 핑퐁
스캐터랩 핑퐁
2023년 9월 13일

두줄요약

생성형 VLM과 멀티턴 이미지 대화 데이터를 구축해 포토챗의 문맥 이해를 개선했습니다. 언어 모델 고정과 이미지-캡션 사전학습으로 리트리벌 모델보다 높은 성능을 확인했습니다.

문제 상황

  • 후보 문장만 선택하는 리트리벌 포토챗의 제한된 표현력과 이미지·텍스트 문맥 불일치
  • 단일 이미지·단일 발화 학습 데이터로 실제 멀티턴 대화 흐름 반영의 어려움

해결 방법

  • 2.3B GPT-2 기반 언어 모델 고정, 비전 인코더·프로젝션 레이어 중심의 VLM 구성
  • 번역 공개 데이터셋과 AI Hub 데이터를 포함한 15M 이미지-캡션 데이터 기반 Vision-Language Pre-training
  • 비식별화 챗 로그에서 이전 10턴·이후 3턴을 활용한 2만 건 멀티턴 이미지 대화 레이블링

성능/운영 포인트

  • 이미지 코멘팅 SSA 기준 신규 생성 모델의 리트리벌 모델 대비 In-domain 0.85 대 0.76, Out-of-domain 0.80 대 0.62
  • 이미지-코멘트 데이터 선학습 후 멀티턴 데이터 학습 전략의 Sensibleness 0.76
  • 언어 모델 고정 및 비전 인코더·프로젝션 레이어 튜닝 조합의 최고 성능

적용해볼 점

  • 이미지와 텍스트를 함께 고려하도록 레이블링하고 시간·프로필 메타데이터와의 모순 방지
  • 사전학습 입력에 복수 이미지-캡션을 결합해 멀티턴 문맥 반영 성능 강화

다음 읽기

#멀티모달 주제를 이어서 읽기

루다, 눈을 뜨다! 포토챗 베타의 멀티모달 기술 소개

친구 같은 이미지 반응을 위한 이미지 코멘팅 데이터셋과 리트리벌·생성 모델을 비교했습니다.\nSwin Transformer 기반 리트리벌 모델을 포토챗 베타에 적용하고 멀티턴·Scene Text 활용을 과제로 제시했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...