스캐터랩 핑퐁2023년 9월 13일AI멀티턴 이미지 대화: 조규성 vs 안정환, 루다야 누가 더 잘생겼어?생성형 VLM과 멀티턴 이미지 대화 데이터를 구축해 포토챗의 문맥 이해를 개선했습니다. 언어 모델 고정과 이미지-캡션 사전학습으로 리트리벌 모델보다 높은 성능을 확인했습니다.#VLM#GPT-2#멀티모달000