
AI
VLM을 이용한 시각적 문서 검색: ColPali와 ColQwen
두줄요약
텍스트 기반 문서 검색의 한계를 보완하기 위해 ColPali와 ColQwen의 시각적 문서 검색 방식을 소개했습니다. 긴 배너 이미지는 청킹과 그룹핑으로 보완하며 Baseline을 구성했습니다.
핵심 내용
- 텍스트 기반 문서 검색의 한계와 VLM 기반 시각적 문서 검색의 필요성 정리
- ColPali·ColQwen의 Late Interaction Multi-Vector 구조와 MaxSim 검색 방식 소개
- T 월드 이벤트 배너로 Baseline을 구성하며 시각 정보만으로 검색하는 흐름 검증
- 긴 이미지의 token 제한, 중복 결과, 점수 임계값 문제를 청킹·그룹핑·비율 기준으로 보완
적용해볼 점
- 표·차트·배너처럼 시각 맥락이 중요한 문서에 이미지 기반 검색 적용 검토
- 긴 문서는 chunking과 overlap으로 해상도 손실 완화
- 검색 결과는 원본 그룹 단위로 묶고, MaxSim 점수는 상대 기준과 하한을 함께 활용

