[클로바시선 #58] 속도와 비용의 열쇠: 멀티모달 AI 학습을 갉아먹는 ‘이미지 토큰 불균형’ 이야기
이미지 토큰 편차로 발생한 멀티모달 학습 GPU 부하 불균형을 분석했습니다. Pack 재배치와 통신 오버랩으로 품질 저하 없이 처리량을 13.3% 높였습니다.
새로운 기술 블로그가 추가되었어요
이미지 토큰 편차로 발생한 멀티모달 학습 GPU 부하 불균형을 분석했습니다. Pack 재배치와 통신 오버랩으로 품질 저하 없이 처리량을 13.3% 높였습니다.


텍스트 기반 문서 검색의 한계를 보완하기 위해 ColPali와 ColQwen의 시각적 문서 검색 방식을 소개했습니다. 긴 배너 이미지는 청킹과 그룹핑으로 보완하며 Baseline을 구성했습니다.


Sim-to-Real과 Real-to-Sim이 Physical AI의 현실 적용을 가로막는 격차를 어떻게 줄이는지 설명했습니다. 시뮬레이션 충실도와 합성 데이터 파이프라인이 VLA 성능을 좌우한다고 정리했습니다.

Agentic Workflow로 BMS 도면 분석을 자동화한 사례를 소개했습니다. 도면 패칭과 암묵지 추론을 결합해 2~3일 걸리던 작업을 10분으로 줄였습니다.

NeurIPS 2025에서 다뤄진 AI 가드레일 연구 흐름을 정책 코드화, 멀티모달 안전성, 프롬프트 인젝션 방어 관점에서 정리했습니다. 실서비스에서 안전성과 사용성을 함께 만족시키는 방향으로 가드레일이 진화하고 있음을 설명했습니다.
무신사는 VLM 기반 자동화가 늘어도 사람의 검증과 기준 조정이 필요하다고 보았습니다. 이를 위해 실험·검증·평가를 하나로 묶는 VLMOps 어드민을 구축해 효율과 품질을 높였습니다.


단일 LLM 중심에서 벗어나 특화 모델을 조합하는 AI 아키텍처 전환을 설명했습니다.비용, 지연 시간, 정확성, 보안 한계를 줄이기 위한 오케스트레이션 전략을 정리했습니다.


VLM의 개념과 최신 기술 동향, 주요 기업의 개발 흐름을 종합적으로 정리했습니다. 문서 AI 도입 시 특화 모델과 데이터 전략, 인프라 비용을 함께 고려할 필요가 있습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

VLM과 LLM을 활용해 멀티모달 학습 데이터를 만드는 방법을 소개했습니다. OCR, 프롬프트 엔지니어링, 후처리로 수작업 라벨링의 비용과 시간을 줄였습니다.

네이버 홈피드 썸네일을 AI와 VLM으로 개선해 CTR을 높인 사례를 소개했습니다. 기술 적용과 함께 예쁜 썸네일의 기준을 분석한 점이 핵심입니다.

생성형 VLM과 멀티턴 이미지 대화 데이터를 구축해 포토챗의 문맥 이해를 개선했습니다. 언어 모델 고정과 이미지-캡션 사전학습으로 리트리벌 모델보다 높은 성능을 확인했습니다.