EMNLP 2022 Review
두줄요약
EMNLP 2022의 NLP 논문 14편을 대화, 검색, 생성, 평가, 데이터셋 관점에서 리뷰했습니다. 프롬프트·LLM·멀티모달 학습의 성과와 개인정보, 비용, 데이터 품질 이슈를 함께 다뤘습니다.
구조와 흐름
- EMNLP 2022 발표 논문 14편을 대화·검색·생성·평가·데이터셋 구축 관점에서 선별 리뷰
- 장기 대화 메모리 관리, 생성 기반 다단계 검색, 대화용 instruction tuning, 재귀적 스토리 생성 등 언어 모델 활용 방식 소개
선택 이유
- 프롬프트 기반 임베딩·추론, 지속 학습, 사실 지식 추적 등 LLM의 일반화·표현·학습 특성 분석
- 이미지-언어 사전학습 기반 단어 정렬과 AI-작업자 협업 기반 NLI 데이터셋 구축 사례 포함
주의할 점
- 대형 사전학습 언어 모델의 memorization 증가에 따른 개인정보 유출 가능성
- 다단계 추론의 입력 길이 증가와 계산 비용, 학습 데이터 귀속 기법의 개선 필요성
적용해볼 점
- 대화 시스템에서 기억 업데이트·삭제와 사람 평가 상관성이 높은 자동 평가 차원 활용
- 데이터 양보다 어려운 패턴과 다양성을 반영한 고품질 데이터셋 구축 검토

