
AI
AI Agent를 위한 OpenSearch 검색 품질 평가하기 (Part 1)
두줄요약
AI Agent 검색 품질을 OpenSearch와 Bedrock으로 정량 평가하는 방법을 다루었습니다. NDCG와 Recall, LLM Judge 검증, BM25·시멘틱·하이브리드 비교 결과를 함께 설명했습니다.
핵심 내용
- RAG 기반 AI Agent의 검색 품질을 정량적으로 평가하는 방법을 OpenSearch와 Bedrock으로 구축
- NDCG@10과 Recall@10을 함께 사용해 BM25, 시멘틱, 하이브리드 검색을 비교
- LLM Judge를 Gold Qrels와 교차 검증해 채점 신뢰도 확인
- 데이터셋과 언어 특성에 따라 최적 검색 방식이 달라짐을 실험으로 확인
