사내 지식으로 Agentic RAG 만들기 (3/3) : 관측 가능한 RAG, 운영되는 도구로
두줄요약
Langfuse와 이중 평가 파이프라인으로 사내 Agentic RAG의 품질·비용·지연시간을 측정했습니다. FastMCP 명세와 instructions를 다듬어 도구 활용 정확도를 개선하고 운영 환경에 제공했습니다.
문제 상황
- 자연어 입출력 특성으로 RAG 답변의 정확성·근거 적합성·호출 비용 판단 난점
- 검색 오류와 생성 오류를 분리하지 못하는 단일 관측의 한계
해결 방법
- Langfuse trace로 검색·프롬프트 조립·생성 단계의 입력·출력·토큰·비용 추적
- Recall@5·Hit Rate·MRR 검색 지표와 LLM-as-a-judge 정확도 평가의 이중 파이프라인 구축
- FastMCP 기반 원격 MCP 서버와 서버 instructions를 통한 도구 오케스트레이션 안내
성능/운영 포인트
- 모든 변경 전 3회 이상 실험으로 정확도·지연시간·토큰·비용 평균 비교
- 중복 instructions 축소, 단건 문서 읽기, 경로 대신 고유 ID 사용으로 모델별 정확도 3~9%p 개선
- 전사 Confluence·Jira 대상 하루 3회 증분 반영과 Slack 기술지원봇·사내 에이전트·개인 개발 환경 제공
적용해볼 점
- 에이전트 도구명·docstring·파라미터 형식을 성능에 직접 영향을 주는 프롬프트로 관리
- 검색 품질과 최종 답변 품질을 분리 측정하고 평가셋 기반으로 변경 사항 검증



