
Harness를 이용해 LLM 애플리케이션 평가 자동화하기
LLM 애플리케이션의 변동성과 복잡성을 줄이기 위해 테스트와 평가를 자동화하는 방법을 소개했습니다. Harness를 커스텀해 프롬프트, 지표, 아웃풋별 평가를 동적으로 처리하는 파이프라인을 구성했습니다.
새로운 기술 블로그가 추가되었어요

LLM 애플리케이션의 변동성과 복잡성을 줄이기 위해 테스트와 평가를 자동화하는 방법을 소개했습니다. Harness를 커스텀해 프롬프트, 지표, 아웃풋별 평가를 동적으로 처리하는 파이프라인을 구성했습니다.


T멤버십 영화예매 에이전트에 LLM Workflow를 적용한 과정을 소개했습니다. 엔티티 추출, 상태 관리, 개인화 반영으로 멀티턴 대화 품질을 높인 사례입니다.


Node.js와 llama-node로 로컬에서 동작하는 간단한 AI 텍스트 생성 서버를 구성했습니다. 복잡한 설정 없이 프롬프트 입력과 응답 생성을 빠르게 시험해볼 수 있습니다.


숙소 리뷰에서 핵심 정보만 뽑아 보여주기 위해 Gen AI 기반 리뷰 하이라이트를 구현했습니다.전처리와 프롬프트 개선, 사람의 검수를 거쳐 숙소별 TOP 키워드를 자동 추출했습니다.

생성형 AI를 QA 업무에 적용해 요구 사항 분석과 테스트 케이스 작성, 결함 분석의 효율을 높이는 방법을 소개했습니다. 다만 복합 케이스와 최종 검증은 수작업 보완이 필요하다고 정리했습니다.
![[에이닷 미디어 에이전트] 대화형 콘텐츠 탐색은 어디까지 왔을까](https://devocean.sk.com/thumnail/2024/10/31/3ae82ea55358fe590deb04dd7f3fc5c5017c61a18a2863712d1a416ac10aa6a3.jpg)

에이닷 미디어 에이전트의 대화형 콘텐츠 탐색 구조와 핵심 기술을 설명했습니다. LLM, RAG, 선제 추천을 활용해 개인화된 검색 경험을 강화했습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.


LLM과 sLLM의 자체 품질 평가 필요성을 정리하고, 리더보드 사례와 함께 LLM을 활용한 평가 프로세스를 설계한 글입니다. 프롬프트 일관성과 평가 기준 관리 같은 운영 과제도 함께 다뤘습니다.


프롬프트 엔지니어링의 개념과 구성 요소, 작성 순서, 대표 기법을 정리했습니다. 공공문서 자동화 사례를 통해 실무 적용 가능성도 함께 살펴봤습니다.


베스트 리뷰 요약의 범용성·시의성 한계를 해결하기 위해 LLM 리뷰 선별을 실험했습니다. CoT와 판단 근거 응답을 적용해 검수 정확성과 결론의 투명성을 높였습니다.


AWS Bedrock과 Claude 3.5 Sonnet으로 상품 이미지 자동 검수 시스템을 구축한 사례를 다뤘습니다. 프롬프트 최적화와 운영 통제를 통해 정확도와 처리 속도를 개선했습니다.


에이닷의 선톡 기능을 Context 수집·가공·활용과 평가 시스템으로 구현한 방식을 소개했습니다. 사용자 반응과 피로도를 함께 고려해 먼저 말을 거는 개인화를 고도화했습니다.


LLM이 다른 LLM의 응답 품질을 평가하는 LLM-as-a-Judge 방법을 소개했습니다. 프롬프트를 단순화하고 평가 이유를 요구하면 인간 평가와의 일치도가 크게 높아졌습니다.


에이닷의 LLM 품질 평가 자동화와 SPeCTRA 기준 도입 사례를 소개했습니다. 사람 평가와 자동 평가를 병행해 QA 효율과 모델 개선 주기를 높였습니다.
![[신청 시작] 8월 우아한테크세미나: 생성AI로 똑똑하게 일하는 법](https://techblog.woowahan.com/wp-content/uploads/2021/06/screenshot.jpg)

8월 우아한테크세미나의 신청 안내와 세션 구성을 소개했습니다. 생성형 AI 활용법과 로컬 LLM 사례를 중심으로 발표 내용을 예고했습니다.