
AI
Amazon Bedrock을 이용해 Amazon Rufus 구현해보기
두줄요약
Amazon Bedrock과 AWS 서비스 조합으로 Rufus 같은 쇼핑 어시스턴트를 구현하는 방법을 소개했습니다. Tool 최적화, 컨텍스트 사전 로딩, prompt caching으로 응답 속도를 줄이는 방식을 설명했습니다.
핵심 내용
- Amazon Bedrock과 AWS 서비스 조합으로 Rufus 같은 쇼핑 어시스턴트 구현 사례 정리
- 상품 검색, 주문 조회, 리뷰 활용, 스트리밍 응답, 다음 대화 추천까지의 구성 요소 소개
- 전용 LLM 없이도 응답 속도와 기능을 함께 확보하는 최적화 접근 제시
구조와 흐름
- Bedrock, DynamoDB, OpenSearch, API Gateway, Strands Agent를 활용한 통합 아키텍처
- 다양한 데이터 소스를 Lambda와 API 호출로 연결해 기존 시스템 재사용
- 상품/주문 응답을 특수 토큰으로 분리해 텍스트와 구조화 데이터를 함께 전달
성능/운영 포인트
- TTFT와 TPS 관점에서 응답 지연 원인 분석
- Tool 호출 최소화, 컨텍스트 사전 로딩, prompt caching으로 토큰과 지연 시간 절감
- 검색과 리뷰 조회 통합으로 LLM 호출 횟수 감소 및 응답 시간 단축
적용해볼 점
- 반복 조회 데이터는 미리 컨텍스트에 넣어 즉시 응답 가능하게 구성
- 스트리밍 응답에 구분자를 두어 카드형 UI와 텍스트를 분리 처리
- 캐싱과 재사용 중심으로 쇼핑 어시스턴트의 체감 속도 개선
