AI Agent를 위한 OpenSearch 검색 품질 평가하기 (Part 1)
AI Agent 검색 품질을 OpenSearch와 Bedrock으로 정량 평가하는 방법을 다루었습니다. NDCG와 Recall, LLM Judge 검증, BM25·시멘틱·하이브리드 비교 결과를 함께 설명했습니다.

검색 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.
20개 표시
AI Agent 검색 품질을 OpenSearch와 Bedrock으로 정량 평가하는 방법을 다루었습니다. NDCG와 Recall, LLM Judge 검증, BM25·시멘틱·하이브리드 비교 결과를 함께 설명했습니다.

기업 AI가 ROI로 이어지지 않는 이유를 의미 계층의 부재로 설명했습니다. 온톨로지와 Active Ontology를 통해 맥락을 기계가 읽게 만드는 방향을 제안했습니다.
검색용 DL 모델을 3주 만에 만든 작업 경험을 공유했습니다. 코드를 거의 타이핑하지 않고 진행한 학습 방식에 초점을 맞췄습니다.
투자 정보는 적시성, 정확성, 검증 가능성이 중요해 LLM 출력만으로는 부족했습니다. 근거 선별과 절차 통제, 평가 가능한 구조를 통해 AI가 말해도 되는 상태를 운영했습니다.

통합 검색 임베딩 모델을 개발하며 9개 태스크를 고르게 학습시키는 과정을 다룬 글입니다. 본문이 일부 차단되어 세부 내용은 확인되지 않았습니다.
검색·추천 스코어링 모델을 vLLM 기반 풀링 런타임과 IO Processor로 전환해 성능을 크게 높인 사례를 소개했습니다. 전후처리 통합과 배치 최적화로 처리량과 지연 시간을 개선했습니다.
포스타입은 벡터 추천의 쿼리 비용을 줄이기 위해 HNSW 활용, 필드 최적화, 스레드 취소를 적용했습니다. 이후 전용 클러스터 분리와 차원 축소로 메모리 문제와 검색 장애를 함께 해결했습니다.

포스타입의 개인화 추천이 태그 한계를 벗어나 벡터와 하이브리드 검색으로 동작하는 방식을 설명했습니다. 오프라인 검증과 A/B 테스트를 통해 추천 성과가 개선된 사례도 함께 소개했습니다.

세 에이전트 구현 과정에서 겪은 검색 오판, 코드 분석 루프, DB 접근 안전장치를 정리했습니다. 사람 vs AI 비교로 속도와 한계도 함께 검증했습니다.

LLM이 내부 업무를 잘 답하려면 검색보다 신뢰할 수 있는 컨텍스트 관리가 필요했습니다. 문서, 코드, 메신저를 공통 단위로 정규화하고 관계와 최신성을 함께 검증하는 Topic 설계를 소개했습니다.
제품이 잘 될수록 회사의 정체성과 구조를 보여주는 브랜딩이 더 중요하다고 정리했습니다. 딜라이트룸은 홈페이지 개편으로 세 사업 구조와 조직의 온도를 함께 드러냈습니다.
라포랩스 PB팀이 4050 여성 고객을 위한 브랜드를 데이터와 현장 관찰, AI, 글로벌 소싱으로 운영하는 방식을 소개했습니다. 빠른 가설 검증과 자동화로 상품 경쟁력과 실행 속도를 높이는 사례를 담았습니다.
방대한 설계 자료를 자연어로 찾기 위해 사내 플랫폼에 AI채팅을 연동했습니다. 실무 검증에서 정답률 96%를 확인하고 검색 시간을 크게 줄였습니다.

X
미리캔버스의 여러 검색 과제를 하나의 임베딩 공간으로 묶기 위한 모델 개발 과정을 소개했습니다. 태스크별 운영의 한계를 줄이고 디자인 도메인 특성에 맞게 학습한 방식이 핵심이었습니다.
OpenSearch 3.3과 derived source로 미리캔버스 검색의 stored fields 병목과 세그먼트 병합 문제를 해결했습니다. 신규 클러스터 도메인 스위칭으로 무중단 전환하고 레이턴시와 IOPS를 크게 개선했습니다.

미리캔버스는 OpenSearch에서 시맨틱 벡터와 비주얼 벡터를 함께 쓰는 듀얼 벡터 검색을 도입했습니다. BM25 선필터와 메모리 최적화 인스턴스 전환으로 성능과 정확도를 함께 개선했습니다.

X
네이버 API를 하나의 콘솔에서 연동하고 운영할 수 있는 NAVER API HUB 출시를 소개했습니다. 하나의 키로 여러 API를 쓰고 종량제로 유연하게 사용할 수 있습니다.
검색 리랭킹의 콜드 스타트와 임베딩 공간 불일치 문제를 안정화 기법으로 해결했습니다. 오프라인과 A/B 테스트에서 성능과 매출 개선도 확인했습니다.
