

LLM을 믿기 전에, 의심부터 했습니다
LLM이 만든 결과를 그대로 믿지 않고, JSON Schema와 Validator로 원문 근거를 검증하는 구조를 소개했습니다. 누락은 질문으로 남기고, 오류 응답과 실행 기록을 보존해 회귀 평가에 활용했습니다.
새로운 기술 블로그가 추가되었어요


LLM이 만든 결과를 그대로 믿지 않고, JSON Schema와 Validator로 원문 근거를 검증하는 구조를 소개했습니다. 누락은 질문으로 남기고, 오류 응답과 실행 기록을 보존해 회귀 평가에 활용했습니다.


LLM 기능을 단순 연결하는 대신 Workflow Loop와 Domain Adapter로 판단과 실행 책임을 분리했습니다. 사용자 Interaction과 스냅샷 승인까지 구조화해 Agentic Workflow의 재개와 검증을 안정화했습니다.

9월 넷째 주 Google for Developers의 주요 업데이트를 모아 소개했습니다. AI, Android, Flutter 관련 새 소식과 번역본 안내를 함께 전했습니다.

같은 PR도 LLM과 프롬프트에 따라 놓치는 결함이 달라질 수 있음을 짚었습니다. 여러 LLM을 동시에 활용해 관점별 코드리뷰를 시도하는 Code Review War를 소개했습니다.

장문 컨텍스트와 RAG, AI 에이전트 확산으로 추론 병목이 메모리와 데이터 이동 경로로 옮겨가고 있습니다. GPU 중심 설계보다 HBM, DRAM, SSD를 함께 보는 계층형 아키텍처가 중요하다고 설명했습니다.


루프 엔지니어링과 Claude Code /goal의 동작 원리를 분석하고, Stop 훅으로 유사 기능을 재구현한 사례를 정리했습니다. 완료 조건을 측정 가능하게 설계하고 예외 종료를 함께 준비하는 것이 핵심이라고 설명했습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

매주 반복되던 스모크 테스트를 자동화하고, 실패 원인 분석과 복구까지 맡기는 토스닥터 V2를 소개했습니다. 사람은 검증할 대상과 자동화 범위 설계에 더 집중할 수 있게 됐습니다.


쿠버네티스와 AWS EKS를 활용해 LLM 추론 인프라를 안정적으로 운영하는 방법을 설명했습니다. 특히 KV 캐시를 고려한 라우팅과 prefill/decode 분리를 통해 성능과 비용을 함께 개선하는 흐름을 다뤘습니다.

AI Pick 카드 생성 품질을 높이기 위해 SFT 이후 정렬 학습과 평가 지표를 설계한 과정을 공유했습니다. 형식 검증기와 NLL 프록시로 선호 쌍을 만들고 DPO, GRPO로 품질과 형식을 함께 개선했습니다.

Google for Developers의 9월 셋째 주 주요 업데이트를 분야별로 정리한 공지입니다. AI, Android, Firebase 등에서 새롭게 공개된 소식을 한눈에 확인할 수 있습니다.

AI 에이전트로 광고 분석 리포트를 자동 생성하되, 계산과 해석을 분리해 신뢰성을 높였습니다. 섹션별 컨텍스트 분리와 평가 루프로 품질을 운영 가능하게 만들었습니다.


AI 에이전트의 작업 흐름을 커밋 메시지와 세션 기록으로 관측 가능하게 만드는 방법을 정리했습니다. 신고 기반 집계와 파생 판정을 통해 새 저장소에서도 즉시 지표가 나오도록 구성했습니다.


딥테크 스타트업의 PoC와 AX 도입을 지원하는 가비아 AWS의 기술교류회 현장을 소개했습니다.\nAgentic AI 4-Layer 구조와 비용·마이그레이션 대응 방안을 함께 정리했습니다.

몇 달 전 풀었던 문제를 다시 만나 같은 시행착오를 겪은 경험을 바탕으로, AI와의 대화를 팀 지식으로 자동 축적하는 필요성을 정리했습니다. 반복 해결을 줄이고 기억에 의존하지 않도록 기록과 재활용 구조를 만들려는 이야기입니다.