[프로모션] 로봇 생산성부터 고장 예측까지 한 번에, AI 기반 로봇 운영 OS ROBOT FACTORY
로봇 현장의 생산성·가동 상태 파악과 고장 예측 문제를 다룹니다. AI 기반 ROBOT FACTORY의 마켓플레이스 프로모션을 소개합니다.
모니터링 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.
20개 표시
로봇 현장의 생산성·가동 상태 파악과 고장 예측 문제를 다룹니다. AI 기반 ROBOT FACTORY의 마켓플레이스 프로모션을 소개합니다.
AI 시대의 진짜 자산은 모델이 아니라 현장에서 쌓이는 도메인 데이터와 하네스라고 설명했습니다. 업의 본질은 그대로지만, 프로세스를 바꾸는 힘이 경쟁력을 만든다고 정리했습니다.
레거시 문자 발송 데몬을 걷어내기 위해 CDC와 Kafka를 이용한 과도기 구조를 설계했습니다.수십 개 서비스를 한 번에 바꾸지 못하는 상황에서 안전한 전환과 관측성을 확보한 사례를 설명했습니다.
배치 완료 알림이 너무 일찍 나가는 문제를 해결한 사례를 다루셨습니다. 처리 순간의 사실을 기록하고 실제 조회 가능 시점을 기준으로 완료를 판정하셨습니다.

매주 반복되던 스모크 테스트를 자동화하고, 실패 원인 분석과 복구까지 맡기는 토스닥터 V2를 소개했습니다. 사람은 검증할 대상과 자동화 범위 설계에 더 집중할 수 있게 됐습니다.

이기종 데이터 통합에서 수집·식별·소비를 경계로 나누는 설계 기준을 정리했습니다. 새 소스 추가 시 변화가 전역으로 번지지 않도록 흡수 구조를 먼저 점검해야 했습니다.
옵저버빌리티는 예상하지 못한 장애 원인까지 나중에 추적할 수 있게 만드는 기반입니다.\n메트릭, 로그, 트레이스를 연결해 마이크로서비스 환경의 문제를 요청 단위로 복원해야 했습니다.

외부 API 장애가 서비스 장애로 이어지는 문제를 다뤘습니다. 멀티 벤더 자동 Fallback과 Health Status 적용 과정의 시행착오를 공유했습니다.
Galaxy Watch 검증 단계의 Crash·ANR·화면 흑화 이슈 초도 분석을 자동화한 WOA Agent 개발기를 소개했습니다. AI에 분석을 맡기기 전에 분석 불가 판단부터 학습시키는 접근을 다뤘습니다.
Nitro V6에서 EC2 Connection Tracking 유휴 타임아웃 기본값이 350초로 바뀐 내용을 정리했습니다. TCP keepalive와 타임아웃 정렬로 silent drop과 연결 실패를 예방하는 방법을 설명했습니다.

SDUI를 도입했지만 화면 결정이 코드에 남아 있어 배포 병목이 계속 생겼습니다. 이를 해결하기 위해 화면 구성을 데이터화한 UX Builder와 토큰 기반 운영 구조를 설계했습니다.

LLM 서빙에서는 단순히 모델을 띄우는 것보다, 지표를 잘 설계하고 원인을 빠르게 추적하는 운영이 중요했습니다. Prefix Cache, finish_reason, KV Cache 같은 신호를 활용해 타임아웃과 처리량 문제를 해결했습니다.

규칙 기반 대출 심사 정책의 한계를 분석하고, 이를 학습 정책으로 안전하게 전환하는 3단계 프레임워크를 소개했습니다. 위험을 늘리지 않으면서 단계적으로 검증 범위를 넓히는 방법을 제시했습니다.
Amazon GameLift Streams로 클라이언트 설치 없이 브라우저에서 게임을 즉시 실행하는 방법을 소개했습니다. 런타임, 스트림 클래스, 용량, 관측성까지 포함한 설계와 운영 흐름을 정리했습니다.

검색·추천 스코어링 모델을 vLLM 기반 풀링 런타임과 IO Processor로 전환해 성능을 크게 높인 사례를 소개했습니다. 전후처리 통합과 배치 최적화로 처리량과 지연 시간을 개선했습니다.
n8n AI 에이전트로 데이터 요청 응대 시간을 30분에서 3분으로 줄인 사례를 다뤘습니다. 미리디 데이터 분석가가 온콜 헬퍼봇을 만든 배경과 활용 방식을 소개했습니다.
AI API Gateway 선택 기준을 도입부터 운영까지 5단계로 정리했습니다. 여러 모델을 쓴다면 모델 다양성, 보안, 결제, 모니터링을 함께 검토해야 합니다.

Amazon Aurora와 RDS의 PostgreSQL 18에서 보안, 모니터링, 복제, 개발자 기능 개선을 정리했습니다.\nMD5 인증 중단, uuidv7(), COPY 및 RETURNING 개선, 복제 슬롯 보호 방법을 함께 소개했습니다.

AI를 활용해 온라인 서비스의 24시간 즉시 대응 체계를 구축한 사례를 소개했습니다. 기존 모니터링과 알림 환경을 바탕으로 상시 관제 필요성을 다뤘습니다.
AI-Ready Infrastructure를 물리 인프라, 데이터, 조직 준비도의 세 층위로 구분해 정리했습니다. 국내는 물리 인프라에 치우쳐 있어 GPU 운영 서비스화와 인력 전환이 차별화 포인트라고 제시했습니다.