모든 태그
태그

모니터링 기술 블로그 글

모니터링 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.

전체 311개최신 20개 표시
홈에서 필터

최신 게시글

20개 표시

AI

[프로모션] 로봇 생산성부터 고장 예측까지 한 번에, AI 기반 로봇 운영 OS ROBOT FACTORY

로봇 현장의 생산성·가동 상태 파악과 고장 예측 문제를 다룹니다. AI 기반 ROBOT FACTORY의 마켓플레이스 프로모션을 소개합니다.

#robot#모니터링#예측 유지보수
900

AI

[AI 트렌드] 모델은 사는 것, 자산은 쌓는 것 — Domain Data와 Harness

AI 시대의 진짜 자산은 모델이 아니라 현장에서 쌓이는 도메인 데이터와 하네스라고 설명했습니다. 업의 본질은 그대로지만, 프로세스를 바꾸는 힘이 경쟁력을 만든다고 정리했습니다.

#LLM#data#모니터링
3000

백엔드

때로는 오버엔지니어링이 필요합니다

레거시 문자 발송 데몬을 걷어내기 위해 CDC와 Kafka를 이용한 과도기 구조를 설계했습니다.수십 개 서비스를 한 번에 바꾸지 못하는 상황에서 안전한 전환과 관측성을 확보한 사례를 설명했습니다.

#CDC#Kafka#transaction
12900

백엔드

"다 됐습니다" 알림, 대체 언제 보내야 맞나

배치 완료 알림이 너무 일찍 나가는 문제를 해결한 사례를 다루셨습니다. 처리 순간의 사실을 기록하고 실제 조회 가능 시점을 기준으로 완료를 판정하셨습니다.

#batch#비동기#cache
3100

AI

쉼 없이 도는 테스트, 사람이 어디까지 돌봐야 할까요? - 토스닥터(Toss Doctor)

매주 반복되던 스모크 테스트를 자동화하고, 실패 원인 분석과 복구까지 맡기는 토스닥터 V2를 소개했습니다. 사람은 검증할 대상과 자동화 범위 설계에 더 집중할 수 있게 됐습니다.

#test#자동화#LLM
13000

아키텍처

[아키텍처] 이기종 데이터 통합 설계, 모니터링 통합에서 얻은 3가지 경계

이기종 데이터 통합에서 수집·식별·소비를 경계로 나누는 설계 기준을 정리했습니다. 새 소스 추가 시 변화가 전역으로 번지지 않도록 흡수 구조를 먼저 점검해야 했습니다.

#MSA#모니터링#아키텍처설계
1000

아키텍처

옵저버빌리티란 무엇이고, 왜 봐야 하는가

옵저버빌리티는 예상하지 못한 장애 원인까지 나중에 추적할 수 있게 만드는 기반입니다.\n메트릭, 로그, 트레이스를 연결해 마이크로서비스 환경의 문제를 요청 단위로 복원해야 했습니다.

#모니터링#트레이싱#logging
4200

백엔드

외부 API 장애가 우리 서비스 장애로 이어졌다

외부 API 장애가 서비스 장애로 이어지는 문제를 다뤘습니다. 멀티 벤더 자동 Fallback과 Health Status 적용 과정의 시행착오를 공유했습니다.

#API#fallback#모니터링
6000

AI

AI에게 분석을 맡기기 전에, '분석할 수 없음' 부터 가르치세요 — Wear OS 이슈 초도 분석을 자동화한 WOA Agent 개발기

Galaxy Watch 검증 단계의 Crash·ANR·화면 흑화 이슈 초도 분석을 자동화한 WOA Agent 개발기를 소개했습니다. AI에 분석을 맡기기 전에 분석 불가 판단부터 학습시키는 접근을 다뤘습니다.

#Android#자동화#LLM
3900

데브옵스

Amazon EC2 Nitro V6의 Connection Tracking 유휴 타임아웃 변경 대응하기

Nitro V6에서 EC2 Connection Tracking 유휴 타임아웃 기본값이 350초로 바뀐 내용을 정리했습니다. TCP keepalive와 타임아웃 정렬로 silent drop과 연결 실패를 예방하는 방법을 설명했습니다.

#Amazon EC2#AWS#Kubernetes
700

아키텍처

서버 개발자가 헥사코드를 몰라도 되게 만들기

SDUI를 도입했지만 화면 결정이 코드에 남아 있어 배포 병목이 계속 생겼습니다. 이를 해결하기 위해 화면 구성을 데이터화한 UX Builder와 토큰 기반 운영 구조를 설계했습니다.

#SDUI#server-driven UI#어드민
5700

AI

LLM 서빙, 띄우는 것과 잘 띄우는 것 사이

LLM 서빙에서는 단순히 모델을 띄우는 것보다, 지표를 잘 설계하고 원인을 빠르게 추적하는 운영이 중요했습니다. Prefix Cache, finish_reason, KV Cache 같은 신호를 활용해 타임아웃과 처리량 문제를 해결했습니다.

#LLM#모니터링#Kubernetes
4800

AI

어피닛 AI 엔진이 규칙 기반 심사 정책을 학습 정책으로 전환해가는 과정

규칙 기반 대출 심사 정책의 한계를 분석하고, 이를 학습 정책으로 안전하게 전환하는 3단계 프레임워크를 소개했습니다. 위험을 늘리지 않으면서 단계적으로 검증 범위를 넓히는 방법을 제시했습니다.

#ML#오프폴리시 평가#behavior cloning
2600

기타

Amazon GameLift Streams로 여는 클라우드 게이밍 시대: 클라이언트 설치 없이 게임 즐기기

Amazon GameLift Streams로 클라이언트 설치 없이 브라우저에서 게임을 즉시 실행하는 방법을 소개했습니다. 런타임, 스트림 클래스, 용량, 관측성까지 포함한 설계와 운영 흐름을 정리했습니다.

#AWS#cloud#WebRTC
1900

AI

우리 팀만의 vLLM 플러그인 만들기 1편 - 검색 AI 모델 서빙 성능 극대화하기

검색·추천 스코어링 모델을 vLLM 기반 풀링 런타임과 IO Processor로 전환해 성능을 크게 높인 사례를 소개했습니다. 전후처리 통합과 배치 최적화로 처리량과 지연 시간을 개선했습니다.

#LLM#검색#MLOps
5800

AI

데이터 요청 응대 30분을 3분으로 줄인 n8n AI 에이전트

n8n AI 에이전트로 데이터 요청 응대 시간을 30분에서 3분으로 줄인 사례를 다뤘습니다. 미리디 데이터 분석가가 온콜 헬퍼봇을 만든 배경과 활용 방식을 소개했습니다.

#LLM#자동화#모니터링
7300

AI

AI API Gateway, 무엇을 보고 골라야 할까? 도입부터 운영까지 선택 기준 5단계

AI API Gateway 선택 기준을 도입부터 운영까지 5단계로 정리했습니다. 여러 모델을 쓴다면 모델 다양성, 보안, 결제, 모니터링을 함께 검토해야 합니다.

#API Gateway#LLM#보안
5400

백엔드

Amazon Aurora 및 Amazon RDS의 PostgreSQL 18: 보안, 모니터링 및 개발자 기능 향상

Amazon Aurora와 RDS의 PostgreSQL 18에서 보안, 모니터링, 복제, 개발자 기능 개선을 정리했습니다.\nMD5 인증 중단, uuidv7(), COPY 및 RETURNING 개선, 복제 슬롯 보호 방법을 함께 소개했습니다.

#PostgreSQL#Amazon Aurora#Amazon RDS
2100

AI

AI 기반 온라인 서비스 24X7 즉시 대응 체계 구축

AI를 활용해 온라인 서비스의 24시간 즉시 대응 체계를 구축한 사례를 소개했습니다. 기존 모니터링과 알림 환경을 바탕으로 상시 관제 필요성을 다뤘습니다.

#모니터링#Slack
1700

데브옵스

AI infra

AI-Ready Infrastructure를 물리 인프라, 데이터, 조직 준비도의 세 층위로 구분해 정리했습니다. 국내는 물리 인프라에 치우쳐 있어 GPU 운영 서비스화와 인력 전환이 차별화 포인트라고 제시했습니다.

#cloud#Kubernetes#GPU
2800