국내 IT 기업 기술 블로그 최신 글

NEW FEATURE

기술을 읽던 곳에서, 다음 기회를 만나세요.

채용 검색부터 관심사 기반 추천, 내 적합도까지.

새로운 기술 블로그가 추가되었어요

필터 1
VPC 내 프라이빗 서비스에 AWS DevOps Agent를 안전하게 연결하기
AWS
데브옵스

VPC 내 프라이빗 서비스에 AWS DevOps Agent를 안전하게 연결하기

AWS DevOps Agent를 VPC 내부 서비스에 안전하게 연결하는 프라이빗 연결 설정 방법을 설명했습니다. 콘솔과 CLI 절차, DNS 해석, Grafana 연동과 운영 주의점까지 함께 정리했습니다.

#AWS DevOps Agent#VPC Lattice
1100
[2편] Grafana 커스텀 패널로 10만 점 산점도 그리기 — 만들고 나서야 보인 함정 3가지
여기어때
데브옵스

[2편] Grafana 커스텀 패널로 10만 점 산점도 그리기 — 만들고 나서야 보인 함정 3가지

OpenTelemetry와 ClickHouse로 APM 스캐터 차트를 만들고 Grafana 커스텀 패널로 10만 점 산점도를 그린 사례를 다뤘습니다. 구현 후 드러난 함정 3가지와 대용량 시각화 시 점검 포인트를 정리했습니다.

#Grafana#OpenTelemetry
2600
[케클러 인터뷰 시리즈] #5 - AI가 클라우드를 운영하려면, 데이터부터 이해해야 합니다
KT 클라우드
기타

[케클러 인터뷰 시리즈] #5 - AI가 클라우드를 운영하려면, 데이터부터 이해해야 합니다

Cloud Native 운영에서는 모니터링만으로 원인을 찾기 어려워 Observability와 데이터 연결이 중요합니다. kt cloud는 AI가 활용할 수 있는 운영 데이터와 접근 통제 구조를 함께 설계했습니다.

#Observability#AIOps
2400
k6로 n8n 부하테스트 - worker를 8배 늘려도 처리량이 그대로인 이유
인포그랩
데브옵스

k6로 n8n 부하테스트 - worker를 8배 늘려도 처리량이 그대로인 이유

n8n Queue Mode에서 worker만 늘려도 처리량이 오르지 않는 이유를 k6 부하테스트로 검증했습니다. 실제 병목은 worker가 아니라 task runner 한도였고, 두 값을 함께 조정해야 했습니다.

#k6#Grafana
1000
LLM 서빙, 띄우는 것과 잘 띄우는 것 사이
토스
AI

LLM 서빙, 띄우는 것과 잘 띄우는 것 사이

LLM 서빙에서는 단순히 모델을 띄우는 것보다, 지표를 잘 설계하고 원인을 빠르게 추적하는 운영이 중요했습니다. Prefix Cache, finish_reason, KV Cache 같은 신호를 활용해 타임아웃과 처리량 문제를 해결했습니다.

#LLM#모니터링
4800
[구축사례] kt cloud PLATFORM Observability Alert 플랫폼 구축하기
KT 클라우드
아키텍처

[구축사례] kt cloud PLATFORM Observability Alert 플랫폼 구축하기

kt cloud가 Observability Alert 플랫폼을 구축한 사례를 정리했습니다. 조직별 격리, 통합관제 연계, 이력 관리를 위한 설계와 운영 포인트를 다뤘습니다.

#observability#Grafana
1400
Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기
라인
AI

Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기

Grafana에서 자연어로 장애 원인을 찾는 SRELens 개발 사례를 소개했습니다.\nLLM 에이전트를 운영 환경에 맞게 제어하기 위해 프롬프트 레이어 분리와 도구 호출 가드레일을 설계했습니다.

#Grafana#LLM
7000
쿠팡 파트너스

광고

개발자를 위한 서적을 확인해 보세요

이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

#개발서적#프로그래밍
LLM 비용 64% 절감, 캐시 히트율 98% 달성기
무신사
AI

LLM 비용 64% 절감, 캐시 히트율 98% 달성기

AWS Bedrock 기반 LLM 비용이 증가하자 API별 토큰 메트릭을 먼저 구축해 원인을 파악했습니다. 이후 Prompt Caching을 적용해 캐시 히트율 98%, 전체 비용 64% 절감을 달성했습니다.

#LLM#cache
32620
Alert 시스템을 표준화하고 IaC로 운영하기
AB180
데브옵스

Alert 시스템을 표준화하고 IaC로 운영하기

Alert 생성과 전달, 대응 흐름을 IaC와 표준화된 Slack 메시지로 정리한 개선 과정을 소개했습니다. 반복 Alert 재사용, grouped Alert, AI 연동, 모니터링 자체 감시까지 운영 개선을 다뤘습니다.

#IaC#Grafana
900
창식이와 함께하는 물류 개발 라이프(with 하네스)
펫프렌즈
AI

창식이와 함께하는 물류 개발 라이프(with 하네스)

Slack 봇 창식이를 통해 하네스 엔지니어링과 컨텍스트/피드백 루프 설계를 실제 운영에 적용한 사례를 정리했습니다. MCP 채널, 지식 베이스, 교정 로그로 장기 작업의 정확도를 높인 구성이 핵심입니다.

#LLM#MCP
9600
옵저버빌리티 Right-Sizing: 여기어때에서 기준을 만드는 법
여기어때
데브옵스

옵저버빌리티 Right-Sizing: 여기어때에서 기준을 만드는 법

Kubernetes Pod의 Request와 Limit을 실제 사용 패턴에 맞게 조정하는 Right-Sizing 기준 수립 과정을 다뤘습니다. P95, 버퍼율, 컴포넌트 특성, Throttling 지표를 함께 고려하는 방법을 정리했습니다.

#Kubernetes#Grafana
7400
StarRocks 운영기: Resource Group으로 멀티테넌트 워크로드 격리하기
토스
백엔드

StarRocks 운영기: Resource Group으로 멀티테넌트 워크로드 격리하기

StarRocks에서 Resource Group으로 멀티테넌트 워크로드를 분류하고 CPU 우선순위를 조절한 운영 경험을 정리했습니다. 서비스 SLA가 필요한 경우에는 exclusive_cpu_cores와 주의점을 함께 적용했습니다.

#Starrocks#Resource Group
5100
신뢰성 향상을 위한 SLI/SLO 활용 1편 - SLI/SLO 프레임워크 및 서비스 상태 확인 도구 LINE Status 개발기
라인
백엔드

신뢰성 향상을 위한 SLI/SLO 활용 1편 - SLI/SLO 프레임워크 및 서비스 상태 확인 도구 LINE Status 개발기

SLI/SLO 도입 과정을 공통 프레임워크로 정리하고 사내 템플릿으로 확산한 사례를 소개했습니다. 또한 웹훅과 DB 기반으로 자동 갱신되는 서비스 상태 확인 도구 LINE Status를 만든 과정을 공유했습니다.

#SRE#SLI/SLO
8400
나만의 완벽한 AI 비서 만들기: Claude 활용 가이드 - Part 2
밸런스히어로
AI

나만의 완벽한 AI 비서 만들기: Claude 활용 가이드 - Part 2

Claude Code로 Slack·VS Code·Jupyter를 묶어 맥락이 이어지는 AI 비서를 설계하고 실무 자동화 사례를 소개했습니다. 개인 워크스페이스를 조직 자산으로 확장하는 방향과 AI를 대하는 실용주의도 함께 정리했습니다.

#Claude#Slack
700