국내 IT 기업 기술 블로그 최신 글

NEW FEATURE

기술을 읽던 곳에서, 다음 기회를 만나세요.

채용 검색부터 관심사 기반 추천, 내 적합도까지.

새로운 기술 블로그가 추가되었어요

필터 1
MNO Performance 마케팅용 최적 요금제 선택을 위한 하이브리드 ML 모델링
데보션
AI

MNO Performance 마케팅용 최적 요금제 선택을 위한 하이브리드 ML 모델링

통신사 마케팅을 위해 요금제 변경 예측과 추천을 결합한 하이브리드 ML 모델을 소개했습니다.\nARPU와 고객 만족도의 균형을 고려해 다운그레이드 방어와 업셀 전략에 활용했습니다.

#ML#XGBoost
3200
Spark Streaming을 활용한 파생 데이터 생성 시간 감축 사례
SK플래닛
백엔드

Spark Streaming을 활용한 파생 데이터 생성 시간 감축 사례

Hive 배치 기반 파생 데이터 생성 지연 문제를 Spark Streaming으로 실시간 처리하도록 전환한 사례를 소개했습니다. Kafka 오프셋과 처리량, LAG 모니터링으로 안정적인 운영 방법도 함께 설명했습니다.

#Spark#Kafka
4300
Accelerating Coupang’s AI Journey with LLMs
쿠팡
AI

Accelerating Coupang’s AI Journey with LLMs

쿠팡이 LLM을 활용해 이미지·텍스트 이해, 약한 라벨 생성, 상품 분류를 개선하는 사례를 소개했습니다. 또한 CJK 언어 특성과 ICL·RAG·SFT·CPT, Kubernetes 기반 훈련 흐름을 함께 설명했습니다.

#LLM#ML
5100
Polars로 데이터 처리를 더 빠르고 가볍게 with 실무 적용기
우아한 형제들
백엔드

Polars로 데이터 처리를 더 빠르고 가볍게 with 실무 적용기

Pandas와 Spark 사이의 대체제로 Polars를 검토한 실무 적용 경험을 소개했습니다. Lazy API와 streaming으로 메모리와 실행 시간을 크게 줄인 사례를 공유했습니다.

#Polars#Pandas
2600
실시간 광고 사용자 ID 매핑
네이버 D2
백엔드

실시간 광고 사용자 ID 매핑

실시간 광고 사용자 ID 매핑 시스템과 그 설계 과정을 다룬 발표 세션을 공개했습니다. gRPC, Spark Structured Streaming, Kafka를 활용한 마이크로서비스 구성과 그래프 기반 매핑 방식을 소개했습니다.

#gRPC#Spark
3800
무신사, 2023 Databricks Data+AI 컨퍼런스에 다녀오다
무신사
기타

무신사, 2023 Databricks Data+AI 컨퍼런스에 다녀오다

무신사 테크가 Databricks Data+AI Summit 2023 참석 후기를 공유했습니다. 생성형 AI, 데이터 플랫폼, 재해복구 등 실무 인사이트를 정리했습니다.

#Databricks#LLM
3400
점점 커지는 RDB Table, S3로 귀양 보내고 Athena로 불러오기 - feat. Optimization with Spark Bucketing
뱅크샐러드
백엔드

점점 커지는 RDB Table, S3로 귀양 보내고 Athena로 불러오기 - feat. Optimization with Spark Bucketing

이력성 데이터 증가로 MySQL 부담이 커져 S3와 Athena로 저장·조회 구조를 옮긴 사례를 다뤘습니다. Spark bucketing으로 필요한 데이터만 읽도록 최적화하는 흐름을 소개했습니다.

#MySQL#S3
1200
분석 데이터를 프로덕션에서 쉽게 사용할 수 없을까?
뱅크샐러드
백엔드

분석 데이터를 프로덕션에서 쉽게 사용할 수 없을까?

분석 데이터를 프로덕션에서 쉽게 쓰기 위한 데이터서빙 서비스 구축 과정을 소개합니다. 분석 테이블을 API로 제공하기 위해 S3, Airflow, Spark 등을 활용했습니다.

#S3#Airflow
2300
쿠팡 파트너스

광고

개발자를 위한 서적을 확인해 보세요

이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

#개발서적#프로그래밍
입사 첫날에 36시간 점검 경험하기
데브시스터즈
백엔드

입사 첫날에 36시간 점검 경험하기

쿠키런: 킹덤 출시 직후 발생한 대규모 장애를 신입 입사자의 시점에서 회고한 글입니다. 데이터 이주와 정합성 검증을 통해 서비스를 복구한 과정을 담았습니다.

#AWS#CockroachDB
2400
Spark on Kubernetes로 가자!
뱅크샐러드
데브옵스

Spark on Kubernetes로 가자!

EMR, YARN 기반 Spark를 Self-hosted Kubernetes로 전환하는 내용을 소개했습니다. 데이터 분석환경 컴퓨팅을 Kubernetes 중심으로 재구성하는 방향을 다뤘습니다.

#Spark#Kubernetes
1900
쿠키런: 킹덤 데이터베이스 스토리지 레이어 복원기
데브시스터즈
백엔드

쿠키런: 킹덤 데이터베이스 스토리지 레이어 복원기

런칭 직후 Ballast 파일 경로 오류로 CockroachDB 클러스터가 전역 장애를 겪었습니다. SST 파일 복원과 데이터 재구성을 통해 서비스를 다시 열고, 이후 재발 방지 프로세스도 강화했습니다.

#CockroachDB#AWS
4400
효율적인 하둡 플랫폼 운영을 위한 “Hive 사용량 통계 레포트” 개발기
네이버 플레이스
백엔드

효율적인 하둡 플랫폼 운영을 위한 “Hive 사용량 통계 레포트” 개발기

Hive 사용량 통계를 수집해 하둡 플랫폼 운영 효율을 높인 개발 사례를 소개했습니다. 크롤링 한계를 로그 분석과 실시간 처리 구조로 개선하고 Iceberg 적재 방식도 조정했습니다.

#Hive#Hadoop
2200
올리브영 데이터 엔지니어링
올리브영
데브옵스

올리브영 데이터 엔지니어링

올리브영은 IDC 기반 ETL·DW 구조를 GCP 기반 데이터 플랫폼으로 확장했습니다.\nAirflow·Spark·BigQuery로 데이터 수집·처리·분석과 로그 수집을 지원합니다.

#ETL#GCP
2300
데이터 분석 라이브러리 개발기 (1)
데브시스터즈
백엔드

데이터 분석 라이브러리 개발기 (1)

PySpark 분석의 경로·설정 관리와 Notebook·batch 환경 차이를 DevPlay Analytics로 추상화했습니다. SQL 인터페이스와 문서화·테스트를 제공해 일일 200종 이상 테이블 적재에 활용했습니다.

#Python#PySpark
1300