국내 IT 기업 기술 블로그 최신 글

NEW FEATURE

기술을 읽던 곳에서, 다음 기회를 만나세요.

채용 검색부터 관심사 기반 추천, 내 적합도까지.

새로운 기술 블로그가 추가되었어요

필터 1
Iceberg는 정말 싸고 빠를까? – 운영 데이터 5가지 벤치마크 솔직한 결과
밸런스히어로
백엔드

Iceberg는 정말 싸고 빠를까? – 운영 데이터 5가지 벤치마크 솔직한 결과

실제 운영 데이터로 Iceberg와 Hive를 비교해 비용과 속도 차이를 검증했습니다. 큰 테이블부터 옮기고 SQL 패턴을 바꿔야 효과가 커졌습니다.

#Apache Iceberg#Athena
5300
Spark History MCP + AI Agent로 Spark 분석 자동화하기
드림어스
AI

Spark History MCP + AI Agent로 Spark 분석 자동화하기

SparkListener와 Spark History MCP, n8n AI Agent를 연결해 Spark 장애 분석을 자동화했습니다.\n실시간 에러 감지와 히스토리 조회로 원인과 해결책을 Slack으로 전달했습니다.

#Spark#MCP
1300
EMNLP24 늦은 후기 2탄: CC 데이터로 LLM 사전학습 데이터셋을 만들어본 경험 및 NVIDIA 논문 리뷰
데보션
AI

EMNLP24 늦은 후기 2탄: CC 데이터로 LLM 사전학습 데이터셋을 만들어본 경험 및 NVIDIA 논문 리뷰

웹 크롤링 데이터로 LLM 사전학습 데이터셋을 만든 경험과 어려움을 정리했습니다. NVIDIA EMNLP 2024 논문을 통해 품질 필터링과 중복 제거 전략을 체계적으로 살펴봤습니다.

#LLM#PySpark
5600
제조업 데이터를 활용한 BI 대시보드 통합 및 자동화 후기
데보션
백엔드

제조업 데이터를 활용한 BI 대시보드 통합 및 자동화 후기

Airflow와 PySpark로 제조업 기준 정보와 생산 데이터를 통합해 Spotfire 대시보드를 자동화했습니다.\n대용량 처리와 정기 갱신으로 현장 의사결정 속도와 데이터 신뢰성을 높였습니다.

#Airflow#PySpark
7500
데이터 분석 라이브러리 개발기 (2) - 통합 테스팅과 문서화를 동시에 잡는 방법
데브시스터즈
백엔드

데이터 분석 라이브러리 개발기 (2) - 통합 테스팅과 문서화를 동시에 잡는 방법

MinIO와 pytest fixture로 S3 의존성 없는 PySpark 통합 테스트 환경을 구축했습니다.\npytest doctest와 Sphinx를 결합해 실행 가능한 API 문서를 유지했습니다.

#Python#PySpark
2800
데이터 분석 라이브러리 개발기 (1)
데브시스터즈
백엔드

데이터 분석 라이브러리 개발기 (1)

PySpark 분석의 경로·설정 관리와 Notebook·batch 환경 차이를 DevPlay Analytics로 추상화했습니다. SQL 인터페이스와 문서화·테스트를 제공해 일일 200종 이상 테이블 적재에 활용했습니다.

#Python#PySpark
1300
쿠팡 파트너스

광고

개발자를 위한 서적을 확인해 보세요

이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

#개발서적#프로그래밍