국내 IT 기업 기술 블로그 최신 글

NEW FEATURE

기술을 읽던 곳에서, 다음 기회를 만나세요.

채용 검색부터 관심사 기반 추천, 내 적합도까지.

새로운 기술 블로그가 추가되었어요

필터 1
Deduplication - 학습 데이터에서 중복 제거하기
스캐터랩 핑퐁
AI

Deduplication - 학습 데이터에서 중복 제거하기

대규모 LLM 학습 데이터의 근접 중복을 효율적으로 제거하는 NearDedup 방식을 소개했습니다. LSH·자카드 유사도·편집 거리 필터를 Apache Beam으로 병렬 처리했습니다.

#LLM#Apache Beam
000
Dataflow로 컬리의 준실시간 수요 예측모델 파이프라인 구축하기 - 1편
마켓컬리
AI

Dataflow로 컬리의 준실시간 수요 예측모델 파이프라인 구축하기 - 1편

준실시간 수요예측을 위해 Apache Beam 기반 GCP Dataflow 파이프라인을 도입한 배경과 동작 구조를 설명했습니다. Flex 템플릿·CI/CD 배포 과정과 스트리밍, 권한, 비용 관련 운영 팁을 정리했습니다.

#Dataflow#Apache Beam
000
Dataflow로 컬리의 준실시간 수요 예측모델 파이프라인 구축하기 - 1편
마켓컬리
데브옵스

Dataflow로 컬리의 준실시간 수요 예측모델 파이프라인 구축하기 - 1편

컬리의 준실시간 수요 예측 모델을 위해 Dataflow 파이프라인을 도입한 배경과 전체 동작 방식을 설명했습니다. Beam, Flex 템플릿, CI/CD, 권한 설정 등 실무 적용 포인트도 함께 정리했습니다.

#Dataflow#Apache Beam
1500
Apache Beam으로 머신러닝 데이터 파이프라인 구축하기 3편 - RunInference로 모델 추론하기
스캐터랩 핑퐁
AI

Apache Beam으로 머신러닝 데이터 파이프라인 구축하기 3편 - RunInference로 모델 추론하기

Apache Beam RunInference로 Dataflow 기반 대규모 모델 추론 파이프라인을 구성하는 방법을 소개했습니다.\n가변 길이 입력의 패딩 처리와 배치·GPU 지표 관리 포인트를 설명합니다.

#Apache Beam#Dataflow
000
TFX 머신러닝 파이프라인 사용하기
스캐터랩 핑퐁
AI

TFX 머신러닝 파이프라인 사용하기

TFX 커스텀 컴포넌트로 신규 데이터부터 학습·모델 등록까지의 파이프라인을 구성했습니다. Apache Beam과 사내 레지스트리를 연동하는 구현·운영 주의점을 설명합니다.

#TFX#TensorFlow
000
Apache Beam으로 머신러닝 데이터 파이프라인 구축하기 2편 - 개발 및 최적화
스캐터랩 핑퐁
AI

Apache Beam으로 머신러닝 데이터 파이프라인 구축하기 2편 - 개발 및 최적화

Apache Beam 파이프라인을 Composite PTransform으로 모듈화하고 병렬 처리 병목을 최적화했습니다.\nShared Object, 배치, Side Input으로 ML 추론과 Faiss 벡터 검색의 메모리·처리 문제를 다뤘습니다.

#Apache Beam#Python
000