목록 보기
2022 개인정보 가명·익명처리 기술 경진대회 참여 후기
백엔드

2022 개인정보 가명·익명처리 기술 경진대회 참여 후기

스캐터랩 핑퐁
스캐터랩 핑퐁
2023년 2월 1일

두줄요약

개인정보·가명정보·익명정보의 차이와 안전성·유용성 평가 관점을 정리했습니다.\nPython과 pandas로 범주화, 부분 총계, k-익명성을 적용하는 방법을 소개했습니다.

구조와 흐름

  • 개인정보·가명정보·익명정보의 구분과 가명정보 처리 특례 소개
  • 프라이버시 보호와 데이터 유용성 사이의 균형을 안전성·유용성 지표로 평가
  • 범주화, 상하단코딩, 부분 총계와 k-익명성의 Python·pandas 적용 예시

선택 이유

  • 가명정보의 추가정보 기반 재식별 가능성과 익명정보의 비개인정보성 구분
  • 원본·비식별 데이터의 통계값 차이와 코사인 유사도, 레코드 비율 기반 유용성 측정
  • 연결 공격 방어 수준을 동질 집합의 최소 크기인 k값으로 정량화

트레이드오프

  • 식별 가능성 축소와 연구·통계 활용 목적의 데이터 유용성 간 상충
  • 총계처리의 재식별 위험 저감 효과와 분산 등 산포도 손실 가능성
  • k-익명성의 최소 안전성 판단 유용성과 가명처리 적용 한계·다양한 재식별 위험 검토 필요성

적용해볼 점

  • 데이터 분포와 희소 구간을 EDA로 확인한 뒤 범주화·상하단코딩 수준 결정
  • 활용 목적에 맞춘 유용성 지표를 스크립트로 상시 측정
  • 식별정보 삭제, 준식별자·민감속성 분류, 처리 환경을 함께 고려한 재식별 위험 검토

다음 읽기

비슷한 주제의 AI 글

금융 보안 퀴즈, AI에게 풀게 해봤습니다: 2025 금융 AI Challenge 우수상 후기

금융보안 AI 경진대회에서 24GB 단일 GPU 제약 아래 LLM 파이프라인을 설계하고 우수상을 수상한 과정을 정리했습니다.\n모델 선정부터 CPT, RAG, 양자화, 출력 제어까지의 선택 이유와 성능 개선 결과를 공유했습니다.

카카오뱅크
카카오뱅크
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...