백엔드
2022 개인정보 가명·익명처리 기술 경진대회 참여 후기
두줄요약
개인정보·가명정보·익명정보의 차이와 안전성·유용성 평가 관점을 정리했습니다.\nPython과 pandas로 범주화, 부분 총계, k-익명성을 적용하는 방법을 소개했습니다.
구조와 흐름
- 개인정보·가명정보·익명정보의 구분과 가명정보 처리 특례 소개
- 프라이버시 보호와 데이터 유용성 사이의 균형을 안전성·유용성 지표로 평가
- 범주화, 상하단코딩, 부분 총계와 k-익명성의 Python·pandas 적용 예시
선택 이유
- 가명정보의 추가정보 기반 재식별 가능성과 익명정보의 비개인정보성 구분
- 원본·비식별 데이터의 통계값 차이와 코사인 유사도, 레코드 비율 기반 유용성 측정
- 연결 공격 방어 수준을 동질 집합의 최소 크기인 k값으로 정량화
트레이드오프
- 식별 가능성 축소와 연구·통계 활용 목적의 데이터 유용성 간 상충
- 총계처리의 재식별 위험 저감 효과와 분산 등 산포도 손실 가능성
- k-익명성의 최소 안전성 판단 유용성과 가명처리 적용 한계·다양한 재식별 위험 검토 필요성
적용해볼 점
- 데이터 분포와 희소 구간을 EDA로 확인한 뒤 범주화·상하단코딩 수준 결정
- 활용 목적에 맞춘 유용성 지표를 스크립트로 상시 측정
- 식별정보 삭제, 준식별자·민감속성 분류, 처리 환경을 함께 고려한 재식별 위험 검토

