2

Differential Privacy
디퍼렌셜 프라이버시
차분 프라이버시는 분석 결과에 통계적 잡음을 더해, 특정 개인 한 명의 데이터가 포함되든 빠지든 결과 분포가 거의 달라지지 않도록 만드는 수학적 정의입니다. 2006년 Dwork, McSherry, Nissim, Smith가 함수의 민감도에 비례해 잡음 크기를 맞추는 방식으로 제시했습니다 [1]. 보호 강도는 프라이버시 예산 엡실론이라는 단일 수치로 정량화합니다. 엡실론이 작을수록 보호는 강해지고 통계의 정확도는 떨어집니다. 익명화나 가명처리가 외부 데이터와 결합해 재식별될 수 있는 것과 달리, 공격자의 배경지식을 가정하지 않은 보장을 제공합니다.
보안·윤리
Synthetic Data
신세틱 데이터
데이터·DB 분야에서 쓰이는 용어로, 실제로 수집한 데이터 대신 알고리즘이나 모델로 인공 생성한 데이터를 뜻합니다. 영국 왕립학회는 특정 데이터 과제를 풀 목적으로 수학 모델이나 알고리즘으로 만든 데이터라고 정의합니다. 원본과 통계적 성질은 닮았지만 실제 개인 정보는 담지 않는 점이 특징입니다. 쓰임새는 크게 둘입니다. 실데이터를 쓰기 어려운 프라이버시 상황의 대체용, 그리고 희귀하거나 위험해서 모으기 힘든 상황을 시뮬레이션으로 채우는 보강용입니다.
데이터·DB
검색 · AI for Everyone