Data Drift란?
운영 중인 머신러닝 모델에 들어오는 입력 데이터의 통계적 분포가 학습 시점과 달라지는 현상입니다. 코로나19 같은 외부 충격, 계절성, 사용자 행동 변화가 원인이 되며, 모델은 그대로여도 예측 정확도가 조용히 떨어집니다. 입력과 정답의 관계 자체가 바뀌는 콘셉트 드리프트와 구분해서 씁니다. 배포 후 모니터링과 재학습 주기를 설계하는 MLOps의 핵심 근거가 되는 개념입니다.
CARD NEWS · 데이터·DB
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.
운영 중인 머신러닝 모델에 들어오는 입력 데이터의 통계적 분포가 학습 시점과 달라지는 현상입니다. 코로나19 같은 외부 충격, 계절성, 사용자 행동 변화가 원인이 되며, 모델은 그대로여도 예측 정확도가 조용히 떨어집니다. 입력과 정답의 관계 자체가 바뀌는 콘셉트 드리프트와 구분해서 씁니다. 배포 후 모니터링과 재학습 주기를 설계하는 MLOps의 핵심 근거가 되는 개념입니다.
데이터 드리프트(Data Drift)는 모델이 배운 세상과 지금 세상이 어긋나는 현상이에요. 재작년 기출문제로만 공부한 수험생이 출제 경향이 바뀐 올해 시험을 치르는 상황과 같습니다. 모델은 그대로인데 세상이 변해서 성적이 떨어집니다. 그래서 운영 중인 AI는 성적표(모니터링)를 계속 확인하고 새 문제집(재학습)을 줘야 합니다.
케이스 1: Instacart(미국) — 코로나가 무너뜨린 재고 예측 인스타카트의 상품 재고 예측 모델은 2020년 3월 코로나 사재기 국면에서 정확도가 93%에서 61%로 급락했습니다 [1]. 소비 패턴이 급변하며 학습 데이터가 현실을 대표하지 못하게 된 사례입니다 [1]. 학습 데이터 윈도를 10일로 줄이고 갱신 주기를 앞당겨 약 85%까지 회복했습니다 [1]. 도입효과: 예측 정확도 9
카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.