CARD NEWS · 데이터·DB

Data Labeling 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
데이터·DB

Data Labeling란?

데이터·DB 분야에서 쓰이는 용어로, 원시 데이터에 의미나 정답 태그를 붙여 머신러닝이 그 라벨로 학습할 수 있게 만드는 작업입니다. Scale AI 공식 가이드는 지도학습이 대량의 라벨 데이터로 모델을 학습시켜 분류나 예측을 하게 한다고 설명합니다. 모델 성능은 데이터와 라벨의 품질에 좌우됩니다. 그래서 자주 간과되지만 머신러닝에서 결정적인 작업으로 꼽힙니다. 최근에는 사람 라벨링에 머신러닝을 결합해 일부를 자동화하기도 합니다.

2/4
쉬운 풀이

데이터 라벨링은 원시 데이터에 정답표를 붙이는 작업이에요

데이터 라벨링은 원시 데이터에 정답표를 붙이는 작업이에요. 사진마다 이건 고양이, 저건 강아지라고 하나하나 이름표를 달아 주는 식입니다. AI는 이 정답표를 보고 규칙을 익히기 때문에, 라벨이 부정확하면 아무리 좋은 모델도 엉뚱하게 헛배웁니다. 조교가 수천 장의 시험지에 일일이 정답 채점을 해 두면 그걸로 학생이 공부하는 상황을 떠올리면 가까워요. 그래서 라벨의 양과 품질이 곧 모델 성능이 되고, AI 프로젝트에서 가장 손이 많이 가는 밑작업으로 꼽힙니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: ImageNet — 사람이 손으로 단 라벨이 딥러닝을 열다 스탠퍼드 연구진이 만든 ImageNet은 2009년 발표된 대규모 이미지 데이터베이스입니다 [4]. 공식 소개에 따르면 모든 이미지를 사람이 직접 주석하고 품질을 관리했습니다 [4]. 라벨이 붙은 이 대규모 데이터가 딥러닝 시대를 연 벤치마크가 됐습니다 [4]. 라벨 품질과 규모가 모델을 좌우한다는 것을 보여준 사례입니다

4/4
더 알아보기

ai.percent.ac
/word/data-labeling

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.