CARD NEWS · 기본

Quantization 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
기본

Quantization란?

AI 모델의 가중치와 활성값을 32비트·16비트 부동소수점에서 8비트·4비트 정수 같은 낮은 정밀도로 바꿔 크기와 연산량을 줄이는 모델 경량화 기법입니다. 정밀도를 낮추면 메모리 사용량과 응답 지연이 함께 줄어, 같은 GPU에서 더 큰 모델을 올리거나 휴대폰에서 온디바이스로 구동할 수 있습니다. 학습을 마친 모델에 적용하는 사후 양자화(PTQ)와 학습 과정에 반영하는 양자화 인식 학습(QAT)으로 나뉩니다. 정확도 손실을 얼마나 억제하느냐가 관건입니다.

2/4
쉬운 풀이

양자화는 모델이 쓰는 숫자의 '자릿수'를 줄이는 작업입니다

양자화는 모델이 쓰는 숫자의 '자릿수'를 줄이는 작업입니다. 원래 소수점을 길게 쓰던 값을 짧게 반올림해 저장 공간과 계산량을 함께 줄여요. 두꺼운 보고서를 100쪽 원본 대신 핵심만 추린 20쪽 요약본으로 돌려 보는 것과 비슷한데, 요약을 잘하면 결론은 거의 그대로입니다. 덕분에 큰 모델을 값싼 GPU 한 장이나 휴대폰에서도 돌릴 수 있어요. 다만 자릿수를 너무 줄이면 답 품질이 떨어져서, 어느 선까지 줄여도 성능이 버티는지 재보는 게 실무의 핵심입니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: Meta — 양자화한 Llama 3.2 1B·3B를 휴대폰에서 구동 Meta는 2024년 10월 Llama 3.2 1B·3B의 양자화 버전을 공개했습니다 [1]. 학습에 양자화를 반영하는 QLoRA와 사후 양자화 기법 SpinQuant를 함께 적용했습니다 [1]. OnePlus 12, 삼성 갤럭시 S24+ 같은 안드로이드 기기에서 원본 BF16 모델과 비교해 측정했습니다 [1].

4/4
더 알아보기

ai.percent.ac
/word/quantization

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.