Quantization란?
AI 모델의 가중치와 활성값을 32비트·16비트 부동소수점에서 8비트·4비트 정수 같은 낮은 정밀도로 바꿔 크기와 연산량을 줄이는 모델 경량화 기법입니다. 정밀도를 낮추면 메모리 사용량과 응답 지연이 함께 줄어, 같은 GPU에서 더 큰 모델을 올리거나 휴대폰에서 온디바이스로 구동할 수 있습니다. 학습을 마친 모델에 적용하는 사후 양자화(PTQ)와 학습 과정에 반영하는 양자화 인식 학습(QAT)으로 나뉩니다. 정확도 손실을 얼마나 억제하느냐가 관건입니다.