기본

Quantization

퀀타이제이션

AI 모델의 가중치와 활성값을 32비트·16비트 부동소수점에서 8비트·4비트 정수 같은 낮은 정밀도로 바꿔 크기와 연산량을 줄이는 모델 경량화 기법입니다. 정밀도를 낮추면 메모리 사용량과 응답 지연이 함께 줄어, 같은 GPU에서 더 큰 모델을 올리거나 휴대폰에서 온디바이스로 구동할 수 있습니다. 학습을 마친 모델에 적용하는 사후 양자화(PTQ)와 학습 과정에 반영하는 양자화 인식 학습(QAT)으로 나뉩니다. 정확도 손실을 얼마나 억제하느냐가 관건입니다.

쉽게 말하면?

양자화는 모델이 쓰는 숫자의 '자릿수'를 줄이는 작업입니다. 원래 소수점을 길게 쓰던 값을 짧게 반올림해 저장 공간과 계산량을 함께 줄여요. 두꺼운 보고서를 100쪽 원본 대신 핵심만 추린 20쪽 요약본으로 돌려 보는 것과 비슷한데, 요약을 잘하면 결론은 거의 그대로입니다. 덕분에 큰 모델을 값싼 GPU 한 장이나 휴대폰에서도 돌릴 수 있어요. 다만 자릿수를 너무 줄이면 답 품질이 떨어져서, 어느 선까지 줄여도 성능이 버티는지 재보는 게 실무의 핵심입니다.

한 줄로 비유하면?

긴 소수점 장부를 반올림해 결재량을 줄인 경비 정산 보고서입니다.

어디에 쓰이나?

케이스 1Meta — 양자화한 Llama 3.2 1B·3B를 휴대폰에서 구동

Meta는 2024년 10월 Llama 3.2 1B·3B의 양자화 버전을 공개했습니다 [1]. 학습에 양자화를 반영하는 QLoRA와 사후 양자화 기법 SpinQuant를 함께 적용했습니다 [1]. OnePlus 12, 삼성 갤럭시 S24+ 같은 안드로이드 기기에서 원본 BF16 모델과 비교해 측정했습니다 [1]. 원본 품질과 안전성을 유지하면서 온디바이스 구동에 맞춘 사례입니다 [1].
도입효과: 모델 크기 평균 56% 감소·메모리 사용량 평균 41% 감소·추론 속도 2~4배 향상 (원본 BF16 대비, 안드로이드 기기 측정 기준) [1]

케이스 2bitsandbytes(LLM.int8()) — 175B 모델을 성능 손실 없이 8비트로

워싱턴대·Meta AI 연구진이 2022년 발표한 LLM.int8()는 거대 트랜스포머를 8비트 정수 행렬곱으로 추론하는 방법입니다 [2]. 값이 크게 튀는 일부 특이값만 16비트로 분리하고 나머지 99.9% 연산을 8비트로 처리합니다 [2]. Hugging Face bitsandbytes 라이브러리에 통합돼 사실상 표준으로 쓰입니다 [2]. 최대 1,750억(175B) 매개변수 모델을 소비자용 GPU에서 돌릴 수 있게 했습니다 [2].
도입효과: 추론 메모리 사용량 50% 감소(2배 절약), 성능 저하 0 — 최대 175B 규모에서 완전 정밀도 성능 유지 [2]

케이스 3MIT HAN Lab(AWQ) — 4비트로 노트북·엣지에서 LLM 가속

MIT HAN Lab의 AWQ는 활성값 분포를 기준으로 중요한 가중치를 보호하며 4비트로 압축하는 기법입니다 [3]. 2024년 MLSys 학회 최우수 논문으로 선정됐습니다 [3]. Jetson Orin Nano(8GB), RTX 4090 등에서 온디바이스 배포를 실증했습니다 [3]. Hugging Face FP16 구현과 비교해 속도를 측정했습니다 [3].
도입효과: 추론 속도 평균 3.2~3.3배 향상 (Hugging Face FP16 구현 대비, INT4 weight-only 기준) [3]

케이스 4FriendliAI(한국) — 정수 양자화로 추론 지연 2.46배 단축

FriendliAI는 서울대에서 출발한 한국의 AI 추론 인프라 기업입니다 [6]. 자사 Friendli Inference 엔진에 8비트 정수(INT8) 양자화를 적용했습니다 [6]. OPT-13B 모델을 NVIDIA A100 80GB GPU에서 FP16과 비교 측정했습니다 [6]. 같은 처리량 조건에서 지연 시간을 줄였다고 공식 블로그에 밝혔습니다 [6].
도입효과: 종단 간 추론 지연 2.46배 단축 (FP16 대비, OPT-13B·A100 80GB·동일 처리량 기준) [6]

주의할 점은?

오늘 바로 해보기
01. Hugging Face에서 bitsandbytes를 설치하고, 같은 모델을 load_in_8bit와 load_in_4bit 옵션으로 각각 불러옵니다.
02. 양자화 전후로 GPU 메모리 사용량(nvidia-smi)을 표에 적어 절감 폭을 확인합니다.
03. 동일한 프롬프트 20개를 두 버전에 넣고 응답 품질과 생성 속도를 나란히 비교합니다.
04. 4비트로 낮췄을 때 답이 어색해지는 질문 유형을 세 개 골라 메모합니다.
05. Meta의 양자화 Llama 블로그에서 크기·메모리·속도 수치를 읽고 우리 서비스 목표치와 비교합니다 [1].

한계와 진화
양자화의 한계는 정밀도를 낮출수록 정확도 손실 위험이 커진다는 점입니다. 특히 4비트 이하에서는 값이 크게 튀는 특이값(outlier) 처리가 어렵습니다. LLM.int8() 연구진은 이런 특이값만 16비트로 따로 분리하는 혼합 정밀도 방식을 써야 했습니다 [2]. 같은 4비트라도 GPTQ·AWQ처럼 어떤 값을 보호하며 반올림하느냐에 따라 정확도가 달라집니다 [3][4]. 가중치보다 활성값 양자화가 더 까다롭고, 모델과 과제마다 버틸 수 있는 하한 비트 수가 달라 반복 측정이 필요합니다 [3]. 무조건 낮추는 게 아니라 정확도 곡선이 꺾이는 지점을 찾는 작업입니다 [3]. 사후 양자화(PTQ)는 학습 없이 빠르게 적용할 수 있는 대신 정확도 방어가 어렵고, 손실이 크면 재보정이나 재학습이 필요합니다 [3]. 그래서 실무에서는 8비트로 먼저 안전하게 내린 뒤, 4비트는 품질을 확인해 가며 조심스럽게 적용하는 순서를 밟습니다 [2].
진화 방향은 두 갈래입니다.

  1. 학습 단계부터 양자화를 반영하는 양자화 인식 학습(QAT)입니다. Meta는 Llama 3.2 경량 모델에 QLoRA와 SpinQuant를 결합해 원본 품질을 유지하면서 크기를 평균 56% 줄였습니다 [1].
  2. 더 낮은 비트를 하드웨어가 직접 지원하는 흐름입니다. NVIDIA는 TensorRT-LLM에서 INT4·FP8 양자화를 기본 기능으로 제공합니다 [5]. 국내에서도 FriendliAI가 INT8 양자화로 추론 지연을 2.46배 단축한 결과를 공개하는 등, 양자화는 서빙 비용을 줄이는 표준 절차로 자리 잡는 흐름입니다 [6]. NVIDIA H100은 8비트 연산을 16비트 부동소수점 대비 두 배 빠르게 처리해, 낮춘 정밀도가 그대로 속도로 이어집니다 [6]. 최근에는 양자화를 LoRA 미세조정과 결합한 QLoRA처럼 여러 경량화 기법을 함께 쌓는 조합이 표준으로 굳어지는 추세입니다 [1].

참고 자료

  1. Introducing quantized Llama models with increased speed and a reduced memory footprint — 공식 기술블로그·Meta AI·2024 — https://ai.meta.com/blog/meta-llama-quantized-lightweight-models/
  2. LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale — arXiv 논문·Dettmers 외·2022 — https://arxiv.org/abs/2208.07339
  3. AWQ: Activation-aware Weight Quantization for On-Device LLM Compression — arXiv 논문(MLSys 2024 최우수)·MIT HAN Lab·2023 — https://arxiv.org/abs/2306.00978
  4. GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers — arXiv 논문·Frantar 외·2022 — https://arxiv.org/abs/2210.17323
  5. Quantization (TensorRT-LLM 공식 문서) — 공식 문서·NVIDIA·2024 — https://nvidia.github.io/TensorRT-LLM/latest/features/quantization.html
  6. Get an Extra Speedup of LLM Inference with Integer Quantization — 기술블로그·FriendliAI·2026 접속 — https://friendli.ai/blog/friendli-engine-integer-quantization

대표 출처

arXiv 논문 (2023) · MIT HAN Lab, AWQ (MLSys 2024 최우수논문)