8

Memory
메모리
AI 활용 분야에서 쓰이는 용어로, LLM이 한 대화 세션을 넘어 사용자의 이름·취향·기존 작업 내역을 지속적으로 기억하고 다음 대화에 자동으로 반영하는 장기 컨텍스트 기능을 가리킵니다.
프롬프트·AI 활용
HNSW
에이치엔에스더블유
벡터 검색 분야에서 쓰이는 Hierarchical Navigable Small World(계층적 탐색 가능 소세계 그래프)의 약자로, 근사 최근접 이웃(ANN) 탐색에 쓰는 그래프 인덱스입니다. 벡터를 여러 층의 근접 그래프로 쌓고 위층에서 탐색 시작점을 좁혀 내려가는 구조이며, 원 논문은 로그 수준의 복잡도 확장을 보고했습니다 [1]. 정확도와 속도의 균형은 M, efConstruction, efSearch 값으로 조절합니다 [1]. 그래프와 벡터를 메모리에 올려 두는 방식이라 메모리 사용량이 큽니다 [7].
데이터·DB
KV Cache
케이브이 캐시
LLM 추론 분야에서 쓰이는 Key-Value Cache(키-값 캐시)의 약자로, 언어 모델이 답을 생성할 때 앞 토큰들의 어텐션 계산 결과인 키와 값을 GPU 메모리에 저장해 두고 재사용하는 기법입니다. 매 토큰마다 전체 문맥을 다시 계산하는 낭비를 없애 생성 속도를 높입니다. 대신 문맥이 길어질수록 캐시가 메모리를 차지해, LLM 서빙 비용과 컨텍스트 길이 한계를 결정하는 핵심 변수가 됩니다. API 제공사의 프롬프트 캐싱 할인은 이 캐시를 재사용하는 상용화 형태입니다.
개발
vLLM
브이엘엘엠
LLM 추론·서빙 분야의 오픈소스 엔진으로, 같은 GPU에서 더 많은 요청을 처리하도록 메모리 관리를 최적화한 것이 핵심입니다. UC 버클리에서 시작했고, 운영체제의 가상 메모리에서 착안한 PagedAttention 기법으로 KV 캐시 낭비를 4% 미만으로 줄였습니다. 이름의 v도 가상(virtual)에서 왔습니다. 2023년 논문 기준 동급 지연시간에서 기존 서빙 시스템 대비 처리량을 2~4배 높였고, 지금은 사실상의 표준 오픈소스 추론 엔진으로 불립니다.
AI 개발도구
HBM
에이치비엠
메모리 반도체 분야에서 쓰이는 High Bandwidth Memory(고대역폭 메모리)의 약자로, D램 칩을 수직으로 쌓고 실리콘 관통 전극(TSV)으로 연결해 프로세서와 데이터를 초광폭 통로로 주고받는 메모리입니다. 국제 표준화 기구 JEDEC이 규격을 정하며, 2025년 4월 확정된 HBM4 표준은 2,048비트 인터페이스로 스택당 최대 2TB/s 대역폭을 냅니다. LLM 추론 속도가 메모리 대역폭에 좌우되면서 AI 가속기의 핵심 부품이 됐습니다.
AI 트렌드
Quantization
퀀타이제이션
AI 모델의 가중치와 활성값을 32비트·16비트 부동소수점에서 8비트·4비트 정수 같은 낮은 정밀도로 바꿔 크기와 연산량을 줄이는 모델 경량화 기법입니다. 정밀도를 낮추면 메모리 사용량과 응답 지연이 함께 줄어, 같은 GPU에서 더 큰 모델을 올리거나 휴대폰에서 온디바이스로 구동할 수 있습니다. 학습을 마친 모델에 적용하는 사후 양자화(PTQ)와 학습 과정에 반영하는 양자화 인식 학습(QAT)으로 나뉩니다. 정확도 손실을 얼마나 억제하느냐가 관건입니다.
기본
Redis
레디스
2009년 이탈리아 출신 개발자 Salvatore Sanfilippo가 만들어 미국 Redis Labs(현 Redis Inc.)가 운영하는 인-메모리 키-값 데이터베이스로, 메모리에 데이터를 두고 1ms 이하로 읽고 쓰며 캐시·세션 관리·실시간 랭킹의 표준 도구입니다.
데이터·DB
SLM
AI 모델 분야에서 쓰이는 Small Language Model(소형 언어 모델)의 약자로, 적은 메모리·전력으로도 로컬 단말이나 서버에서 빠르게 동작하도록 만든 소규모 인공지능 모델입니다.
기본
검색 · AI for Everyone