19건
토큰
Token
AI 기초 분야에서 쓰이는 용어로, LLM이 사람의 문장을 처리할 때 사용하는 최소 단위로, 단어보다 작은 음절이나 조각으로 잘려 모델 입력·출력 길이와 비용을 계산하는 기준이 됩니다.
기본
Token Cost
토큰 비용
AI 활용 분야에서 쓰이는 용어로, LLM API 호출 비용이 입력·출력 토큰 수 단위로 청구되는 구조와 그 단가를 일컫는 표현으로, 캐싱·배치·모델 선택으로 절감할 수 있습니다.
프롬프트·AI 활용
Max Tokens
맥스 토큰
AI 활용 분야에서 쓰이는 용어로, LLM API 호출 시 모델이 한 번의 응답에서 생성할 수 있는 최대 토큰 수를 사용자가 직접 지정해 응답 길이·비용·지연 시간을 제어하는 파라미터입니다.
프롬프트·AI 활용
Agentic RAG
에이전틱 랙
AI 트렌드 분야에서 쓰이는 Agentic Retrieval-Augmented Generation(에이전트형 검색 증강 생성)의 약자로, 검색과 생성 사이에 스스로 판단하는 에이전트를 끼운 구조입니다. 2025년 1월 서베이 논문은 반성·계획·도구 사용·다중 에이전트 협업 패턴을 파이프라인에 넣어 검색 전략을 상황에 맞게 바꾸는 방식으로 정의합니다. 기존 RAG가 질문 한 번에 검색 한 번이라면, 에이전틱 RAG는 질문을 쪼개고 결과를 본 뒤 다시 검색합니다. 정확도는 오르지만 지연 시간과 토큰 비용이 함께 늘어납니다.
AI 트렌드
Semantic Caching
시맨틱 캐싱
Semantic Caching은 글자가 똑같은 질문이 아니라 의미가 비슷한 질문까지 이전 답변을 재사용하는 캐시 방식입니다. 질문을 임베딩 벡터로 바꿔 저장해 두고, 새 질문이 들어오면 벡터 거리로 가장 가까운 항목을 찾아 기준값 안에 들면 저장된 답을 그대로 돌려줍니다. LLM 호출을 건너뛰므로 토큰 비용과 응답 시간이 함께 줄어듭니다. 대신 기준값을 느슨하게 잡으면 엉뚱한 답이 나가므로, 적중률과 정확도의 균형점을 찾는 일이 핵심입니다.
데이터·DB
KV Cache
케이브이 캐시
LLM 추론 분야에서 쓰이는 Key-Value Cache(키-값 캐시)의 약자로, 언어 모델이 답을 생성할 때 앞 토큰들의 어텐션 계산 결과인 키와 값을 GPU 메모리에 저장해 두고 재사용하는 기법입니다. 매 토큰마다 전체 문맥을 다시 계산하는 낭비를 없애 생성 속도를 높입니다. 대신 문맥이 길어질수록 캐시가 메모리를 차지해, LLM 서빙 비용과 컨텍스트 길이 한계를 결정하는 핵심 변수가 됩니다. API 제공사의 프롬프트 캐싱 할인은 이 캐시를 재사용하는 상용화 형태입니다.
개발
AI 워터마킹
AI Watermarking
AI가 만든 이미지·영상·텍스트에 사람 눈에는 보이지 않는 신호나 메타데이터를 심어, 나중에 AI 생성물임을 식별할 수 있게 하는 기술입니다. 구글 딥마인드의 SynthID처럼 픽셀·토큰 확률에 신호를 심는 방식과, C2PA 표준처럼 콘텐츠 출처·편집 이력을 메타데이터로 붙이는 방식이 대표적입니다. 한국 AI 기본법(2026년 1월 시행)과 EU AI법(2026년 8월 적용)이 생성물 표시를 의무화하면서 규제 준수 기술로 부상했습니다.
보안·윤리
LLM Observability
LLM 옵저버빌리티
개발 분야에서 쓰이는 LLM observability(대규모 언어모델 관측가능성)의 약자로, LLM 애플리케이션의 내부 상태를 그 출력으로 추적·이해·분석하는 체계입니다. 모델에 들어간 프롬프트, 나온 응답, 토큰 사용량, 지연, 비용, 그리고 중간의 검색·도구 호출을 트레이스 단위로 기록합니다. AI는 같은 입력에도 다른 답을 내는 비결정적 특성이 있어, 관측 도구 없이 디버깅하면 추측에 가까워집니다. 그래서 서비스에 올린 뒤 왜 이 답이 나왔는지 되짚고 품질을 감시하는 개발 공정으로 자리 잡았습니다.
AI 개발도구
Chunking
청킹
긴 문서를 검색·임베딩에 알맞은 크기의 조각으로 잘라 나누는 전처리 작업입니다. RAG에서 원문을 통째로 넣을 수 없으므로, 문단·문장·토큰 단위로 나눠 각 조각을 벡터로 저장합니다. 너무 크게 자르면 관련 없는 내용이 섞이고, 너무 잘게 자르면 앞뒤 문맥이 끊깁니다. 조각 크기와 겹침(overlap) 설정이 검색 정확도를 좌우해, RAG 품질의 첫 단추로 꼽힙니다.
데이터·DB
MoE
믹스처 오브 엑스퍼츠
모델 구조 분야에서 쓰이는 Mixture of Experts(전문가 혼합)의 약자로, 여러 전문가 하위망 중 입력마다 일부만 골라 활성화하는 신경망 구조입니다. '라우터'라 불리는 게이팅 신경망이 토큰마다 소수의 전문가만 선택합니다. 전체 파라미터 수는 크게 늘리되 실제 계산에는 일부만 쓰기 때문에, 같은 연산량으로 더 큰 모델급 성능을 노립니다. Mixtral, DeepSeek-V3 같은 최신 대형 모델이 이 구조를 채택했습니다.
모델·서비스
Speculative Decoding
스페큘러티브 디코딩
작고 빠른 '초안(draft) 모델'이 다음 토큰 여러 개를 먼저 제안하면, 크고 정확한 본 모델이 이를 한 번에 검증해 맞은 부분까지 통째로 채택하는 추론 가속 기법입니다. 토큰을 하나씩 순서대로 생성하던 과정을 병렬 검증으로 바꿔 속도를 높입니다. 틀린 토큰이 나온 지점부터 본 모델이 다시 이어 씁니다. 최종 출력은 본 모델이 혼자 생성한 것과 동일하게 유지되는 것이 특징입니다. 2022년 구글 연구진이 정리했습니다.
기본
JWT
제이더블유티 (또는 좌트)
JSON Web Token의 약자로, 2015년 미국에서 IETF 표준으로 정립된 인증 토큰 형식이며 사용자가 로그인 후 받는 '신분증 같은 문자열'을 의미하고 현대 웹·앱 API 인증의 사실상 표준입니다.
보안·윤리
Streaming
스트리밍
AI 활용 분야에서 쓰이는 용어로, LLM이 응답을 다 완성한 다음 한꺼번에 보내지 않고 토큰 단위로 생성되는 즉시 사용자 화면에 실시간으로 흘려보내는 출력 방식입니다.
프롬프트·AI 활용
Color Palette
컬러 팔레트
한 제품·브랜드에서 사용할 색의 모음으로, 주 색·보조 색·강조 색·배경 색을 체계적으로 정해 두는 디자인 토큰의 핵심 요소입니다.
디자인
Adaptive Reasoning
어댑티브 리즈닝
AI 활용 분야에서 쓰이는 용어로, LLM이 질문 난이도에 따라 추론에 쓸 시간·토큰을 알아서 늘리거나 줄여 답하는 방식으로, 추론 모델 시대의 자율적 사고량 조절 능력을 가리킵니다.
AI 트렌드
Extended Thinking
익스텐디드 씽킹
AI 활용 분야에서 Anthropic이 2025년에 도입한 기능으로, Claude가 답하기 전에 정해진 토큰 예산만큼 내부적으로 길게 생각한 다음 응답하도록 추론 깊이를 사용자가 직접 조절하는 모드입니다.
AI 트렌드
Claude Haiku 4.5
클로드 하이쿠
AI 모델 분야에서 Anthropic이 공개한 Claude 4 계열 경량 라인으로, 응답 속도와 토큰 단가를 최소화해 대규모 처리·실시간 응답 시나리오에 쓰이는 LLM(Large Language Model, 거대 언어 모델)입니다.
모델·서비스
Throughput
쓰루풋
AI 모델 운영 분야에서 쓰이는 용어로, LLM 서비스가 단위 시간당 처리할 수 있는 토큰 양 또는 동시 요청 수를 가리키며, 보통 초당 토큰(TPS) 단위로 측정하는 성능 지표입니다.
기본
컨텍스트 윈도우
Context Window
AI 활용 분야에서 쓰이는 용어로, LLM이 한 번의 대화·요청에서 동시에 기억하고 처리할 수 있는 입력과 출력의 최대 토큰 수를 가리키며, 긴 문서 분석·코드 베이스 이해의 한계를 결정합니다.
기본