40건
MongoDB
몽고디비
2009년 미국 뉴욕에서 시작된 NoSQL 문서형 데이터베이스로, JSON과 비슷한 자유로운 형식으로 데이터를 저장하며 NoSQL 시장 1위이자 전 세계 개발자가 가장 많이 쓰는 비관계형 DB입니다.
데이터·DB
Vector DB
벡터 데이터베이스
AI 인프라 분야에서 쓰이는 용어로, 텍스트·이미지·코드를 숫자 벡터로 바꿔 저장한 다음 의미가 비슷한 벡터를 빠르게 찾아 주도록 설계된 데이터베이스로, RAG·시맨틱 검색·추천 시스템의 기반이 됩니다.
데이터·DB
Vector Database
벡터 DB
AI 인프라 분야에서 쓰이는 용어로, 임베딩 벡터를 저장하고 가장 가까운 의미를 가진 벡터들을 빠르게 찾아 주도록 만든 데이터베이스로, RAG·시맨틱 검색·추천에 폭넓게 쓰입니다.
데이터·DB
Data Labeling
데이터 라벨링
데이터·DB 분야에서 쓰이는 용어로, 원시 데이터에 의미나 정답 태그를 붙여 머신러닝이 그 라벨로 학습할 수 있게 만드는 작업입니다. Scale AI 공식 가이드는 지도학습이 대량의 라벨 데이터로 모델을 학습시켜 분류나 예측을 하게 한다고 설명합니다. 모델 성능은 데이터와 라벨의 품질에 좌우됩니다. 그래서 자주 간과되지만 머신러닝에서 결정적인 작업으로 꼽힙니다. 최근에는 사람 라벨링에 머신러닝을 결합해 일부를 자동화하기도 합니다.
데이터·DB
Synthetic Data
신세틱 데이터
데이터·DB 분야에서 쓰이는 용어로, 실제로 수집한 데이터 대신 알고리즘이나 모델로 인공 생성한 데이터를 뜻합니다. 영국 왕립학회는 특정 데이터 과제를 풀 목적으로 수학 모델이나 알고리즘으로 만든 데이터라고 정의합니다. 원본과 통계적 성질은 닮았지만 실제 개인 정보는 담지 않는 점이 특징입니다. 쓰임새는 크게 둘입니다. 실데이터를 쓰기 어려운 프라이버시 상황의 대체용, 그리고 희귀하거나 위험해서 모으기 힘든 상황을 시뮬레이션으로 채우는 보강용입니다.
데이터·DB
pgvector
피지벡터
AI 인프라 분야에서 쓰이는 용어로, 오픈소스 PostgreSQL에 임베딩 저장·유사도 검색 기능을 더해 주는 확장 모듈로, 기존 RDB에 곧바로 벡터 검색을 붙일 수 있어 운영 부담을 줄여 줍니다.
데이터·DB
MySQL
마이에스큐엘
1995년 스웨덴 출신 개발자가 만들어 현재 미국 Oracle이 운영하는 세계에서 가장 널리 쓰이는 오픈소스 관계형 데이터베이스로, 30년이 지난 지금도 한국 IT 서비스의 약 50%가 사용하는 사실상 표준 DB입니다.
데이터·DB
PostgreSQL
포스트그레스
AI 인프라 분야에서 쓰이는 용어로, 1986년에 시작된 오픈소스 관계형 DB로, pgvector 확장과 함께 쓰면 RDB·벡터·문서 검색을 단일 시스템에서 처리할 수 있어 RAG 백엔드로 자주 채택됩니다.
데이터·DB
NoSQL
노에스큐엘
Not Only SQL의 약자로, 행·열 표 구조의 관계형 DB 대신 문서·키-값·그래프 같은 자유로운 형식으로 데이터를 저장하는 데이터베이스 종류이며 빠른 확장·유연한 스키마가 필요한 현대 IT 서비스의 대안입니다.
데이터·DB
컨텍스트 롯
Context Rot
입력 컨텍스트가 길어질수록 언어 모델의 처리 품질이 고르지 않게 저하되는 현상입니다. 벡터DB 기업 크로마가 2025년 7월 기술 보고서에서 이름을 붙였고, GPT-4.1, 클로드 4, 제미나이 2.5 등 18개 모델 실험에서 단순한 과제조차 입력이 길어지면 정확도가 떨어짐을 확인했습니다. 컨텍스트 윈도우가 커졌다고 넣는 만큼 다 잘 읽는 것은 아니라는 뜻입니다. 필요한 정보만 골라 넣는 컨텍스트 엔지니어링이 중요해진 배경으로 꼽힙니다.
프롬프트·AI 활용
그라운딩
Grounding
데이터·DB 분야에서 쓰이는 용어로, 생성형 AI의 답변을 검증 가능한 외부 근거에 묶어 사실과 어긋나지 않게 만드는 기법입니다. Google 공식 문서는 모델에 특정 데이터 출처를 연결하면 답이 그 데이터에 매이면서 내용을 지어낼 가능성이 줄어든다고 설명합니다. 그라운딩은 상위 개념이고, 외부 지식베이스에서 근거 문서를 찾아 붙이는 검색 증강 생성(RAG)은 그라운딩을 구현하는 대표 기법입니다. 답에 출처 링크를 달아 나중에 근거를 되짚을 수 있게 하는 감사가능성도 함께 제공합니다.
기본
RLAIF
AI 모델 학습 분야에서 쓰이는 RLAIF(Reinforcement Learning from AI Feedback, 인공지능 피드백 기반 강화학습)의 약자로, 사람 대신 다른 LLM이 답안 두 개 중 더 나은 쪽을 골라 보상을 만들어 모델을 학습시키는 방법입니다.
보안·윤리
RLHF
AI 모델 학습 분야에서 쓰이는 Reinforcement Learning from Human Feedback(인간 피드백 기반 강화학습)의 약자로, 사람이 모델 답변 중 더 좋은 쪽을 골라준 기록을 보상으로 삼아 모델 행동을 다듬는 학습 방법입니다.
보안·윤리
함수 호출
Function Calling
AI 활용 분야에서 OpenAI가 2023년 6월에 공개한 API 기능으로, LLM이 답변 도중 미리 등록된 외부 함수를 JSON 인자로 호출하도록 만들어 도구·DB·실시간 데이터와 연결할 수 있게 한 방식입니다.
프롬프트·AI 활용
LlamaIndex
라마인덱스
AI 개발도구 분야에서 Jerry Liu가 2022년에 공개한 오픈소스 RAG·문서 검색 프레임워크로, 사내 문서·웹·DB를 LLM이 읽을 수 있도록 인덱싱·청크·검색을 한 줄로 연결하게 해주는 도구입니다.
AI 개발도구
LangChain
랭체인
AI 개발도구 분야에서 Harrison Chase가 2022년에 공개한 오픈소스 프레임워크로, 여러 LLM·벡터DB·도구를 한 줄로 연결해 RAG·에이전트·자동화 파이프라인을 빠르게 만들 수 있게 해줍니다.
AI 개발도구
Lovable
러버블
AI 활용 개발도구 분야에서 스웨덴 Lovable가 2024년에 공개한 한 줄 입력 풀스택 AI 빌더로, 디자인·프론트엔드·백엔드·DB 연결까지 자동 생성해 비개발자도 웹앱을 만들도록 한 서비스입니다.
AI 개발도구
Semantic Caching
시맨틱 캐싱
Semantic Caching은 글자가 똑같은 질문이 아니라 의미가 비슷한 질문까지 이전 답변을 재사용하는 캐시 방식입니다. 질문을 임베딩 벡터로 바꿔 저장해 두고, 새 질문이 들어오면 벡터 거리로 가장 가까운 항목을 찾아 기준값 안에 들면 저장된 답을 그대로 돌려줍니다. LLM 호출을 건너뛰므로 토큰 비용과 응답 시간이 함께 줄어듭니다. 대신 기준값을 느슨하게 잡으면 엉뚱한 답이 나가므로, 적중률과 정확도의 균형점을 찾는 일이 핵심입니다.
데이터·DB
BM25
비엠 이십오
정보 검색 분야에서 쓰이는 Best Matching 25(베스트 매칭 25)의 약자로, 질의어와 문서의 단어 일치도를 점수로 매기는 키워드 기반 랭킹 함수입니다. 1970년대와 1980년대에 Robertson과 Spärck Jones 등이 세운 확률적 검색 모델을 잇는 TF-IDF 계열 기법입니다 [1]. 문서 길이 정규화를 맡는 b와 용어 빈도 포화를 맡는 k1, 두 파라미터가 점수를 조절합니다 [3]. Apache Lucene과 Elasticsearch, OpenSearch가 기본 스코어링으로 채택했습니다 [2]. RAG의 하이브리드 검색에서는 의미 기반 벡터 검색과 짝을 이룹니다 [4].
데이터·DB
HNSW
에이치엔에스더블유
벡터 검색 분야에서 쓰이는 Hierarchical Navigable Small World(계층적 탐색 가능 소세계 그래프)의 약자로, 근사 최근접 이웃(ANN) 탐색에 쓰는 그래프 인덱스입니다. 벡터를 여러 층의 근접 그래프로 쌓고 위층에서 탐색 시작점을 좁혀 내려가는 구조이며, 원 논문은 로그 수준의 복잡도 확장을 보고했습니다 [1]. 정확도와 속도의 균형은 M, efConstruction, efSearch 값으로 조절합니다 [1]. 그래프와 벡터를 메모리에 올려 두는 방식이라 메모리 사용량이 큽니다 [7].
데이터·DB
Data Drift
데이터 드리프트
운영 중인 머신러닝 모델에 들어오는 입력 데이터의 통계적 분포가 학습 시점과 달라지는 현상입니다. 코로나19 같은 외부 충격, 계절성, 사용자 행동 변화가 원인이 되며, 모델은 그대로여도 예측 정확도가 조용히 떨어집니다. 입력과 정답의 관계 자체가 바뀌는 콘셉트 드리프트와 구분해서 씁니다. 배포 후 모니터링과 재학습 주기를 설계하는 MLOps의 핵심 근거가 되는 개념입니다.
데이터·DB
GraphRAG
그래프래그
검색 증강 생성 분야에서 쓰이는 Graph Retrieval-Augmented Generation(그래프 기반 검색 증강 생성)의 약자로, 문서에서 LLM으로 개체와 관계를 뽑아 지식그래프를 만들고 이를 검색에 활용하는 RAG 방식입니다. 비슷한 개체끼리 묶은 군집(커뮤니티)별 요약을 미리 만들어 두기 때문에, 문서 전체를 관통하는 '이 데이터의 주요 주제는 무엇인가' 같은 전역 질문에 강합니다. Microsoft Research가 2024년 논문과 오픈소스로 공개하며 확산했습니다.
데이터·DB
Text-to-SQL
텍스트 투 에스큐엘
자연어로 쓴 질문을 데이터베이스에서 실행할 수 있는 SQL 쿼리로 자동 변환하는 기술입니다. 학술적으로는 시맨틱 파싱의 대표 과제로, 2018년 예일대의 Spider 벤치마크가 표준 평가 기준을 세웠습니다. LLM 등장 이후 정확도가 크게 올라, 개발자가 아닌 직군도 채팅으로 데이터를 조회하는 사내 도구로 확산하고 있습니다. 다만 깨끗한 벤치마크와 달리 실제 기업 데이터베이스 환경에서는 정답률이 크게 떨어져, 사람의 검증 절차와 함께 쓰는 것이 전제입니다.
데이터·DB
Knowledge Graph
널리지 그래프
현실의 개체(사람·장소·상품 등)를 점(노드)으로, 개체 사이의 관계를 선(엣지)으로 표현해 지식을 그물망 구조로 저장하는 방식입니다. '문자열이 아니라 사물'을 다루므로, 흩어진 데이터를 관계로 연결해 추론과 검색에 씁니다. 관계를 따라가며 여러 단계 떨어진 사실도 한 번에 찾을 수 있습니다. 검색엔진의 개체 정보 카드, 추천, 그리고 최근에는 LLM의 근거 데이터(GraphRAG)로 활용됩니다.
데이터·DB
Hybrid Search
하이브리드 서치
키워드 기반 검색(BM25 같은 어휘 일치)과 의미 기반 벡터 검색을 함께 돌린 뒤, 두 결과를 하나의 순위로 합치는 검색 방식입니다. 정확한 단어·상품코드에 강한 키워드 검색과 동의어·자연어에 강한 벡터 검색의 약점을 서로 메웁니다. 두 점수를 합칠 때는 상호 순위 융합(RRF) 같은 방법을 씁니다. 오타·전문용어·자연어 질문이 섞여도 놓치지 않아, RAG와 상품 검색의 기본 구성으로 자리 잡았습니다.
데이터·DB
Reranking
리랭킹
검색이 1차로 넉넉히 뽑아 온 후보 문서를, 질문과의 관련도를 더 정교하게 다시 계산해 순서를 매기는 2차 정렬 단계입니다. 보통 질문과 문서를 한 쌍으로 함께 읽는 교차 인코더(cross-encoder)를 써서, 빠르지만 거친 1차 검색의 순위를 바로잡습니다. 계산이 무거워 전체가 아니라 상위 후보 수십 개에만 적용합니다. RAG에서 상위 몇 개만 LLM에 넘길 때 정답 문서를 위로 끌어올리는 역할을 합니다.
데이터·DB
Semantic Search
시맨틱 서치
단어의 철자 일치가 아니라 문장의 '의미'로 문서를 찾는 검색 방식입니다. 질문과 문서를 각각 벡터(임베딩)로 바꾼 뒤, 벡터 사이 거리가 가까운 것을 관련 있는 결과로 봅니다. 그래서 검색어와 겹치는 단어가 하나도 없어도 뜻이 통하면 찾아냅니다. 동의어·자연어 질문·오타에 강해 키워드 검색의 한계를 보완합니다. 문장 임베딩 기법과 벡터 데이터베이스가 발전하면서 실용화됐고, 지금은 RAG의 기본 검색 방식으로 쓰입니다.
데이터·DB
Chunking
청킹
긴 문서를 검색·임베딩에 알맞은 크기의 조각으로 잘라 나누는 전처리 작업입니다. RAG에서 원문을 통째로 넣을 수 없으므로, 문단·문장·토큰 단위로 나눠 각 조각을 벡터로 저장합니다. 너무 크게 자르면 관련 없는 내용이 섞이고, 너무 잘게 자르면 앞뒤 문맥이 끊깁니다. 조각 크기와 겹침(overlap) 설정이 검색 정확도를 좌우해, RAG 품질의 첫 단추로 꼽힙니다.
데이터·DB
Query
쿼리
데이터베이스·검색 엔진에서 원하는 정보를 찾기 위해 보내는 '질문'으로, SQL 한 줄·Google 검색어·API 호출 모두 쿼리의 한 형태입니다.
데이터·DB
Schema
스키마
데이터베이스의 구조 설계도로, 어떤 테이블에 어떤 컬럼이 있고 각 컬럼의 타입은 무엇이며 어떻게 연결되는지를 정의한 청사진입니다.
데이터·DB
Kafka
카프카
2011년 미국 LinkedIn에서 시작해 Apache 재단으로 이관된 오픈소스 분산 메시지·이벤트 스트리밍 플랫폼으로, 매초 수백만 건의 데이터를 안전하게 흘려 보내는 현대 대형 서비스의 핵심 인프라입니다.
데이터·DB
Airflow
에어플로우
2014년 미국 Airbnb에서 시작해 2019년 Apache 재단으로 이관된 오픈소스 워크플로우 오케스트레이션 도구로, '매일 새벽 데이터 가공·매주 보고서 발송' 같은 정기 작업을 자동 실행·관리하는 ETL 표준 도구입니다.
데이터·DB
ETL
이티엘
Extract(추출)·Transform(변환)·Load(적재)의 약자로, 여러 곳에 흩어진 데이터를 가져와 형식을 통일하고 분석용 데이터 창고에 적재하는 표준 데이터 처리 흐름이며 1980년대 미국 IT 산업에서 시작된 데이터 분석의 기본 절차입니다.
데이터·DB
Milvus
밀버스
AI 인프라 분야에서 중국 Zilliz가 2019년에 공개한 오픈소스 벡터 데이터베이스로, 수십억 단위 임베딩을 분산 처리하도록 설계된 대규모 RAG·검색·추천 인프라입니다.
데이터·DB
Qdrant
큐드란트
AI 인프라 분야에서 독일 Qdrant가 2021년에 공개한 오픈소스 벡터 데이터베이스로, Rust로 구현되어 고성능·고압축을 강점으로 RAG·검색·추천 시스템에 사용됩니다.
데이터·DB
Chroma
크로마
AI 인프라 분야에서 미국 Chroma가 2022년에 공개한 오픈소스 벡터 데이터베이스로, RAG 파이프라인이 임베딩을 저장·검색하는 핵심 인프라로 쓰이며 로컬 단일 파일부터 클라우드까지 동일 API로 동작합니다.
데이터·DB
Weaviate
위비에이트
AI 인프라 분야에서 네덜란드 Weaviate가 2019년에 공개한 오픈소스 벡터 데이터베이스로, 임베딩과 키워드 검색을 한 번에 하이브리드 방식으로 수행하는 RAG 인프라입니다.
데이터·DB
Pinecone
파인콘
AI 인프라 분야에서 미국 Pinecone Systems가 2019년에 공개한 매니지드 벡터 데이터베이스로, RAG·추천·시맨틱 검색용 임베딩을 대규모로 저장·검색해 주는 클라우드 서비스입니다.
데이터·DB
BigQuery
빅쿼리
2010년 미국 Google이 발표한 클라우드 데이터 웨어하우스로, 페타바이트 단위의 거대 데이터를 SQL 한 줄로 몇 초 안에 분석할 수 있게 해 주는 GCP의 대표 서비스이자 글로벌 데이터 분석 표준 중 하나입니다.
데이터·DB
Redis
레디스
2009년 이탈리아 출신 개발자 Salvatore Sanfilippo가 만들어 미국 Redis Labs(현 Redis Inc.)가 운영하는 인-메모리 키-값 데이터베이스로, 메모리에 데이터를 두고 1ms 이하로 읽고 쓰며 캐시·세션 관리·실시간 랭킹의 표준 도구입니다.
데이터·DB