LLM Observability
LLM 옵저버빌리티
개발 분야에서 쓰이는 LLM observability(대규모 언어모델 관측가능성)의 약자로, LLM 애플리케이션의 내부 상태를 그 출력으로 추적·이해·분석하는 체계입니다. 모델에 들어간 프롬프트, 나온 응답, 토큰 사용량, 지연, 비용, 그리고 중간의 검색·도구 호출을 트레이스 단위로 기록합니다. AI는 같은 입력에도 다른 답을 내는 비결정적 특성이 있어, 관측 도구 없이 디버깅하면 추측에 가까워집니다. 그래서 서비스에 올린 뒤 왜 이 답이 나왔는지 되짚고 품질을 감시하는 개발 공정으로 자리 잡았습니다.
쉽게 말하면?
LLM 옵저버빌리티는 AI 앱 속에서 무슨 일이 벌어졌는지 다 들여다보는 기록 장치예요. LLM은 대규모 언어모델(Large Language Model)을 줄인 말입니다. 발표 자료가 이상해졌을 때 누가 어느 슬라이드를 언제 고쳤는지 변경 이력을 펼쳐 보는 노션 페이지를 떠올리면 가깝습니다. 어떤 프롬프트가 들어갔고, 답이 얼마 만에 나왔고, 토큰을 얼마나 썼는지를 한 화면에 보여줘요. AI가 같은 질문에도 매번 조금씩 다르게 답하기 때문에, 이 기록이 없으면 문제 원인을 찾기 어렵습니다.
한 줄로 비유하면?
AI 응답이 나오기까지 모든 결재 단계를 되짚는 감사 로그입니다.
어디에 쓰이나?
케이스 1라쿠텐 — LangSmith로 사내 코파일럿 운영 가시성 확보
일본 라쿠텐은 LangChain과 LangSmith로 사내 AI 코파일럿을 구축했습니다 [6]. 프로토타입에서 프로덕션으로 넘어가는 단계에서 LangSmith로 프롬프트를 관리하고 커스텀 지표로 실험 결과를 측정했습니다 [6]. 공식 블로그는 이 플랫폼을 임직원 3만 2천 명 규모로 확대했다고 밝혔습니다 [6]. 무엇이 어디서 왜 실행되는지 들여다보는 관측 계층으로 LangSmith를 썼습니다 [6].
도입효과: 사내 코파일럿 임직원 32,000명 규모 배포, 생산성 20% 향상 목표 명시 (라쿠텐 공식 사례) [6]
케이스 2클라르나 — LangSmith로 AI 어시스턴트 디버깅
스웨덴 핀테크 클라르나는 LangSmith로 AI 어시스턴트의 단계별 동작을 관측하고 디버깅했습니다 [7]. 어떤 문제가 어디서 생겼는지 실행 흐름을 짚고, 평가와 프롬프트 반복으로 개선했습니다 [7]. 어시스턴트 자체는 활성 사용자 8,500만 명을 대상으로 운영된다고 공식 블로그에 적혀 있습니다 [7]. 관측·평가 계층이 대규모 서비스의 개선 근거를 만든 사례입니다 [7].
도입효과: AI 어시스턴트 평균 문의 해결 시간 80% 단축 (클라르나 공식 수치, LangSmith는 관측·평가 계층) [7]
케이스 3Langfuse — 오픈소스 LLM 관측 플랫폼
Langfuse는 오픈소스 LLM 엔지니어링 플랫폼입니다 [1]. 팀이 AI 앱을 함께 개발·감시·평가·디버깅하도록 돕는다고 공식 GitHub에 소개돼 있습니다 [1]. OpenTelemetry와 LangChain·OpenAI SDK 등과 통합됩니다 [1]. 사내에 트레이스 데이터를 두고 싶은 팀이 자체 호스팅으로 쓰는 대표 선택지입니다 [1].
도입효과: OpenTelemetry·주요 SDK 통합 오픈소스로 자체 호스팅 관측 지원 (외부 SaaS 의존 없이 트레이스 보관) [1]
케이스 4와탭랩스 — 국내 LLM 옵저버빌리티 제품 [한국]
한국 관측 기업 와탭랩스는 LLM 옵저버빌리티 제품을 제공합니다 [8]. 지연과 첫 토큰 시간, 토큰 소비, 요청·모델별 비용, 응답 품질을 추적한다고 공식 블로그에 적었습니다 [8]. AI 에이전트의 도구 호출 성공·실패와 루프 감지, GPU·쿠버네티스 지표까지 함께 봅니다 [8]. 기존 APM과 묶어 국내 환경에서 쓰려는 팀의 사례입니다 [8].
도입효과: 지연·토큰·비용·품질·에이전트 실행을 APM과 통합 모니터링 (정량 도입 수치 비공개) [8]
주의할 점은?
오늘 바로 해보기
01. 자사 AI 호출 한 건을 골라, 프롬프트·응답·토큰·지연을 손으로 적어 봅니다.
02. Langfuse 공식 문서에서 트레이스와 스팬이 각각 무엇을 담는지 확인합니다 [1].
03. 같은 요청을 두세 번 보내 답이 달라지는지 보고, 비결정성을 직접 체감합니다.
04. OpenTelemetry 생성형 AI 표준 속성(gen_ai.usage.input_tokens 등) 목록을 훑습니다 [4].
05. 자사 로그에 개인정보가 섞여 들어가는지 점검하고, 마스킹 대상을 표로 정리합니다 [1].
관측에도 과제가 있습니다. 트레이스는 프롬프트와 응답 전문을 저장하기 때문에 개인정보 보호가 걸립니다 [1]. 그래서 Langfuse 같은 도구는 민감정보 마스킹 기능을 따로 둡니다 [1]. 표준도 아직 무르익는 중입니다. OpenTelemetry의 생성형 AI 규약은 별도 저장소로 옮겨져 버전이 빠르게 바뀌고 있어, 안정된 표준으로 자리 잡기 전 단계입니다 [4][5]. 도구마다 속성명이 조금씩 달라 대시보드를 옮길 때 손이 갑니다 [5]. 품질 평가도 어렵습니다. 환각 같은 품질은 자동으로 재기 힘들어 모델 기반 평가·사용자 피드백·수작업 라벨링에 기댑니다 [2]. 지연과 토큰과 비용은 숫자로 바로 보이지만, 답이 맞는지는 별도의 판단이 필요하다는 뜻입니다 [2]. 관측 데이터가 많아질수록 저장 비용과 노이즈도 함께 늘어, 무엇을 남길지 고르는 일이 과제가 됩니다 [1].
진화 방향은 두 갈래입니다.
- OpenTelemetry 기반 표준화입니다. Datadog은 이 규약이 프레임워크와 벤더를 넘어 AI 관측을 측정·비교·상호운용 가능하게 만든다고 설명합니다 [5]. 표준 속성명을 맞추면 관측 도구를 바꿔도 지표가 이어집니다 [4].
- LLM 옵저버빌리티에서 에이전트 옵저버빌리티로 넓어지고 있습니다 [3]. 다단계 에이전트와 도구 호출, 루프까지 추적하는 방향이고, Datadog은 제품명을 에이전트 옵저버빌리티로 바꿨습니다 [3]. 라쿠텐이 사내 코파일럿을 3만 2천 명 규모로 운영하며 관측 계층으로 LangSmith를 둔 것도 같은 맥락입니다 [6]. 클라르나도 LangSmith로 AI 어시스턴트의 단계별 동작을 짚어 개선 근거를 만들었습니다 [7]. 국내 와탭도 에이전트 실행 추적과 GPU·쿠버네티스 지표를 함께 제공하며 이 흐름을 따라갑니다 [8]. 현재 시점에서는 트레이스·평가·비용을 한 화면에서 보는 구성이 표준에 가깝습니다.
참고 자료
- LLM Observability & Application Tracing (overview) — 공식 문서·Langfuse·2024~2025 — https://langfuse.com/docs/observability/overview
- What is LLM Observability & Monitoring? — 공식 FAQ·Langfuse·2024~2025 — https://langfuse.com/faq/all/llm-observability
- Agent Observability (LLM Observability) — 공식 문서·Datadog·2025 — https://docs.datadoghq.com/llm_observability/
- Gen AI semantic conventions (attributes registry) — 공식 표준·OpenTelemetry·2024~2026 — https://opentelemetry.io/docs/specs/semconv/registry/attributes/gen-ai/
- Datadog Agent Observability natively supports OTel GenAI Semantic Conventions — 공식 블로그·Datadog·2025 — https://www.datadoghq.com/blog/llm-otel-semantic-convention/
- Rakuten builds with LangChain and LangSmith — 공식 블로그·LangChain·2024 — https://www.langchain.com/blog/customers-rakuten
- Klarna customer story — 공식 블로그·LangChain·2025 — https://www.langchain.com/blog/customers-klarna
- LLM 옵저버빌리티란? — 공식 블로그·와탭랩스·2026 — https://whatap.io/ko/blog/what-is-llm-observability
대표 출처
Langfuse·Datadog·LangChain·와탭랩스 공식 (2024~2026) — 관측 문서·OTel 규약·고객 사례이 페이지에 대한 의견을 남겨주세요
여러분의 의견은 다음 갱신에 반영됩니다.