CARD NEWS · 보안·윤리

Interpretability 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
보안·윤리

Interpretability란?

AI 활용 분야에서 쓰이는 용어로, 인공지능 모델 내부의 뉴런·회로·가중치 동작을 직접 들여다보며 모델이 왜 특정 답을 만드는지 인과적으로 추적하는 연구 분야로, Explainability의 더 깊은 형태입니다.

2/4
쉬운 풀이

AI 모델 안에서 어떤 뉴런과 회로가 켜져서 그런 답이 나왔는지를 직접 열어 보는 연구 분야예요

AI 모델 안에서 어떤 뉴런과 회로가 켜져서 그런 답이 나왔는지를 직접 열어 보는 연구 분야예요. 시험 답안만 보고 채점하는 것이 설명가능성이라면, 학생이 풀이 과정에서 어느 공식을 어떤 순서로 썼는지 노트 전체를 펼쳐 보는 쪽이 해석가능성입니다. 모델이 거짓말을 지어내거나 편향된 답을 낼 때 단순히 "왜 그랬는지" 추측하는 것이 아니라, 내부 회로 어디에서 어긋났는지 인과적으로 짚어 낼 수 있어야 환각·편향·정렬 실패를 진짜로 고칠 수 있다는 발상에서 출발했습니다. 최근에는 안전한 AI를 만들기 위한 핵심 도구로 인식돼 Anthropic·OpenAI·DeepMind가 모두 전담 팀을 운영합니다.

3/4
활용 사례

누가·언제 쓰나?

**케이스 1: Anthropic — Claude 3 Sonnet에서 3,400만 특징 발견** Anthropic 인터프리터빌리티 팀은 2024년 5월 「Scaling Monosemanticity」를 공개하고, Claude 3 Sonnet의 중간층 잔차 스트림에 희소 오토인코더(SAE)를 학습시켜 3,400만 개 특징을 추출했습니다 [1]. 인간 평가자 기준 약 70%가 해석 가능하다고 분류

4/4
더 알아보기

ai.percent.ac
/word/interpretability

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.