1/4
보안·윤리
Interpretability란?
AI 활용 분야에서 쓰이는 용어로, 인공지능 모델 내부의 뉴런·회로·가중치 동작을 직접 들여다보며 모델이 왜 특정 답을 만드는지 인과적으로 추적하는 연구 분야로, Explainability의 더 깊은 형태입니다.
CARD NEWS · 보안·윤리
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 화면을 캡처하거나 브라우저의 인쇄 기능으로 PDF를 저장해 공유할 수 있습니다.
AI 활용 분야에서 쓰이는 용어로, 인공지능 모델 내부의 뉴런·회로·가중치 동작을 직접 들여다보며 모델이 왜 특정 답을 만드는지 인과적으로 추적하는 연구 분야로, Explainability의 더 깊은 형태입니다.
AI 모델 안에서 어떤 뉴런과 회로가 켜져서 그런 답이 나왔는지를 직접 열어 보는 연구 분야예요. 시험 답안만 보고 채점하는 것이 설명가능성이라면, 학생이 풀이 과정에서 어느 공식을 어떤 순서로 썼는지 노트 전체를 펼쳐 보는 쪽이 해석가능성입니다.
케이스 1: Anthropic — Claude 3 Sonnet에서 3,400만 특징 발견 Anthropic 인터프리터빌리티 팀은 2024년 5월 「Scaling Monosemanticity」를 공개하고, Claude 3 Sonnet의 중간층 잔차 스트림에 희소 오토인코더(SAE)를 학습시켜 3,400만 개 특징을 추출했습니다 [1].
카드를 캡처하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 쓸 수 있습니다. CC BY-SA 4.0에 따라 출처(AI for Everyone by Percent · ai.percent.ac)와 라이선스를 표시하면 상업적으로도 이용할 수 있습니다. 내용을 바꿨다면 그 사실을 밝히고 같은 라이선스로 공유해 주세요.