CARD NEWS · 보안·윤리

Guardrails 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
보안·윤리

Guardrails란?

보안·윤리·거버넌스 분야에서 쓰이는 용어로, 모델을 다시 학습시키지 않고 입력과 출력을 실행 시점에 통제해 위험한 응답을 걸러내는 외부 안전장치입니다. 유해 주제 회피, 정해진 대화 흐름 준수, 특정 형식 강제 같은 규칙을 모델과 별개로 설정합니다. 구현은 크게 두 갈래입니다. 규칙과 대화 흐름을 코드로 짜두는 프로그래머블 레일 방식과, 입력과 출력을 안전·위험으로 분류하는 모델 기반 세이프가드 방식으로 나뉩니다. 학습 단계의 정렬과 달리 운영 중에 언제든 고쳐 쓸 수 있는 점이 특징입니다.

2/4
쉬운 풀이

가드레일은 AI가 하면 안 되는 말을 하지 않도록 옆에 세워두는 난간 같은 장치입니다

가드레일은 AI가 하면 안 되는 말을 하지 않도록 옆에 세워두는 난간 같은 장치입니다. 모델 자체를 뜯어고치지 않고, 들어오는 질문과 나가는 답을 실시간으로 검사해 위험한 내용을 막아요. 조별 과제 제출 전에 표절·비속어·형식을 점검하는 최종 검토 체크리스트를 떠올리면 가깝습니다. 예를 들어 회사 챗봇이 욕설 요청을 받으면, 모델에 닿기 전에 입력 가드가 걸러내고 답이 나갈 때 출력 가드가 한 번 더 확인해요. 그래서 서비스를 열기 전 안전 요건을 맞추는 표준 장치로 자리 잡았습니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: Meta — Llama Guard로 입출력 동시 분류 Meta는 2023년 12월 Llama Guard를 공개했습니다 [2]. Llama2-7B를 안전 분류용으로 튜닝해, 사용자 프롬프트와 모델 응답을 각각 안전·위험으로 나눕니다 [2]. 논문은 OpenAI Moderation 데이터셋에서 해당 데이터로 학습하지 않고도 기존 상용 도구에 필적하는 성능을 보고했습니다 [2]. 사내

4/4
더 알아보기

ai.percent.ac
/word/guardrails

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.