CARD NEWS · 기본

SFT 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
기본

SFT란?

인공지능 학습 분야에서 쓰이는 Supervised Fine-Tuning(지도 미세조정)의 약자로, 사전학습을 마친 언어 모델에 사람이 만든 모범 질문·답변 쌍을 추가 학습시켜 지시를 따르게 만드는 사후학습 단계입니다. 원시 텍스트만 학습한 베이스 모델은 문장을 이어 쓸 뿐 지시 수행이 서툽니다. 그래서 SFT로 응답 형식과 태도를 먼저 가르친 뒤 RLHF나 DPO 같은 선호 최적화를 이어 적용하는 것이 표준 절차입니다. 오늘날 챗봇형 AI 대부분이 이 단계를 거쳐 만들어집니다.

2/4
쉬운 풀이

에스에프티(SFT)는 Supervised Fine-Tuning, 즉 지도 미세조정의 약자예요

에스에프티(SFT)는 Supervised Fine-Tuning, 즉 지도 미세조정의 약자예요. 책을 많이 읽어 아는 것은 많지만 업무 응대는 서툰 신입에게 모범 문답집을 주고 따라 하게 하는 교육 단계라고 보면 됩니다. 이 과정을 거치면 문장을 이어 쓰기만 하던 모델이 질문에 답하는 비서처럼 바뀝니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: OpenAI(미국) — 챗GPT의 기초가 된 인스트럭트GPT OpenAI는 2022년 인스트럭트GPT 논문에서 SFT와 인간 피드백 강화학습을 결합한 사후학습 절차를 제시했습니다 [1]. 라벨러가 작성한 모범 답변으로 SFT를 먼저 수행하고 선호 데이터를 추가 학습했습니다 [1]. 이 절차는 이후 챗GPT 계열 모델의 표준이 됐습니다. 도입효과: 평가자 선호도에서 13억 파라미터

4/4
더 알아보기

ai.percent.ac
/word/sft

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.