CARD NEWS · 모델·서비스

MoE 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 화면을 캡처하거나 브라우저의 인쇄 기능으로 PDF를 저장해 공유할 수 있습니다.

1/4
모델·서비스

MoE란?

모델 구조 분야에서 쓰이는 Mixture of Experts(전문가 혼합)의 약자로, 여러 전문가 하위망 중 입력마다 일부만 골라 활성화하는 신경망 구조입니다. '라우터'라 불리는 게이팅 신경망이 토큰마다 소수의 전문가만 선택합니다. 전체 파라미터 수는 크게 늘리되 실제 계산에는 일부만 쓰기 때문에, 같은 연산량으로 더 큰 모델급 성능을 노립니다. Mixtral, DeepSeek-V3 같은 최신 대형 모델이 이 구조를 채택했습니다.

2/4
쉬운 풀이

이렇게 이해하면 쉬워요

믹스처 오브 엑스퍼츠(MoE, Mixture of Experts)는 여러 전문가 중 문제마다 딱 맞는 몇 명만 불러 쓰는 구조입니다. 모델 안에 작은 전문가 신경망을 여러 개 두고, '라우터'가 입력 토큰마다 그중 소수만 골라 답을 맡겨요. 하나의 큰 회의에 전원을 부르는 대신, 안건별로 담당 실무자 두 명만 호출해 처리하는 방식과 비슷합니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: Google Brain — 현대 MoE의 출발점(2017) Google Brain 연구진은 2017년 희소 게이팅 방식의 MoE 층을 제안했습니다 [1]. 신경망 사이에 수천 개의 전문가를 두고, 게이팅 망이 입력마다 소수만 활성화했습니다 [1]. 언어 모델링과 기계 번역에 적용했습니다 [1]. 계산량은 조금만 늘리고 모델 용량을 크게 키우는 길을 보였습니다 [1].

4/4
더 알아보기

ai.percent.ac
/word/mixture-of-experts

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 캡처하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 쓸 수 있습니다. CC BY-SA 4.0에 따라 출처(AI for Everyone by Percent · ai.percent.ac)와 라이선스를 표시하면 상업적으로도 이용할 수 있습니다. 내용을 바꿨다면 그 사실을 밝히고 같은 라이선스로 공유해 주세요.