MoE
믹스처 오브 엑스퍼츠
모델 구조 분야에서 쓰이는 Mixture of Experts(전문가 혼합)의 약자로, 여러 전문가 하위망 중 입력마다 일부만 골라 활성화하는 신경망 구조입니다. '라우터'라 불리는 게이팅 신경망이 토큰마다 소수의 전문가만 선택합니다. 전체 파라미터 수는 크게 늘리되 실제 계산에는 일부만 쓰기 때문에, 같은 연산량으로 더 큰 모델급 성능을 노립니다. Mixtral, DeepSeek-V3 같은 최신 대형 모델이 이 구조를 채택했습니다.
쉽게 말하면?
믹스처 오브 엑스퍼츠(MoE, Mixture of Experts)는 여러 전문가 중 문제마다 딱 맞는 몇 명만 불러 쓰는 구조입니다. 모델 안에 작은 전문가 신경망을 여러 개 두고, '라우터'가 입력 토큰마다 그중 소수만 골라 답을 맡겨요. 하나의 큰 회의에 전원을 부르는 대신, 안건별로 담당 실무자 두 명만 호출해 처리하는 방식과 비슷합니다. 그래서 전체 규모는 크지만 매번 도는 계산은 일부라, 큰 모델의 성능을 더 싼 연산으로 얻습니다. 다만 라우터가 일감을 고르게 나눠 주도록 관리하는 게 관건이에요.
한 줄로 비유하면?
안건별 담당 실무자 두 명만 호출해 처리하는 태스크포스 회의입니다.
어디에 쓰이나?
케이스 1Google Brain — 현대 MoE의 출발점(2017)
Google Brain 연구진은 2017년 희소 게이팅 방식의 MoE 층을 제안했습니다 [1]. 신경망 사이에 수천 개의 전문가를 두고, 게이팅 망이 입력마다 소수만 활성화했습니다 [1]. 언어 모델링과 기계 번역에 적용했습니다 [1]. 계산량은 조금만 늘리고 모델 용량을 크게 키우는 길을 보였습니다 [1].
도입효과: 모델 용량 1,000배 이상 증가·계산 효율 손실 최소 (기존 비조건부 모델 대비, 최대 1,370억 파라미터 MoE 구현) [1]
케이스 2Mistral AI(Mixtral 8x7B) — 토큰당 일부만 쓰는 오픈 MoE
Mistral AI는 2023년 각 층에 전문가 8개를 두고 토큰마다 2개만 고르는 Mixtral 8x7B를 공개했습니다 [3]. 라우터가 토큰별로 전문가를 선택합니다 [3]. 전체 파라미터는 46.7B이지만 토큰당 12.9B만 씁니다 [3]. 대부분 벤치마크에서 Llama 2 70B를 앞섰습니다 [3].
도입효과: 토큰당 활성 파라미터 12.9B(전체 46.7B 중), Llama 2 70B 대비 추론 6배 빠름 [3]
케이스 3DeepSeek — 671B MoE로 토큰당 37B만 활성화
DeepSeek는 2024년 671B 규모의 MoE 모델 DeepSeek-V3를 공개했습니다 [4]. 토큰마다 전체의 일부인 37B만 활성화합니다 [4]. 보조 손실 없이 전문가 부하를 고르게 맞추는 기법을 적용했습니다 [4]. 14.8조 토큰으로 사전학습했습니다 [4].
도입효과: 총 파라미터 671B·토큰당 활성 37B, 전체 학습에 H800 GPU 278.8만 시간 소요 (DeepSeek-V3 기준) [4]
케이스 4LG AI연구원(한국) — K-EXAONE 236B MoE, 국내 유일 글로벌 톱10
LG AI연구원은 2026년 1월 MoE 구조의 K-EXAONE-236B-A23B를 공개했습니다 [5]. 총 236B 파라미터 중 추론 때 약 23B(약 10%)만 활성화합니다 [6]. 전문가 128개 중 8개와 공유 전문가 1개를 함께 씁니다 [5]. Artificial Analysis의 인텔리전스 지수에서 7위에 올랐습니다 [6].
도입효과: 총 236B·활성 23B(약 10%) MoE, Artificial Analysis 인텔리전스 지수 글로벌 7위(국내 유일 톱10) [6]
주의할 점은?
오늘 바로 해보기
01. Mixtral 공식 블로그에서 '전체 46.7B·토큰당 12.9B' 문장을 찾아 전체와 활성 파라미터의 차이를 한 줄로 정리합니다 [3].
02. Hugging Face에서 Mixtral 계열 모델 카드를 열어 전문가 수와 토큰당 선택 수(top-k)를 확인합니다.
03. 같은 프롬프트를 밀집(dense) 모델과 MoE 모델에 넣고 응답 속도·품질을 비교합니다.
04. 라우터가 전문가에게 일감을 고르게 나누는지(load balancing)가 왜 중요한지 한 문단으로 적어 봅니다.
05. DeepSeek-V3 리포트에서 '671B 중 37B 활성' 수치의 학습 비용(H800 시간)을 확인합니다 [4].
한계와 진화
MoE의 한계는 전체 파라미터를 모두 메모리에 올려야 한다는 점입니다. 토큰당 계산은 적어도, 전문가 전체를 적재해야 해 GPU 메모리 부담이 큽니다 [3]. 라우터가 특정 전문가에만 일감을 몰아주면 나머지가 놀게 되어, 부하 균형을 맞추는 별도 장치가 필요합니다 [1]. 전문가 병렬화로 여러 GPU에 나눠 올리면 통신 비용도 늘어, 서빙 설계가 밀집 모델보다 까다롭습니다 [4]. 또 학습 때 전문가들이 특정 패턴에만 쏠려 전문성이 겹치면, 파라미터를 늘린 만큼의 이득이 나오지 않습니다 [1]. 추론 시에도 어떤 전문가가 호출될지 미리 알기 어려워, 지연 시간이 입력마다 들쭉날쭉할 수 있습니다 [4]. 즉 '싼 계산'을 얻는 대신 메모리·라우팅·분산 운영의 복잡성을 감수해야 합니다 [4].
진화 방향은 두 갈래입니다.
- 전문가를 잘게 쪼개고 공유 전문가를 두는 세분화 MoE입니다. DeepSeek-V3는 이 방식과 보조 손실 없는 부하 균형으로 671B를 토큰당 37B만 활성화해 돌립니다 [4].
- 프런티어급 성능을 효율적으로 내려는 흐름으로 확산 중입니다. Mistral의 Mixtral이 오픈 MoE를 대중화했고, 국내에서는 LG AI연구원의 K-EXAONE가 총 236B·활성 23B MoE로 글로벌 톱10에 진입했습니다 [3][6]. 2021년 구글의 Switch Transformer는 이 구조를 조 단위 파라미터까지 밀어붙여 사전학습 속도를 크게 끌어올렸습니다 [2]. 밀집 모델과 같은 추론 비용으로 더 큰 파라미터 용량을 확보하려는 대형 모델들이 잇따라 채택하면서, MoE는 개방형 모델과 프런티어 모델 양쪽에서 기본 설계 선택지로 자리 잡는 흐름입니다 [3][4].
참고 자료
- Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer — arXiv 논문·Google Brain(Shazeer 외)·2017 — https://arxiv.org/abs/1701.06538
- Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity — arXiv 논문·Google·2021 — https://arxiv.org/abs/2101.03961
- Mixtral of experts — 공식 기술블로그·Mistral AI·2023 — https://mistral.ai/news/mixtral-of-experts/
- DeepSeek-V3 Technical Report — arXiv 기술리포트·DeepSeek-AI·2024 — https://arxiv.org/abs/2412.19437
- K-EXAONE-236B-A23B (모델 카드) — 공식 모델 릴리스·LG AI연구원 / Hugging Face·2026 — https://huggingface.co/LGAI-EXAONE/K-EXAONE-236B-A23B
- LG's K-Exaone breaks into global top 10 AI rankings — 권위 매체·The Korea Herald·2026 — https://www.koreaherald.com/article/10652980
대표 출처
공식 기술블로그 (2023) · Mistral AI, Mixtral of experts이 페이지에 대한 의견을 남겨주세요
여러분의 의견은 다음 갱신에 반영됩니다.