Groq란?
AI 인프라 분야에서 미국 Groq Inc.가 2016년에 창업해 자체 설계한 LPU 추론 칩으로, Llama·Mistral 같은 오픈 모델을 초고속으로 실행하는 클라우드 추론 서비스를 함께 운영합니다.
CARD NEWS · 모델·서비스
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.
AI 인프라 분야에서 미국 Groq Inc.가 2016년에 창업해 자체 설계한 LPU 추론 칩으로, Llama·Mistral 같은 오픈 모델을 초고속으로 실행하는 클라우드 추론 서비스를 함께 운영합니다.
Groq는 ChatGPT 같은 거대 언어 모델이 답을 빠르게 내놓도록 도와주는 전용 칩(LPU)과 그 칩을 묶은 클라우드 서비스입니다. 같은 모델이라도 일반 GPU 서버보다 답이 몇 배 빠르게 떠올라서, 사용자가 '전송'을 누르고 1초도 안 돼 글이 완성되는 체감이에요. 시험 기간에 같은 강의 자료를 도서관 복사기 대신 인쇄소 윤전기로 한 번에 찍어내는 느낌이라고 보면 됩니다. 음성 비서나 실시간 상담 챗봇처럼 '지연 시간이 곧 사용 경험'인 서비스에서 자주 거론되니, 추론 인프라 후보를 비교할 때 알아 두면 좋습니다.
**케이스 1: GroqCloud — Llama 3.3 70B를 초당 276토큰으로 서빙** 독립 벤치마크 사이트 Artificial Analysis 기준 GroqCloud는 Llama 3.3 70B를 초당 276토큰, 첫 토큰까지 0.3~0.9초 안에 응답합니다.[5] 같은 모델을 일반 GPU 클라우드에서 돌리면 보통 초당 30~80토큰 수준이라, 사용자가 '전송' 버튼을 누르고 답이 다
카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.