세레브라스 젬마 4 속도 비교: 1,851 tokens/s 발표와 현재 측정값
세레브라스는 Gemma 4 31B를 1,851 tokens/s로 발표했지만 2026년 8월 24일 독립 측정값은 reasoning 1,404.6 tokens/s, non-reasoning 1,325.1 tokens/s였다. 숫자가 달라진 이유와 실제 도입 때 확인할 지표를 구분했다.
읽는 시간 약 9분
AI는 자료 조사와 초안 정리에 보조적으로 사용했으며, 편집부가 출처와 사실을 확인했습니다.

세레브라스 젬마 4는 지금도 초당 1,800토큰짜리 모델일까. 2026년 6월 29일 세레브라스가 공개한 수치는 1,851 output tokens/s였다. 8월 24일 Artificial Analysis의 같은 모델 제공사 비교에서는 reasoning 모드 1,404.6 tokens/s, non-reasoning 모드 1,325.1 tokens/s가 나왔다.
숫자는 내려왔지만 1위 자리는 그대로다. 두 비교표 모두 세레브라스를 Gemma 4 31B API 제공사 13곳 가운데 가장 빠른 곳으로 기록한다. 문제는 1,800 tokens/s를 변하지 않는 제품 사양처럼 쓰거나 모든 GPU보다 35배 빠르다고 일반화할 때 생긴다. 원자료는 거기까지 말하지 않는다.
이 글에서는 2026년 8월 24일 공개된 제조사 문서와 독립 제공사 벤치마크를 맞춰 봤다. 세레브라스 API를 직접 호출해 재현한 시험은 아니다.
세레브라스 젬마 4 속도는 발표값과 현재 측정값이 다르다
| 확인 시점과 출처 | 모드 | 출력 속도 | 응답 시작 지표 |
|---|---|---|---|
| 2026-06-29 세레브라스 발표 | 별도 표기 없음 | 1,851 tokens/s | 첫 answer token 1.5초, reasoning 포함 |
| 2026-08-24 Artificial Analysis | reasoning | 1,404.6 tokens/s | 첫 answer token 1.73초 |
| 2026-08-24 Artificial Analysis | non-reasoning | 1,325.1 tokens/s | 첫 token 0.54초 |
세레브라스의 출시 글은 Artificial Analysis 측정치를 인용해 1,851 tokens/s라고 발표했다.
현재 reasoning 제공사 비교와 non-reasoning 제공사 비교의 수치는 그보다 낮다.
두 값 중 하나가 틀렸다고 단정할 근거는 없다. 제공사 부하와 인프라, 측정 시점, reasoning 설정이 달라지면 결과도 움직인다. Artificial Analysis 역시 제공사 성능을 계속 다시 측정한다. 이 수치는 모델의 고정 스펙이 아니라 날짜가 붙은 관측값으로 읽어야 한다.
세레브라스가 7월 8일 공개한 자체 활용 사례에서는 약 2,300 tokens/s가 기록됐다. 같은 회사 자료 안에서도 작업과 설정에 따라 수백 tokens/s 차이가 난다. 내가 도입 검토에 쓸 숫자는 보도자료의 최고치가 아니라 실제 요청 길이와 출력 형식으로 잰 중앙값이다.
35배라는 문장에는 비교 대상이 빠져 있었다
출시 글은 1,851 tokens/s가 “일반적인 GPU 엔드포인트”보다 35배 빠르다고 설명했다. 여기서 빠진 것은 분모다. 어떤 제공사와 설정을 일반적인 기준으로 잡았는지는 본문에 구체적으로 적지 않았다.
8월 24일 Artificial Analysis의 reasoning 비교에서 세레브라스는 1,404.6 tokens/s, 2위 Modular는 242.8 tokens/s였다. 이 둘의 차이는 약 5.8배다. 가장 느린 Novita의 17.5 tokens/s와 비교하면 약 80.2배로 벌어진다. 같은 Gemma 4 31B라도 분모에 어떤 제공사를 두느냐에 따라 배수가 크게 달라진다.
자료가 보증하는 문장은 하나다. 세레브라스는 현재 Artificial Analysis가 추적하는 Gemma 4 31B 제공사 가운데 출력 속도 1위다. “GPU보다 항상 35배 빠르다”거나 “모든 멀티모달 모델 중 가장 빠르다”는 결론은 이 비교표만으로 증명되지 않는다.
공개 벤치마크의 단위와 수집 시점을 읽는 방법은 AI 모델 벤치마크에도 같은 원칙으로 적용하고 있다. 서로 다른 평가의 점수를 합쳐 하나의 종합 순위를 만들지 않는 이유다.
tokens/s만으로 체감 속도를 설명할 수는 없다
Artificial Analysis의 측정 방법에서 output speed는 첫 응답 조각을 받은 뒤 토큰이 생성되는 속도를 뜻한다. 요청 전송부터 첫 토큰까지 걸리는 시간은 별도 지표다. reasoning 모델은 생각을 마친 뒤 첫 답변 토큰이 나오기까지의 시간도 따로 봐야 한다.
이미지를 다루는 서비스에는 파일 업로드, 이미지 전처리, 입력 토큰 처리, 네트워크, 도구 실행 시간도 붙는다. 긴 JSON이나 보고서를 생성하는 작업은 output speed가 체감에 바로 드러난다. 짧은 분류 답변이라면 첫 토큰 지연과 입력 처리 시간이 더 중요하다.
세레브라스의 7월 활용 사례도 이 차이를 보여준다. 회사 발표로는 60쪽 보고서의 그림 세 개를 설명하는 데 전체 1.79초가 걸렸다. 차량 영상에서 뽑은 17개 프레임은 5초에 처리했다. 흥미로운 결과지만 제조사가 설계한 데모다. 한국어 문서나 자체 데이터에서 같은 결과가 나온다고 보증하지는 않는다.
도입 전에는 적어도 다음 네 값을 같은 요청으로 기록해야 한다.
- 첫 token 또는 첫 answer token까지 걸린 시간
- 출력 구간의 tokens/s
- 요청부터 완료까지의 전체 시간
- 오류와 재시도를 포함한 건당 비용
스트리밍과 오류 처리를 실제 코드에 넣을 때 확인할 항목은 OpenAI·Claude·Gemini API 예제에서 함께 볼 수 있다. 제공사는 달라도 첫 응답 시간, 전체 완료 시간, 재시도 로그를 분리해야 한다는 원칙은 같다.
Gemma 4 자체와 세레브라스 제공 조건은 나눠 봐야 한다
Google의 Gemma 4 모델 카드에 따르면 31B는 30.7B 파라미터를 모두 추론에 쓰는 dense 모델이다. 텍스트와 이미지를 받아 텍스트를 출력한다. 영상은 프레임을 나눠 처리한다. 31B에는 네이티브 오디오 입력이 없다. 함수 호출과 구조화 JSON을 지원하며 네이티브 컨텍스트는 최대 256K다.
Google의 출시 글은 가중치를 Apache 2.0 라이선스로 공개했다고 밝힌다. 다만 라이선스 공개와 API 제공 조건은 같은 말이 아니다.
세레브라스가 제공하는 같은 31B 모델의 조건은 조금 다르다. 현재 요금제별 한도 문서는 컨텍스트 131,072, 최대 출력 40,960 tokens로 안내한다.
현재 모델 선택 문서에서는 Gemma 4 31B를 코드 생성과 비전·문서 이해에 쓸 수 있는 public 모델로 안내한다.
오픈웨이트는 모델 가중치에 관한 말이다. 호스팅 속도는 인프라에 관한 말이다. Gemma 4 가중치를 내려받아 자체 서버에서 운영하는 선택과 세레브라스 클라우드에서 높은 속도로 호출하는 선택은 별개다. 자체 서버에 모델을 올린다고 세레브라스의 속도가 따라오는 것은 아니다.
관리형 API와 자체 배포의 책임 차이는 한국 AI 모델 비교에서도 먼저 구분했다. 가중치 통제가 중요한 팀이라면 로컬 LLM·MCP 설정 가이드처럼 하드웨어와 권한 조건부터 계산해야 한다.
모델은 일반 제공, 이미지 입력은 Public Preview다
세레브라스 공식 가격표는 2026년 8월 24일 기준 Gemma 4 31B의 입력 100만 tokens당 가격을 0.99달러, 출력 100만 tokens당 가격을 1.49달러로 안내한다. 표에 적힌 속도는 약 1,800 tokens/s다.
세레브라스 공개 모델 API에서 Gemma 4 31B는 deprecated: false, preview: false로 표시된다. 모델 자체를 평가용 preview로 부르는 것은 현재 정보와 맞지 않는다. 다만 이미지 입력 기능 문서는 비전 기능을 Public Preview로 구분한다.
사용 한도도 계정 등급에 따라 다르다. Free Trial은 5 RPM·30K TPM, Developer는 300 RPM·500K TPM이다. 이미지 한도는 각각 요청당 2장·4MB와 10장·10MB다. 외부 이미지 URL은 받지 않는다. 텍스트 API가 열려 있다는 이유만으로 이미지 파이프라인의 운영 조건까지 같다고 보면 안 된다.
실제 비용은 입력과 출력의 비율, 이미지가 차지하는 tokens, 재시도 횟수에 따라 달라진다. 이 글에서는 계정을 연결해 청구 내역을 확인하지 않았다. 도입 검토 단계에서는 20~50건의 실제 요청으로 총 tokens와 실패율을 기록한 뒤 월 사용량을 계산해야 한다.
내가 먼저 시험할 곳은 ‘길게 많이 뽑는’ 작업이다
내가 이 API를 먼저 붙여볼 곳은 ‘짧게 한 번 맞히는’ 일이 아니다. 화면을 읽고 구조화 결과를 여러 번 내보내는 에이전트, 여러 장의 이미지나 문서를 연속 처리하는 파이프라인, 긴 출력 대기가 제품 경험을 막는 경우다. 같은 모델을 제공하는 다른 API보다 출력 속도가 크게 앞선다는 독립 측정이 있기 때문이다.
반대로 한 번의 답이 정확해야 하는 업무라면 속도 1위만으로 선택하기 어렵다. 한국어 문서 정확도, 이미지 해석 오류, 데이터 보존 조건, 호출 한도와 비용을 따로 시험해야 한다. 이 글에서는 한국어 품질이나 실제 청구 비용을 직접 측정하지 않았다.
검토 순서는 간단하다. 먼저 실제 입력 20~50건을 고정하고 reasoning 사용 여부와 출력 길이를 맞춘다. 그다음 첫 응답, 전체 완료 시간, 실패율, 비용을 함께 기록한다. 세레브라스가 그 조건에서도 충분히 빠르고 품질 기준을 넘을 때 도입 후보로 남기면 된다.
이 페이지의 속도표는 Artificial Analysis의 제공사 측정값이 바뀌거나 세레브라스의 public 제공 조건이 달라질 때 갱신한다. 1,800 tokens/s라는 발표 숫자는 기록으로 남기되, 현재 선택은 현재 측정값으로 판단한다.
참고한 출처
공식 출처와 보조 신호를 함께 확인했습니다. 전체 12개 중 공식 출처는 9개입니다.
- Rate Limits(새 창)공식Cerebras Inference Docs
- Choose a Model(새 창)공식Cerebras Inference Docs
- Cerebras Inference Pricing(새 창)공식Cerebras
- Public Models API(새 창)공식Cerebras
- Image Inputs(새 창)공식Cerebras Inference Docs
- Gemma 4 Model Card(새 창)공식Google
- Gemma 4: Our most capable model built to run on a single accelerator(새 창)공식Google
- First Look: Gemma 4 on Cerebras(새 창)공식Cerebras
- Gemma 4 on Cerebras: The Fastest Inference is Now Multimodal(새 창)공식Cerebras
- Gemma 4 31B Providers (Reasoning)(새 창)보조Artificial Analysis
- Gemma 4 31B Providers (Non-reasoning)(새 창)보조Artificial Analysis
- Performance Benchmarking Methodology v2.2.0(새 창)보조Artificial Analysis