모델 계열 · 그록

Grok 최신 모델
벤치마크 순위·성능 비교

그록은 추론 강도별 항목이 별도로 집계될 수 있습니다. 종합 지능과 코딩·대화 선호의 순위 차이를 중심으로 읽습니다.

데이터 갱신 2026. 08. 17.

한눈에 보기

현재 Grok 대표 항목은 Grok 4.6 (high)

Artificial Analysis 공개 순위에서 가장 높은 Grok 계열 항목은 Grok 4.6 (high)입니다. 전체 6위, 지능 지수 61로 집계됐습니다.

이는 출시일 순서가 아니라 현재 독립 평가 스냅샷에서 가장 높은 실행 설정입니다. 같은 모델의 추론 강도별 항목은 별도 결과일 수 있습니다.

공개 결과
27
총 공개 결과 수
평가 출처
5
결과가 있는 평가

출처별 비교

평가별 Grok 상위 결과

서로 단위가 다른 점수를 합산하지 않습니다. 각 표의 순위는 해당 원본 리더보드 전체에서의 위치이며, Grok 결과만 최대 5개 추렸습니다.

종합·효율 · Artificial Analysis

Grok 지능·비용·속도를 한 화면에서

해석: 성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가? 에이전트, 코딩, 과학 추론, 일반 능력을 묶은 Intelligence Index와 실제 API 비용·속도를 함께 봅니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
06Grok 4.6 (high)SpaceXAI61지능
16Grok 4.5 (high)SpaceXAI56지능
63Grok 4.3 (medium)SpaceXAI37*지능
64Grok 4.3 (low)SpaceXAI36*지능

한계: 영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.

대화 선호 · Arena Text

Grok 사람들이 실제 대화에서 고른 모델

해석: 실제 사용자는 어떤 모델의 답변을 더 선호하는가? 두 모델의 익명 답변을 사용자가 직접 비교해 투표한 결과로, 정답률보다 체감 품질과 선호를 보여줍니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
24grok-4.20-beta1SpaceXAI1475 ±5점수
32grok-4.20-beta-0309-reasoningSpaceXAI1472 ±4점수
34grok-4.20-multi-agent-beta-0309SpaceXAI1470 ±4점수
36grok-4.5SpaceXAI1469 ±5점수
42grok-4.1-thinkingSpaceXAI1466 ±3점수

한계: 사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.

코딩 선호 · Arena Code

Grok 코드 답변을 직접 비교한 사용자 선택

해석: 코딩 대화에서 사용자가 더 만족한 모델은 무엇인가? 코딩 요청에서 어떤 모델의 결과가 더 낫다고 평가됐는지 보여주는 공개 사용자 선호 리더보드입니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
05grok-4.6-highSpaceXAI1631+17 / -17점수
15grok-4.5SpaceXAI1555+9 / -9점수
74grok-4.20-beta-0309-reasoningSpaceXAI1374+6 / -6점수
84grok-4.3SpaceXAI1354+7 / -7점수

한계: 코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.

에이전트 실사용 · Arena Agent

Grok 도구를 쓰는 에이전트의 실제 세션 신호

해석: 실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가? 도구 호출이 포함된 실제 세션에서 성공 확인, 칭찬·불만, 조향 가능성, Bash 복구와 환각 신호를 함께 봅니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
16Grok 4.5SpaceXAI6.19% ±1.20%순 개선
41Grok 4.3 (High)SpaceXAI8.47% ±0.89%순 개선
43Grok Build 0.1SpaceXAI9.10% ±0.95%순 개선
48Grok 4.3SpaceXAI14.67% ±1.27%순 개선

한계: 여러 행동 신호를 인과 추정으로 합친 실사용 지표입니다. 단일 정답형 벤치마크와 점수 단위를 비교할 수 없습니다.

이미지 이해 · Arena Vision

Grok 이미지 입력 답변에 대한 사용자 선호

해석: 이미지와 텍스트를 함께 이해하는 답변에서 무엇이 더 선호되는가? 이미지를 보고 답하는 멀티모달 모델을 익명으로 비교한 사용자 투표 기반 리더보드입니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
13grok-4.5SpaceXAI1285 ±11점수
36grok-4.20-beta-0309-reasoningSpaceXAI1255 ±6점수
38grok-4.20-multi-agent-beta-0309SpaceXAI1252 ±7점수
44grok-4.3SpaceXAI1244 ±7점수
75grok-4-1-fast-reasoningSpaceXAI1195 ±7점수

한계: OCR, 차트, 공간 추론 등 세부 능력을 하나의 선호 점수로 압축합니다. 용도별 테스트가 추가로 필요합니다.