같은 출처로 비교

Grok(그록) vs Gemini(제미나이)성능·가격·코딩 비교

현재 AA 대표: Grok 4.6 (high) · Gemini 3.7 Flash (high)

그록과 제미나이는 대화, 코드, 이미지, 도구 사용에서 순위가 서로 다를 수 있습니다. 한 줄 승자 대신 실제 사용 목적과 가까운 독립 평가를 골라 읽습니다.

데이터 갱신 2026년 8월 17일

주요 수치 · 같은 실행 기준

지능·비용·속도 빠른 비교

아래 세 수치는 Artificial Analysis의 동일한 두 대표 항목입니다. 서로 다른 평가의 점수를 섞지 않으며 종합 승자를 정하지 않습니다.

기준GrokGemini
지능 지수6156
평가 작업 비용$0.84$0.40
출력 속도58 t/s

출처별 비교

같은 평가 안에서만 보는 순위

에이전트 실사용

Arena Agent

모델군대표 항목순위순 개선
GrokGrok 4.5166.19% ±1.20%
GeminiGemini 3.7 Flash (High)213.61% ±1.22%

어떤 표를 볼까요?

용도에 맞는 평가 고르기

  • 일반 추론·운영 효율Artificial Analysis에서 지능 지수와 비용·속도를 같은 실행 항목으로 확인합니다.
  • 대화·코딩 체감일반 답변은 Arena Text, 코드 답변은 Arena Code의 사용자 선호 순위를 따로 봅니다.
  • 이미지·도구 사용이미지 입력은 Arena Vision, 실제 도구 세션은 Arena Agent를 우선 확인합니다.

평가 방법과 한계

비교 방법과 한계

모델명 정규식으로 각 공개 소스에서 모델군별 최고 순위 항목 하나를 고릅니다. 양쪽 항목이 모두 있는 소스만 표시하고, 소스 사이 순위와 점수는 합산하지 않습니다.

추론 강도가 표시된 항목은 같은 모델의 별도 실행 설정입니다. 이름이 비슷해도 high·medium 같은 설정을 지우거나 평균내지 않습니다.

  • Artificial Analysis: 영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.
  • Arena Text: 사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.
  • Arena Code: 코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.
  • Arena Agent: 여러 행동 신호를 인과 추정으로 합친 실사용 지표입니다. 단일 정답형 벤치마크와 점수 단위를 비교할 수 없습니다.
  • Arena Vision: OCR, 차트, 공간 추론 등 세부 능력을 하나의 선호 점수로 압축합니다. 용도별 테스트가 추가로 필요합니다.