모델 계열 · 제미나이

Gemini 최신 모델
벤치마크 순위·성능 비교

제미나이는 Flash·Pro와 추론 설정별 항목이 함께 등장합니다. 응답 속도와 비전·대화 선호를 목적별 리더보드에서 나눠 확인합니다.

데이터 갱신 2026. 08. 17.

한눈에 보기

현재 Gemini 대표 항목은 Gemini 3.7 Flash (high)

Artificial Analysis 공개 순위에서 가장 높은 Gemini 계열 항목은 Gemini 3.7 Flash (high)입니다. 전체 15위, 지능 지수 56로 집계됐습니다.

이는 출시일 순서가 아니라 현재 독립 평가 스냅샷에서 가장 높은 실행 설정입니다. 같은 모델의 추론 강도별 항목은 별도 결과일 수 있습니다.

공개 결과
57
총 공개 결과 수
평가 출처
6
결과가 있는 평가

출처별 비교

평가별 Gemini 상위 결과

서로 단위가 다른 점수를 합산하지 않습니다. 각 표의 순위는 해당 원본 리더보드 전체에서의 위치이며, Gemini 결과만 최대 5개 추렸습니다.

종합·효율 · Artificial Analysis

Gemini 지능·비용·속도를 한 화면에서

해석: 성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가? 에이전트, 코딩, 과학 추론, 일반 능력을 묶은 Intelligence Index와 실제 API 비용·속도를 함께 봅니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
15Gemini 3.7 Flash (high)Google56지능
19Gemini 3.7 Flash (medium)Google53지능
26Gemini 3.6 FlashGoogle52지능
27Gemini 3.7 Flash (low)Google51지능
32Gemini 3.1 Pro PreviewGoogle48지능

한계: 영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.

대화 선호 · Arena Text

Gemini 사람들이 실제 대화에서 고른 모델

해석: 실제 사용자는 어떤 모델의 답변을 더 선호하는가? 두 모델의 익명 답변을 사용자가 직접 비교해 투표한 결과로, 정답률보다 체감 품질과 선호를 보여줍니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
09gemini-3.7-flash-highGoogle1490 ±8점수
14gemini-3.1-pro-previewGoogle1486 ±3점수
15gemini-3-proGoogle1485 ±4점수
16gemini-3.6-flash-highGoogle1484 ±6점수
20gemini-3.5-flash-highGoogle1477 ±5점수

한계: 사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.

코딩 선호 · Arena Code

Gemini 코드 답변을 직접 비교한 사용자 선택

해석: 코딩 대화에서 사용자가 더 만족한 모델은 무엇인가? 코딩 요청에서 어떤 모델의 결과가 더 낫다고 평가됐는지 보여주는 공개 사용자 선호 리더보드입니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
08gemini-3.7-flash-highGoogle1587+13 / -13점수
21gemini-3.6-flash-highGoogle1537+9 / -9점수
32gemini-3.5-flash-highGoogle1499+8 / -8점수
35gemini-3.5-flash-mediumGoogle1489+7 / -7점수
45gemini-3.5-flash-liteGoogle1449+43 / -43점수

한계: 코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.

에이전트 실사용 · Arena Agent

Gemini 도구를 쓰는 에이전트의 실제 세션 신호

해석: 실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가? 도구 호출이 포함된 실제 세션에서 성공 확인, 칭찬·불만, 조향 가능성, Bash 복구와 환각 신호를 함께 봅니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
21Gemini 3.7 Flash (High)Google3.61% ±1.22%순 개선
29Gemini 3.5 Flash (High)Google0.29% ±0.64%순 개선
30Gemini 3.1 Pro PreviewGoogle0.44% ±0.75%순 개선
36Gemini 3.6 Flash (High)Google2.36% ±1.22%순 개선
38Gemini 3.5 Flash (Medium)Google3.48% ±1.43%순 개선

한계: 여러 행동 신호를 인과 추정으로 합친 실사용 지표입니다. 단일 정답형 벤치마크와 점수 단위를 비교할 수 없습니다.

이미지 이해 · Arena Vision

Gemini 이미지 입력 답변에 대한 사용자 선호

해석: 이미지와 텍스트를 함께 이해하는 답변에서 무엇이 더 선호되는가? 이미지를 보고 답하는 멀티모달 모델을 익명으로 비교한 사용자 투표 기반 리더보드입니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
07gemini-3.6-flash-highGoogle1295 ±18점수
11gemini-3-proGoogle1289 ±8점수
15gemini-3.5-flash-mediumGoogle1284 ±10점수
17gemini-3.5-flash-highGoogle1283 ±10점수
25gemini-3.1-pro-previewGoogle1277 ±6점수

한계: OCR, 차트, 공간 추론 등 세부 능력을 하나의 선호 점수로 압축합니다. 용도별 테스트가 추가로 필요합니다.

저장소 수정 · SWE-bench Verified

Gemini 실제 GitHub 이슈를 해결한 에이전트

해석: 실제 코드베이스 문제를 해결해 테스트까지 통과한 시스템은 무엇인가? 실제 오픈소스 저장소의 이슈를 재현하고 패치를 적용해 테스트를 통과한 비율을 비교합니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
04live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)UIUC77.4%해결률
09mini-SWE-agent + Gemini 3 Flash (high)Google DeepMind75.8%해결률
13TRAE + Claude Sonnet 4 + Opus 4 + Sonnet 3.7 + Gemini 2.5 ProTRAE75.2%해결률
21mini-SWE-agent + Gemini 3 Pro Preview (2025-11-18)Google DeepMind74.2%해결률
48mini-SWE-agent + Gemini 3 ProGoogle DeepMind69.6%해결률

한계: 모델뿐 아니라 에이전트 하네스, 시도 횟수, 도구와 프롬프트가 결과에 영향을 줍니다. 모델 단독 순위가 아닙니다.