모델 계열 · 챗GPT

GPT 최신 모델
벤치마크 순위·성능 비교

챗GPT 앱 자체가 아니라 공개 리더보드의 GPT 모델·시스템 항목을 비교합니다. 일반 모델과 코딩 하네스를 구분하고 지능·가격·속도와 코딩 선호를 합치지 않습니다.

데이터 갱신 2026. 08. 17.

한눈에 보기

현재 GPT 대표 항목은 GPT-5.6 Sol (max)

Artificial Analysis 공개 순위에서 가장 높은 GPT 계열 항목은 GPT-5.6 Sol (max)입니다. 전체 5위, 지능 지수 61로 집계됐습니다.

이는 출시일 순서가 아니라 현재 독립 평가 스냅샷에서 가장 높은 실행 설정입니다. 같은 모델의 추론 강도별 항목은 별도 결과일 수 있습니다.

공개 결과
100
총 공개 결과 수
평가 출처
6
결과가 있는 평가

출처별 비교

평가별 GPT 상위 결과

서로 단위가 다른 점수를 합산하지 않습니다. 각 표의 순위는 해당 원본 리더보드 전체에서의 위치이며, GPT 결과만 최대 5개 추렸습니다.

종합·효율 · Artificial Analysis

GPT 지능·비용·속도를 한 화면에서

해석: 성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가? 에이전트, 코딩, 과학 추론, 일반 능력을 묶은 Intelligence Index와 실제 API 비용·속도를 함께 봅니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
05GPT-5.6 Sol (max)OpenAI61지능
08GPT-5.6 Sol (xhigh)OpenAI59지능
12GPT-5.6 Sol (high)OpenAI57지능
14GPT-5.6 Terra (max)OpenAI57지능
17GPT-5.6 Sol (medium)OpenAI56지능

한계: 영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.

대화 선호 · Arena Text

GPT 사람들이 실제 대화에서 고른 모델

해석: 실제 사용자는 어떤 모델의 답변을 더 선호하는가? 두 모델의 익명 답변을 사용자가 직접 비교해 투표한 결과로, 정답률보다 체감 품질과 선호를 보여줍니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
17gpt-5.5-highOpenAI1482 ±4점수
19gpt-5.6-sol-xhighOpenAI1481 ±6점수
21gpt-5.5OpenAI1477 ±4점수
22gpt-5.4-highOpenAI1476 ±4점수
23gpt-5.2-chat-latest-20260210OpenAI1476 ±4점수

한계: 사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.

코딩 선호 · Arena Code

GPT 코드 답변을 직접 비교한 사용자 선택

해석: 코딩 대화에서 사용자가 더 만족한 모델은 무엇인가? 코딩 요청에서 어떤 모델의 결과가 더 낫다고 평가됐는지 보여주는 공개 사용자 선호 리더보드입니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
07gpt-5.6-sol-xhigh (codex-harness)OpenAI1622+8 / -8점수
26gpt-5.6-terra-xhigh (codex-harness)OpenAI1521+9 / -9점수
28gpt-5.6-luna-xhigh (codex-harness)OpenAI1517+9 / -9점수
31gpt-5.5-xhigh (codex-harness)OpenAI1507+6 / -6점수
36gpt-5.5-high (codex-harness)OpenAI1487+6 / -6점수

한계: 코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.

에이전트 실사용 · Arena Agent

GPT 도구를 쓰는 에이전트의 실제 세션 신호

해석: 실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가? 도구 호출이 포함된 실제 세션에서 성공 확인, 칭찬·불만, 조향 가능성, Bash 복구와 환각 신호를 함께 봅니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
04GPT 5.6 Sol (xHigh)OpenAI10.86% ±1.80%순 개선
07GPT 5.5 (xHigh)OpenAI8.90% ±1.03%순 개선
09GPT 5.5 (High)OpenAI7.73% ±0.97%순 개선
15GPT 5.5OpenAI6.35% ±0.91%순 개선
17GPT 5.4 (High)OpenAI4.99% ±0.95%순 개선

한계: 여러 행동 신호를 인과 추정으로 합친 실사용 지표입니다. 단일 정답형 벤치마크와 점수 단위를 비교할 수 없습니다.

이미지 이해 · Arena Vision

GPT 이미지 입력 답변에 대한 사용자 선호

해석: 이미지와 텍스트를 함께 이해하는 답변에서 무엇이 더 선호되는가? 이미지를 보고 답하는 멀티모달 모델을 익명으로 비교한 사용자 투표 기반 리더보드입니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
12gpt-5.5OpenAI1286 ±7점수
16gpt-5.5-highOpenAI1283 ±7점수
18gpt-5.4-highOpenAI1283 ±7점수
20gpt-5.4OpenAI1280 ±7점수
22gpt-5.6-sol-xhighOpenAI1280 ±11점수

한계: OCR, 차트, 공간 추론 등 세부 능력을 하나의 선호 점수로 압축합니다. 용도별 테스트가 추가로 필요합니다.

저장소 수정 · SWE-bench Verified

GPT 실제 GitHub 이슈를 해결한 에이전트

해석: 실제 코드베이스 문제를 해결해 테스트까지 통과한 시스템은 무엇인가? 실제 오픈소스 저장소의 이슈를 재현하고 패치를 적용해 테스트를 통과한 비율을 비교합니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
17JoyCode + Claude 4 Sonnet + GPT-4.1JoyCode74.6%해결률
19Prometheus-v1.2.1 + GPT-5EuniAI74.4%해결률
25mini-SWE-agent + GPT 5.2 CodexOpenAI72.8%해결률
27mini-SWE-agent + GPT 5.2 (high)OpenAI72.8%해결률
29OpenHands + GPT-5OpenHands71.8%해결률

한계: 모델뿐 아니라 에이전트 하네스, 시도 횟수, 도구와 프롬프트가 결과에 영향을 줍니다. 모델 단독 순위가 아닙니다.