CODING MODEL BOARD

코딩 AI 벤치마크 순위:
Claude·GPT·Gemini 비교

“답변이 마음에 들었는가”와 “실제 저장소 테스트를 통과했는가”는 다른 질문입니다. Arena Code와 SWE-bench Verified를 분리해 현재 코딩 AI 순위를 확인합니다.

QUICK ANSWER

코딩 AI 1위는 하나가 아닙니다

코드 답변 사용자 선호

claude-opus-5-max

Arena Code 1705 +15/-15 · Anthropic

실제 저장소 이슈 해결률

live-SWE-agent + Claude 4.5 Opus medium

SWE-bench Verified 79.2% · UIUC

Arena Code는 사용자가 고른 답변의 상대적 선호이고, SWE-bench는 모델·에이전트 하네스·도구 설정을 합친 시스템의 테스트 통과율입니다. 두 순위를 직접 합산하지 않습니다.

MODEL FAMILY CHECK

Claude·GPT·Gemini 코딩 순위 비교

Arena Code에 올라온 각 모델군의 최고 순위 항목입니다. 모델 이름에 하네스가 표시된 경우 도구 설정까지 포함된 결과입니다.

Claude

1

claude-opus-5-max

Anthropic

점수
1705 +15/-15
투표
2,192
가격
$5 / $25

GPT

6

gpt-5.6-sol-xhigh (codex-harness)

OpenAI

점수
1620 +9/-9
투표
6,000
가격
$5 / $30

Gemini

18

gemini-3.6-flash

Google

점수
1533 +11/-11
투표
3,314
가격
$1.50 / $7.50

코딩 선호 · Arena Code

코드 답변을 직접 비교한 사용자 선택

코딩 요청에서 어떤 모델의 결과가 더 낫다고 평가됐는지 보여주는 공개 사용자 선호 리더보드입니다.

코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?

2026년 8월 3일 기준

순위모델·에이전트점수투표가격문맥
01claude-opus-5-maxAnthropic1705 +15/-152,192$5 / $251M
02kimi-k3-maxMoonshot AI1676 +12/-124,366$3 / $151M
03claude-opus-5-highAnthropic1669 +11/-113,873$5 / $251M
04qwen3.8-maxAlibaba예비1668 +18/-181,563$2 / $61M
05claude-fable-5Anthropic1630 +9/-96,310$10 / $501M
06gpt-5.6-sol-xhigh (codex-harness)OpenAI하네스1620 +9/-96,000$5 / $301.1M
07glm-5.2-maxZ.ai1586 +9/-96,361$1.40 / $4.401M
08deepseek-v4-flash-highDeepSeek예비1577 +18/-181,319$0.14 / $0.281M
18gemini-3.6-flashGoogle1533 +11/-113,314$1.50 / $7.501M

주의: 코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.

저장소 수정 · SWE-bench Verified

실제 GitHub 이슈를 해결한 에이전트

실제 오픈소스 저장소의 이슈를 재현하고 패치를 적용해 테스트를 통과한 비율을 비교합니다.

실제 코드베이스 문제를 해결해 테스트까지 통과한 시스템은 무엇인가?

2026년 8월 3일 기준

순위모델·에이전트해결률시도공개제출일
01live-SWE-agent + Claude 4.5 Opus mediumUIUC오픈 시스템79.2%1회공개2025.12.15
02Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%1회비공개2025.12.05
03TRAE + Doubao-Seed-CodeByteDance오픈 시스템78.8%2회+공개2025.09.28
04live-SWE-agent + Gemini 3 Pro PreviewUIUC오픈 시스템77.4%1회공개2025.11.20
05Atlassian Rovo DevAtlassian76.8%2회비공개2025.09.02
06EPAM AI/Run Developer Agent + Claude 4 SonnetEPAM76.8%2회+비공개2025.08.04
07mini-SWE-agent + Claude 4.5 Opus (high)SWE-agent오픈 시스템76.8%1회공개2026.02.17
08ACoderACoder76.4%2회+비공개2025.08.19
09mini-SWE-agent + Gemini 3 Flash (high)SWE-agent오픈 시스템75.8%1회공개2026.02.17
10mini-SWE-agent + MiniMax M2.5 (high)SWE-agent오픈 시스템75.8%1회공개2026.02.17

주의: 모델뿐 아니라 에이전트 하네스, 시도 횟수, 도구와 프롬프트가 결과에 영향을 줍니다. 모델 단독 순위가 아닙니다.

HOW TO CHOOSE

내 작업에 맞는 코딩 모델 고르기

질문·코드 리뷰Arena Code의 사용자 선호와 가격을 먼저 비교합니다.

저장소 수정 자동화SWE-bench의 해결률뿐 아니라 하네스 공개 여부와 시도 횟수를 봅니다.

실제 도입내 언어·프레임워크·테스트셋으로 성공률과 비용을 다시 측정합니다.