코딩 모델 비교

코딩 AI 벤치마크 순위: 최신 모델 비교

“답변이 마음에 들었는가”와 “실제 저장소 테스트를 통과했는가”는 다른 질문입니다. Arena Code와 SWE-bench Verified를 분리해 현재 코딩 AI 순위를 확인합니다.

한눈에 보기

코딩 AI 1위는 하나가 아닙니다

코드 답변 사용자 선호

gpt-6-astra-max

Arena Code 1797+24 / -24 · OpenAI

실제 저장소 이슈 해결률

live-SWE-agent + Claude 4.5 Opus medium (20251101)

SWE-bench Verified 79.2% · UIUC

Arena Code는 사용자가 고른 답변의 상대적 선호이고, SWE-bench는 모델·에이전트 하네스·도구 설정을 합친 시스템의 테스트 통과율입니다. 두 순위를 직접 합산하지 않습니다.

제공사별 상위 모델

순위권 16개 제공사 대표 모델

Arena Code 상위 100개 항목에서 제공사별 최고 순위 모델을 하나씩 표시합니다. 모델 이름에 하네스가 있으면 도구 설정까지 포함된 결과입니다.

Meta

11

muse-spark-1.3 (xHigh)

점수
1622+18 / -18
투표
1,274
가격
$1.25 / $4.25

Tencent

12

hy4-preview

점수
1621+16 / -16
투표
1,661
가격
$0.83 / $2.50

Z.ai

14

glm-5.3-max

점수
1609+12 / -12
투표
2,930
가격
$1.40 / $4.40

Bytedance

34

seed-2.1-pro-preview

점수
1521+7 / -7
투표
8,617
가격
N/A

MiniMax

45

minimax-m3

점수
1487+7 / -7
투표
11,876
가격
$0.30 / $1.20

Xiaomi

48

mimo-v2.5-pro

점수
1475+6 / -6
투표
15,080
가격
$0.43 / $0.87

Thinking Machines

69

inkling

점수
1409+8 / -8
투표
8,089
가격
$1 / $4.05

Upstage

86

solar-pro4

점수
1371+17 / -17
투표
1,404
가격
$0.03 / $0.12

Poolside

96

laguna-m.1

점수
1347+10 / -10
투표
5,060
가격
$0.20 / $0.40

코딩 선호 · Arena Code

코드 답변을 직접 비교한 사용자 선택

코딩 요청에서 어떤 모델의 결과가 더 낫다고 평가됐는지 보여주는 공개 사용자 선호 리더보드입니다.

코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?

2026년 9월 7일 기준

순위모델·에이전트점수투표가격문맥
01gpt-6-astra-maxOpenAI1797+24 / -241,199$10 / $501.1M
02claude-fable-5.1-maxAnthropic1762+16 / -162,275$10 / $501M
03claude-opus-5-maxAnthropic1688+8 / -810,904$5 / $251M
04qwen3.8-max-0902Alibaba예비1686+16 / -161,868$2 / $6N/A
05kimi-k3-maxMoonshot1674+11 / -114,546$3 / $151M
06qwen3.8-maxAlibaba예비1670+12 / -123,223$2 / $61M
07claude-opus-5-highAnthropic1661+7 / -710,928$5 / $251M
08claude-fable-5Anthropic1629+8 / -89,356$10 / $501M
09qwen3.8-flash-nextAlibaba예비1626+14 / -142,158$0.16 / $0.471M
10grok-4.6-highSpaceXAI1625+11 / -113,487$2 / $6500K

주의: 코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.

저장소 수정 · SWE-bench Verified

실제 GitHub 이슈를 해결한 에이전트

실제 오픈소스 저장소의 이슈를 재현하고 패치를 적용해 테스트를 통과한 비율을 비교합니다.

실제 코드베이스 문제를 해결해 테스트까지 통과한 시스템은 무엇인가?

2026년 8월 17일 기준

순위모델·에이전트해결률시도공개제출일
01live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC오픈 시스템79.2%1회공개2025.12.15
02Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%1회비공개2025.12.05
03TRAE + Doubao-Seed-CodeByteDance오픈 시스템78.8%2+회공개2025.09.28
04live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)UIUC오픈 시스템77.4%1회공개2025.11.20
05Atlassian Rovo Dev (2025-09-02)Atlassian76.8%2회비공개2025.09.02
06EPAM AI/Run Developer Agent v20250719 + Claude 4 SonnetEPAM Systems, Inc.76.8%2+회비공개2025.08.04
07mini-SWE-agent + Claude 4.5 Opus (high)Anthropic오픈 시스템76.8%1회공개2026.02.17
08ACoderACoder76.4%2+회비공개2025.08.19
09mini-SWE-agent + Gemini 3 Flash (high)Google DeepMind오픈 시스템75.8%1회공개2026.02.17
10mini-SWE-agent + MiniMax M2.5 (high)Minimax오픈 시스템75.8%1회공개2026.02.17

주의: 모델뿐 아니라 에이전트 하네스, 시도 횟수, 도구와 프롬프트가 결과에 영향을 줍니다. 모델 단독 순위가 아닙니다.

모델 선택 기준

내 작업에 맞는 코딩 모델 고르기

질문·코드 리뷰Arena Code의 사용자 선호와 가격을 먼저 비교합니다.

저장소 수정 자동화SWE-bench의 해결률뿐 아니라 하네스 공개 여부와 시도 횟수를 봅니다.

실제 도입내 언어·프레임워크·테스트셋으로 성공률과 비용을 다시 측정합니다.