코드 답변 사용자 선호
claude-opus-5-max
Arena Code 1705 +15/-15 · Anthropic
CODING MODEL BOARD
“답변이 마음에 들었는가”와 “실제 저장소 테스트를 통과했는가”는 다른 질문입니다. Arena Code와 SWE-bench Verified를 분리해 현재 코딩 AI 순위를 확인합니다.
QUICK ANSWER
코드 답변 사용자 선호
claude-opus-5-max
Arena Code 1705 +15/-15 · Anthropic
실제 저장소 이슈 해결률
live-SWE-agent + Claude 4.5 Opus medium
SWE-bench Verified 79.2% · UIUC
Arena Code는 사용자가 고른 답변의 상대적 선호이고, SWE-bench는 모델·에이전트 하네스·도구 설정을 합친 시스템의 테스트 통과율입니다. 두 순위를 직접 합산하지 않습니다.
MODEL FAMILY CHECK
Arena Code에 올라온 각 모델군의 최고 순위 항목입니다. 모델 이름에 하네스가 표시된 경우 도구 설정까지 포함된 결과입니다.
claude-opus-5-max
Anthropic
gpt-5.6-sol-xhigh (codex-harness)
OpenAI
gemini-3.6-flash
코딩 선호 · Arena Code
코딩 요청에서 어떤 모델의 결과가 더 낫다고 평가됐는지 보여주는 공개 사용자 선호 리더보드입니다.
코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?
2026년 8월 3일 기준
| 순위 | 모델·에이전트 | 점수 | 투표 | 가격 | 문맥 |
|---|---|---|---|---|---|
| 01 | claude-opus-5-maxAnthropic | 1705 +15/-15 | 2,192 | $5 / $25 | 1M |
| 02 | kimi-k3-maxMoonshot AI | 1676 +12/-12 | 4,366 | $3 / $15 | 1M |
| 03 | claude-opus-5-highAnthropic | 1669 +11/-11 | 3,873 | $5 / $25 | 1M |
| 04 | qwen3.8-maxAlibaba예비 | 1668 +18/-18 | 1,563 | $2 / $6 | 1M |
| 05 | claude-fable-5Anthropic | 1630 +9/-9 | 6,310 | $10 / $50 | 1M |
| 06 | gpt-5.6-sol-xhigh (codex-harness)OpenAI하네스 | 1620 +9/-9 | 6,000 | $5 / $30 | 1.1M |
| 07 | glm-5.2-maxZ.ai | 1586 +9/-9 | 6,361 | $1.40 / $4.40 | 1M |
| 08 | deepseek-v4-flash-highDeepSeek예비 | 1577 +18/-18 | 1,319 | $0.14 / $0.28 | 1M |
| 18 | gemini-3.6-flashGoogle | 1533 +11/-11 | 3,314 | $1.50 / $7.50 | 1M |
주의: 코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.
저장소 수정 · SWE-bench Verified
실제 오픈소스 저장소의 이슈를 재현하고 패치를 적용해 테스트를 통과한 비율을 비교합니다.
실제 코드베이스 문제를 해결해 테스트까지 통과한 시스템은 무엇인가?
2026년 8월 3일 기준
| 순위 | 모델·에이전트 | 해결률 | 시도 | 공개 | 제출일 |
|---|---|---|---|---|---|
| 01 | live-SWE-agent + Claude 4.5 Opus mediumUIUC오픈 시스템 | 79.2% | 1회 | 공개 | 2025.12.15 |
| 02 | Sonar Foundation Agent + Claude 4.5 OpusSonar | 79.2% | 1회 | 비공개 | 2025.12.05 |
| 03 | TRAE + Doubao-Seed-CodeByteDance오픈 시스템 | 78.8% | 2회+ | 공개 | 2025.09.28 |
| 04 | live-SWE-agent + Gemini 3 Pro PreviewUIUC오픈 시스템 | 77.4% | 1회 | 공개 | 2025.11.20 |
| 05 | Atlassian Rovo DevAtlassian | 76.8% | 2회 | 비공개 | 2025.09.02 |
| 06 | EPAM AI/Run Developer Agent + Claude 4 SonnetEPAM | 76.8% | 2회+ | 비공개 | 2025.08.04 |
| 07 | mini-SWE-agent + Claude 4.5 Opus (high)SWE-agent오픈 시스템 | 76.8% | 1회 | 공개 | 2026.02.17 |
| 08 | ACoderACoder | 76.4% | 2회+ | 비공개 | 2025.08.19 |
| 09 | mini-SWE-agent + Gemini 3 Flash (high)SWE-agent오픈 시스템 | 75.8% | 1회 | 공개 | 2026.02.17 |
| 10 | mini-SWE-agent + MiniMax M2.5 (high)SWE-agent오픈 시스템 | 75.8% | 1회 | 공개 | 2026.02.17 |
주의: 모델뿐 아니라 에이전트 하네스, 시도 횟수, 도구와 프롬프트가 결과에 영향을 줍니다. 모델 단독 순위가 아닙니다.
HOW TO CHOOSE
질문·코드 리뷰Arena Code의 사용자 선호와 가격을 먼저 비교합니다.
저장소 수정 자동화SWE-bench의 해결률뿐 아니라 하네스 공개 여부와 시도 횟수를 봅니다.
실제 도입내 언어·프레임워크·테스트셋으로 성공률과 비용을 다시 측정합니다.