코드 답변 사용자 선호
gpt-6-astra-max
Arena Code 1797+24 / -24 · OpenAI
코딩 모델 비교
“답변이 마음에 들었는가”와 “실제 저장소 테스트를 통과했는가”는 다른 질문입니다. Arena Code와 SWE-bench Verified를 분리해 현재 코딩 AI 순위를 확인합니다.
한눈에 보기
코드 답변 사용자 선호
gpt-6-astra-max
Arena Code 1797+24 / -24 · OpenAI
실제 저장소 이슈 해결률
live-SWE-agent + Claude 4.5 Opus medium (20251101)
SWE-bench Verified 79.2% · UIUC
Arena Code는 사용자가 고른 답변의 상대적 선호이고, SWE-bench는 모델·에이전트 하네스·도구 설정을 합친 시스템의 테스트 통과율입니다. 두 순위를 직접 합산하지 않습니다.
제공사별 상위 모델
Arena Code 상위 100개 항목에서 제공사별 최고 순위 모델을 하나씩 표시합니다. 모델 이름에 하네스가 있으면 도구 설정까지 포함된 결과입니다.
muse-spark-1.3 (xHigh)
hy4-preview
glm-5.3-max
seed-2.1-pro-preview
minimax-m3
mimo-v2.5-pro
inkling
solar-pro4
laguna-m.1
코딩 선호 · Arena Code
코딩 요청에서 어떤 모델의 결과가 더 낫다고 평가됐는지 보여주는 공개 사용자 선호 리더보드입니다.
코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?
2026년 9월 7일 기준
| 순위 | 모델·에이전트 | 점수 | 투표 | 가격 | 문맥 |
|---|---|---|---|---|---|
| 01 | gpt-6-astra-maxOpenAI | 1797+24 / -24 | 1,199 | $10 / $50 | 1.1M |
| 02 | claude-fable-5.1-maxAnthropic | 1762+16 / -16 | 2,275 | $10 / $50 | 1M |
| 03 | claude-opus-5-maxAnthropic | 1688+8 / -8 | 10,904 | $5 / $25 | 1M |
| 04 | qwen3.8-max-0902Alibaba예비 | 1686+16 / -16 | 1,868 | $2 / $6 | N/A |
| 05 | kimi-k3-maxMoonshot | 1674+11 / -11 | 4,546 | $3 / $15 | 1M |
| 06 | qwen3.8-maxAlibaba예비 | 1670+12 / -12 | 3,223 | $2 / $6 | 1M |
| 07 | claude-opus-5-highAnthropic | 1661+7 / -7 | 10,928 | $5 / $25 | 1M |
| 08 | claude-fable-5Anthropic | 1629+8 / -8 | 9,356 | $10 / $50 | 1M |
| 09 | qwen3.8-flash-nextAlibaba예비 | 1626+14 / -14 | 2,158 | $0.16 / $0.47 | 1M |
| 10 | grok-4.6-highSpaceXAI | 1625+11 / -11 | 3,487 | $2 / $6 | 500K |
주의: 코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.
저장소 수정 · SWE-bench Verified
실제 오픈소스 저장소의 이슈를 재현하고 패치를 적용해 테스트를 통과한 비율을 비교합니다.
실제 코드베이스 문제를 해결해 테스트까지 통과한 시스템은 무엇인가?
2026년 8월 17일 기준
| 순위 | 모델·에이전트 | 해결률 | 시도 | 공개 | 제출일 |
|---|---|---|---|---|---|
| 01 | live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC오픈 시스템 | 79.2% | 1회 | 공개 | 2025.12.15 |
| 02 | Sonar Foundation Agent + Claude 4.5 OpusSonar | 79.2% | 1회 | 비공개 | 2025.12.05 |
| 03 | TRAE + Doubao-Seed-CodeByteDance오픈 시스템 | 78.8% | 2+회 | 공개 | 2025.09.28 |
| 04 | live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)UIUC오픈 시스템 | 77.4% | 1회 | 공개 | 2025.11.20 |
| 05 | Atlassian Rovo Dev (2025-09-02)Atlassian | 76.8% | 2회 | 비공개 | 2025.09.02 |
| 06 | EPAM AI/Run Developer Agent v20250719 + Claude 4 SonnetEPAM Systems, Inc. | 76.8% | 2+회 | 비공개 | 2025.08.04 |
| 07 | mini-SWE-agent + Claude 4.5 Opus (high)Anthropic오픈 시스템 | 76.8% | 1회 | 공개 | 2026.02.17 |
| 08 | ACoderACoder | 76.4% | 2+회 | 비공개 | 2025.08.19 |
| 09 | mini-SWE-agent + Gemini 3 Flash (high)Google DeepMind오픈 시스템 | 75.8% | 1회 | 공개 | 2026.02.17 |
| 10 | mini-SWE-agent + MiniMax M2.5 (high)Minimax오픈 시스템 | 75.8% | 1회 | 공개 | 2026.02.17 |
주의: 모델뿐 아니라 에이전트 하네스, 시도 횟수, 도구와 프롬프트가 결과에 영향을 줍니다. 모델 단독 순위가 아닙니다.
모델 선택 기준
질문·코드 리뷰Arena Code의 사용자 선호와 가격을 먼저 비교합니다.
저장소 수정 자동화SWE-bench의 해결률뿐 아니라 하네스 공개 여부와 시도 횟수를 봅니다.
실제 도입내 언어·프레임워크·테스트셋으로 성공률과 비용을 다시 측정합니다.