AI 모델 순위
지금 어떤 AI를 쓸지, 성능과 비용을 함께 비교하세요.
코딩 답변 현재 수록 1위
OpenAI
1797+24 / -24Code Arena 점수
Arena Code · · 해당 평가의 원점수
| 비교 선택 | 모델 눌러서 자세히 | 제공사 | 순위 추이 ↗ | ||||
|---|---|---|---|---|---|---|---|
| 1 | OpenAI | 1797+24 / -24 | 1,199 | $10 / $50 | 이전 미수록 | ||
| 2 | Anthropic | 1762+16 / -16 | 2,275 | $10 / $50 | |||
| 3 | Anthropic | 1688+8 / -8 | 10,904 | $5 / $25 | |||
| 4 | Alibaba | 1686+16 / -16 | 1,868 | $2 / $6 | |||
| 5 | Moonshot | 1674+11 / -11 | 4,546 | $3 / $15 | |||
| 6 | Alibaba | 1670+12 / -12 | 3,223 | $2 / $6 | |||
| 7 | Anthropic | 1661+7 / -7 | 10,928 | $5 / $25 | |||
| 8 | Anthropic | 1629+8 / -8 | 9,356 | $10 / $50 | |||
| 9 | Alibaba | 1626+14 / -14 | 2,158 | $0.16 / $0.47 | |||
| 10 | SpaceXAI | 1625+11 / -11 | 3,487 | $2 / $6 | 비교 보류 |
10 / 100개 항목 · 실행 설정별 구분
Arena Code
코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?점수와 순위를 읽는 방법
코딩 요청에서 어떤 모델의 결과가 더 낫다고 평가됐는지 보여주는 공개 사용자 선호 리더보드입니다.
코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.
막대는 현재 표의 원점수 범위 안에서 길이를 비교하며, 음수는 0선 왼쪽에 표시합니다. 출처가 다른 막대 길이를 비교하지 마세요.
표의 순위는 원본 값입니다. 검색하거나 정렬해도 새 순위를 매기지 않습니다. 비용의 단위는 평가 작업 비용과 API 토큰 요금에 따라 다릅니다.
코딩하는 상인의 분석
순위에서 한 걸음 더
작업별 선택 기준과 모델별 실행 조건을 확인하세요.
주요 모델 상세 분석
설정별 점수·비용 차이와 공개 평가의 한계
평가별 상위 결과 한눈에 보기
각 출처에서 가장 높은 순위의 항목을 모았습니다. 평가마다 점수 단위와 실행 조건이 다르므로, 이 여섯 행을 서로 비교해 종합 1위를 정할 수는 없습니다.
| 평가 | 원본 상위 항목 | 평가 결과 | 저장 날짜 |
|---|---|---|---|
| Artificial Analysis ↗종합·효율 | Claude Fable 5.1 (max with fallback)원본 1위 · Anthropic추론 설정폴백 포함 | 57지능 지수 | |
| Arena Text ↗대화 선호 | claude-fable-5원본 1위 · Anthropic | 1507 ±5Arena 점수 | |
| Arena Code ↗코딩 선호 | gpt-6-astra-max원본 1위 · OpenAI | 1797+24 / -24Code Arena 점수 | |
| Arena Agent ↗에이전트 실사용 | Claude Fable 5.1 (Max)원본 1위 · Anthropic | 15.87% ±2.84%순 개선도 · 변화량 %p | |
| Arena Vision ↗이미지 이해 | claude-fable-5원본 1위 · Anthropic | 1313 ±8Vision Arena 점수 | |
| SWE-bench Verified ↗저장소 수정 | live-SWE-agent + Claude 4.5 Opus medium (20251101)원본 1위 · UIUC오픈 시스템 | 79.2%해결률 | 14일 이상 경과 |
비교 다음에는, 실제 사용.
내 사용량에서는 얼마일까?
평가 작업 비용은 내 서비스의 요금 견적이 아닙니다. 요청 횟수와 입력·출력 토큰을 넣어 월 API 비용을 따로 계산하세요.
API 비용 계산기점수 차이보다 사용 조건이 중요할 때도 있습니다. AI 선택 가이드에서 비용과 벤치마크의 단위를 확인하세요.
출처와 저장 날짜
갱신·정정 기준 →6개 평가의 559개 항목은 저장 시점의 공개 결과입니다. 출처마다 날짜가 다르며 실시간 순위를 보장하지 않습니다. 항목 수에는 같은 모델의 추론 설정과 에이전트 구성이 각각 포함됩니다.
- Artificial Analysis
- 100개 항목
- Arena Text
- 100개 항목
- Arena Code
- 100개 항목
- Arena Agent
- 59개 항목
- Arena Vision
- 100개 항목
- SWE-bench Verified
- 100개 항목14일 이상 경과