AI 모델 순위
지금 어떤 AI를 쓸지, 성능과 비용을 함께 비교하세요.
대화·글쓰기 현재 수록 1위
Anthropic
1507 ±5Arena 점수
Arena Text · · 해당 평가의 원점수
| 비교 선택 | 모델 눌러서 자세히 | 제공사 | 순위 추이 ↗ | ||||
|---|---|---|---|---|---|---|---|
| 1 | Anthropic | 1507 ±5 | 27,189 | $10 / $50 | |||
| 2 | Anthropic | 1505 ±4 | 72,099 | $5 / $25 | |||
| 3 | Anthropic | 1504 ±11 | 2,906 | $10 / $50 | 이전 미수록 | ||
| 4 | Anthropic | 1502 ±4 | 60,103 | $5 / $25 | |||
| 5 | Meta | 1499 ±10 | 3,240 | $1.25 / $4.25 | |||
| 6 | Anthropic | 1498 ±3 | 76,015 | $5 / $25 | |||
| 7 | Anthropic | 1494 ±4 | 61,238 | $5 / $25 | |||
| 8 | 1494 ±9 | 5,125 | $0.75 / $3.75 | 이전 미수록 | |||
| 9 | Anthropic | 1493 ±5 | 35,174 | $5 / $25 | |||
| 10 | Meta | 1492 ±5 | 24,064 | $1.25 / $4.25 |
10 / 100개 항목 · 실행 설정별 구분
Arena Text
실제 사용자는 어떤 모델의 답변을 더 선호하는가?점수와 순위를 읽는 방법
두 모델의 익명 답변을 사용자가 직접 비교해 투표한 결과로, 정답률보다 체감 품질과 선호를 보여줍니다.
사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.
막대는 현재 표의 원점수 범위 안에서 길이를 비교하며, 음수는 0선 왼쪽에 표시합니다. 출처가 다른 막대 길이를 비교하지 마세요.
표의 순위는 원본 값입니다. 검색하거나 정렬해도 새 순위를 매기지 않습니다. 비용의 단위는 평가 작업 비용과 API 토큰 요금에 따라 다릅니다.
코딩하는 상인의 분석
순위에서 한 걸음 더
작업별 선택 기준과 모델별 실행 조건을 확인하세요.
주요 모델 상세 분석
설정별 점수·비용 차이와 공개 평가의 한계
평가별 상위 결과 한눈에 보기
각 출처에서 가장 높은 순위의 항목을 모았습니다. 평가마다 점수 단위와 실행 조건이 다르므로, 이 여섯 행을 서로 비교해 종합 1위를 정할 수는 없습니다.
| 평가 | 원본 상위 항목 | 평가 결과 | 저장 날짜 |
|---|---|---|---|
| Artificial Analysis ↗종합·효율 | Claude Fable 5.1 (max with fallback)원본 1위 · Anthropic추론 설정폴백 포함 | 57지능 지수 | |
| Arena Text ↗대화 선호 | claude-fable-5원본 1위 · Anthropic | 1507 ±5Arena 점수 | |
| Arena Code ↗코딩 선호 | gpt-6-astra-max원본 1위 · OpenAI | 1797+24 / -24Code Arena 점수 | |
| Arena Agent ↗에이전트 실사용 | Claude Fable 5.1 (Max)원본 1위 · Anthropic | 15.87% ±2.84%순 개선도 · 변화량 %p | |
| Arena Vision ↗이미지 이해 | claude-fable-5원본 1위 · Anthropic | 1313 ±8Vision Arena 점수 | |
| SWE-bench Verified ↗저장소 수정 | live-SWE-agent + Claude 4.5 Opus medium (20251101)원본 1위 · UIUC오픈 시스템 | 79.2%해결률 | 14일 이상 경과 |
비교 다음에는, 실제 사용.
내 사용량에서는 얼마일까?
평가 작업 비용은 내 서비스의 요금 견적이 아닙니다. 요청 횟수와 입력·출력 토큰을 넣어 월 API 비용을 따로 계산하세요.
API 비용 계산기점수 차이보다 사용 조건이 중요할 때도 있습니다. AI 선택 가이드에서 비용과 벤치마크의 단위를 확인하세요.
출처와 저장 날짜
갱신·정정 기준 →6개 평가의 559개 항목은 저장 시점의 공개 결과입니다. 출처마다 날짜가 다르며 실시간 순위를 보장하지 않습니다. 항목 수에는 같은 모델의 추론 설정과 에이전트 구성이 각각 포함됩니다.
- Artificial Analysis
- 100개 항목
- Arena Text
- 100개 항목
- Arena Code
- 100개 항목
- Arena Agent
- 59개 항목
- Arena Vision
- 100개 항목
- SWE-bench Verified
- 100개 항목14일 이상 경과