AI 모델 순위
지금 어떤 AI를 쓸지, 성능과 비용을 함께 비교하세요.
종합 성능 현재 수록 1위
Anthropic · max with fallback
Artificial Analysis · · 해당 평가의 원점수
| 비교 선택 | 모델 눌러서 자세히 | 제공사 | 순위 추이 ↗ | ||||
|---|---|---|---|---|---|---|---|
| 1 | Anthropic | 57 | $6.12 | 68 t/s | |||
| 2 | Anthropic | 56 | $4.64 | 65 t/s | |||
| 3 | OpenAI | 55 | $2.57 | 64 t/s | 이전 미수록 | ||
| 4 | Anthropic | 54 | $2.86 | 56 t/s | |||
| 5 | OpenAI | 54 | $1.85 | 60 t/s | 이전 미수록 | ||
| 6 | Anthropic | 54 | $4.21 | 56 t/s | |||
| 7 | Anthropic | 53 | $3.36 | 53 t/s | |||
| 8 | OpenAI | 53 | $1.41 | 62 t/s | 이전 미수록 | ||
| 9 | Anthropic | 53 | $5.62 | 63 t/s | |||
| 10 | Meta | 53 | $0.96 | 233 t/s |
Artificial Analysis
성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가?점수와 순위를 읽는 방법
에이전트, 코딩, 과학 추론, 일반 능력을 묶은 Intelligence Index와 실제 API 비용·속도를 함께 봅니다.
영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.
막대는 현재 표의 원점수 범위 안에서 길이를 비교하며, 음수는 0선 왼쪽에 표시합니다. 출처가 다른 막대 길이를 비교하지 마세요.
표의 순위는 원본 값입니다. 검색하거나 정렬해도 새 순위를 매기지 않습니다. 비용의 단위는 평가 작업 비용과 API 토큰 요금에 따라 다릅니다.
코딩하는 상인의 분석
순위에서 한 걸음 더
작업별 선택 기준과 모델별 실행 조건을 확인하세요.
주요 모델 상세 분석
설정별 점수·비용 차이와 공개 평가의 한계
평가별 상위 결과 한눈에 보기
각 출처에서 가장 높은 순위의 항목을 모았습니다. 평가마다 점수 단위와 실행 조건이 다르므로, 이 여섯 행을 서로 비교해 종합 1위를 정할 수는 없습니다.
| 평가 | 원본 상위 항목 | 평가 결과 | 저장 날짜 |
|---|---|---|---|
| Artificial Analysis ↗종합·효율 | Claude Fable 5.1 (max with fallback)원본 1위 · Anthropic추론 설정폴백 포함 | 57지능 지수 | |
| Arena Text ↗대화 선호 | claude-fable-5원본 1위 · Anthropic | 1507 ±5Arena 점수 | |
| Arena Code ↗코딩 선호 | gpt-6-astra-max원본 1위 · OpenAI | 1797+24 / -24Code Arena 점수 | |
| Arena Agent ↗에이전트 실사용 | Claude Fable 5.1 (Max)원본 1위 · Anthropic | 15.87% ±2.84%순 개선도 · 변화량 %p | |
| Arena Vision ↗이미지 이해 | claude-fable-5원본 1위 · Anthropic | 1313 ±8Vision Arena 점수 | |
| SWE-bench Verified ↗저장소 수정 | live-SWE-agent + Claude 4.5 Opus medium (20251101)원본 1위 · UIUC오픈 시스템 | 79.2%해결률 | 14일 이상 경과 |
비교 다음에는, 실제 사용.
내 사용량에서는 얼마일까?
평가 작업 비용은 내 서비스의 요금 견적이 아닙니다. 요청 횟수와 입력·출력 토큰을 넣어 월 API 비용을 따로 계산하세요.
API 비용 계산기점수 차이보다 사용 조건이 중요할 때도 있습니다. AI 선택 가이드에서 비용과 벤치마크의 단위를 확인하세요.
출처와 저장 날짜
갱신·정정 기준 →6개 평가의 559개 항목은 저장 시점의 공개 결과입니다. 출처마다 날짜가 다르며 실시간 순위를 보장하지 않습니다. 항목 수에는 같은 모델의 추론 설정과 에이전트 구성이 각각 포함됩니다.
- Artificial Analysis
- 100개 항목
- Arena Text
- 100개 항목
- Arena Code
- 100개 항목
- Arena Agent
- 59개 항목
- Arena Vision
- 100개 항목
- SWE-bench Verified
- 100개 항목14일 이상 경과