모델 계열 · 클로드

Claude 최신 모델
벤치마크 순위·성능 비교

클로드는 같은 계열이라도 추론 강도와 에이전트 하네스에 따라 결과가 달라집니다. 대화·코딩·도구 사용·저장소 수정 순위를 따로 읽어야 합니다.

데이터 갱신 2026. 08. 17.

한눈에 보기

현재 Claude 대표 항목은 Claude Opus 5 (max)

Artificial Analysis 공개 순위에서 가장 높은 Claude 계열 항목은 Claude Opus 5 (max)입니다. 전체 1위, 지능 지수 63로 집계됐습니다.

이는 출시일 순서가 아니라 현재 독립 평가 스냅샷에서 가장 높은 실행 설정입니다. 같은 모델의 추론 강도별 항목은 별도 결과일 수 있습니다.

공개 결과
97
총 공개 결과 수
평가 출처
6
결과가 있는 평가

출처별 비교

평가별 Claude 상위 결과

서로 단위가 다른 점수를 합산하지 않습니다. 각 표의 순위는 해당 원본 리더보드 전체에서의 위치이며, Claude 결과만 최대 5개 추렸습니다.

종합·효율 · Artificial Analysis

Claude 지능·비용·속도를 한 화면에서

해석: 성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가? 에이전트, 코딩, 과학 추론, 일반 능력을 묶은 Intelligence Index와 실제 API 비용·속도를 함께 봅니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
01Claude Opus 5 (max)Anthropic63지능
02Claude Opus 5 (xhigh)Anthropic63지능
03Claude Fable 5 (with fallback)Anthropic62지능
04Claude Opus 5 (high)Anthropic61지능
09Claude Opus 5 (medium)Anthropic59지능

한계: 영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.

대화 선호 · Arena Text

Claude 사람들이 실제 대화에서 고른 모델

해석: 실제 사용자는 어떤 모델의 답변을 더 선호하는가? 두 모델의 익명 답변을 사용자가 직접 비교해 투표한 결과로, 정답률보다 체감 품질과 선호를 보여줍니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
01claude-fable-5Anthropic1506 ±5점수
02claude-opus-4-6-highAnthropic1505 ±4점수
03claude-opus-4-7-highAnthropic1502 ±4점수
05claude-opus-4-6Anthropic1497 ±3점수
06claude-opus-4-7Anthropic1494 ±4점수

한계: 사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.

코딩 선호 · Arena Code

Claude 코드 답변을 직접 비교한 사용자 선택

해석: 코딩 대화에서 사용자가 더 만족한 모델은 무엇인가? 코딩 요청에서 어떤 모델의 결과가 더 낫다고 평가됐는지 보여주는 공개 사용자 선호 리더보드입니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
01claude-opus-5-maxAnthropic1692+9 / -9점수
04claude-opus-5-highAnthropic1663+9 / -9점수
06claude-fable-5Anthropic1627+8 / -8점수
12claude-opus-4-8-highAnthropic1564+7 / -7점수
13claude-opus-4-7Anthropic1558+6 / -6점수

한계: 코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.

에이전트 실사용 · Arena Agent

Claude 도구를 쓰는 에이전트의 실제 세션 신호

해석: 실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가? 도구 호출이 포함된 실제 세션에서 성공 확인, 칭찬·불만, 조향 가능성, Bash 복구와 환각 신호를 함께 봅니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
01Claude Opus 5 (High)Anthropic12.19% ±1.45%순 개선
02Claude Fable 5 (High)Anthropic12.01% ±2.57%순 개선
03Claude Opus 5 (Max)Anthropic11.95% ±1.71%순 개선
06Claude Opus 4.8 (High)Anthropic9.78% ±1.78%순 개선
08Claude Opus 4.7 (High)Anthropic8.17% ±1.43%순 개선

한계: 여러 행동 신호를 인과 추정으로 합친 실사용 지표입니다. 단일 정답형 벤치마크와 점수 단위를 비교할 수 없습니다.

이미지 이해 · Arena Vision

Claude 이미지 입력 답변에 대한 사용자 선호

해석: 이미지와 텍스트를 함께 이해하는 답변에서 무엇이 더 선호되는가? 이미지를 보고 답하는 멀티모달 모델을 익명으로 비교한 사용자 투표 기반 리더보드입니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
01claude-fable-5Anthropic1315 ±9점수
03claude-opus-4-7-highAnthropic1301 ±7점수
04claude-opus-4-6-highAnthropic1300 ±7점수
05claude-opus-4-7Anthropic1299 ±7점수
06claude-opus-5-highAnthropic1297 ±11점수

한계: OCR, 차트, 공간 추론 등 세부 능력을 하나의 선호 점수로 압축합니다. 용도별 테스트가 추가로 필요합니다.

저장소 수정 · SWE-bench Verified

Claude 실제 GitHub 이슈를 해결한 에이전트

해석: 실제 코드베이스 문제를 해결해 테스트까지 통과한 시스템은 무엇인가? 실제 오픈소스 저장소의 이슈를 재현하고 패치를 적용해 테스트를 통과한 비율을 비교합니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
01live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%해결률
02Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%해결률
06EPAM AI/Run Developer Agent v20250719 + Claude 4 SonnetEPAM Systems, Inc.76.8%해결률
07mini-SWE-agent + Claude 4.5 Opus (high)Anthropic76.8%해결률
12mini-SWE-agent + Claude 4.6 OpusAnthropic75.6%해결률

한계: 모델뿐 아니라 에이전트 하네스, 시도 횟수, 도구와 프롬프트가 결과에 영향을 줍니다. 모델 단독 순위가 아닙니다.