모델명·체크포인트·제공사를 확인한 항목만 모았습니다. 순위는 각 원본 전체의 순위이며, 출처가 다른 점수나 순위를 평균내지 않습니다. 빈 값과 별표, 신뢰구간은 원본 표기를 유지합니다.
성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가?
Claude Opus 5, Artificial Analysis, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | 지능 지수 | 평가 작업 비용 | 출력 속도 | 첫 응답 | 전체 응답 | 컨텍스트 |
|---|
| 6 | Claude Opus 5 (max)추론 설정 | 54 | $4.21 | 56 t/s | 94.82 초 | 103.76 초 | 1M |
|---|
| 7 | Claude Opus 5 (xhigh)추론 설정 | 53 | $3.36 | 53 t/s | 33.25 초 | 42.62 초 | 1M |
|---|
| 13 | Claude Opus 5 (high)추론 설정 | 52 | $2.44 | 52 t/s | 17.97 초 | 27.56 초 | 1M |
|---|
| 21 | Claude Opus 5 (medium)추론 설정 | 50 | $1.36 | 52 t/s | 4.68 초 | 14.31 초 | 1M |
|---|
| 40 | Claude Opus 5 (low)추론 설정 | 44 | $0.64 | 53 t/s | 2.29 초 | 11.79 초 | 1M |
|---|
영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.
실제 사용자는 어떤 모델의 답변을 더 선호하는가?
Claude Opus 5, Arena Text, 2026. 09. 03. 저장 결과| 순위 | 모델·실행 설정 | Arena 점수 | 투표 수 | API 가격 | 컨텍스트 |
|---|
| 9 | claude-opus-5-high | 1493 ±5 | 35,174 | $5 / $25 | 1M |
|---|
| 14 | claude-opus-5-max | 1488 ±6 | 17,119 | $5 / $25 | 1M |
|---|
사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.
표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.
코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?
Claude Opus 5, Arena Code, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | Code Arena 점수 | 투표 수 | API 가격 | 컨텍스트 |
|---|
| 3 | claude-opus-5-max | 1688+8 / -8 | 10,904 | $5 / $25 | 1M |
|---|
| 7 | claude-opus-5-high | 1661+7 / -7 | 10,928 | $5 / $25 | 1M |
|---|
코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.
표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.
실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가?
Claude Opus 5, Arena Agent, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | 순 개선도 | 확인된 성공 | 칭찬 대 불만 | Bash 복구 | 도구 환각 | 세션 수 |
|---|
| 2 | Claude Opus 5 (High) | 12.68% ±1.73% | 13.30% ±3.69% | 18.27% ±6.49% | 15.03% ±0.84% | -0.73% ±0.13% | 22,594 |
|---|
| 3 | Claude Opus 5 (Max) | 11.67% ±1.96% | 14.89% ±3.95% | 17.30% ±7.10% | 15.69% ±0.82% | -0.76% ±0.13% | 18,112 |
|---|
수치는 절대 성공률이 아니라 평균 모델 대비 변화(%p)입니다. 음수는 감소를 뜻하며 도구 환각은 낮을수록 좋습니다. 다른 벤치마크와 점수를 합산할 수 없습니다.
이미지와 텍스트를 함께 이해하는 답변에서 무엇이 더 선호되는가?
Claude Opus 5, Arena Vision, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | Vision Arena 점수 | 투표 수 | API 가격 | 컨텍스트 |
|---|
| 9 | claude-opus-5-high | 1290 ±8 | 8,271 | $5 / $25 | 1M |
|---|
OCR, 차트, 공간 추론 등 세부 능력을 하나의 선호 점수로 압축합니다. 용도별 테스트가 추가로 필요합니다.
표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.
다른 출처에 결과가 없다는 사실은 0점이나 해당 기능 미지원의 근거가 아닙니다. 동일 모델인지 확인되지 않은 항목은 연결하지 않았습니다.