Claude Opus 5 (max)
먼저 목적을 고릅니다
대화, 코딩, 에이전트, 비전은 서로 다른 능력입니다.
점수의 단위를 확인합니다
선호 점수와 테스트 통과율을 같은 숫자로 비교하지 않습니다.
가격·속도로 다시 거릅니다
가장 높은 점수가 실제 운영의 최선은 아닐 수 있습니다.
MULTI-LENS LEADERBOARD
하나의 1위 대신, 여섯 개의 관점
점수 단위가 다른 벤치마크를 임의 합산하지 않습니다. 지금 하려는 일과 가장 가까운 평가를 먼저 고르세요.
지능·비용·속도를 한 화면에서
에이전트, 코딩, 과학 추론, 일반 능력을 묶은 Intelligence Index와 실제 API 비용·속도를 함께 봅니다.
→ 성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가?
| 모델·시스템 | |||||||
|---|---|---|---|---|---|---|---|
| 01 | Claude Opus 5 (max)Anthropic추론 max | 61 | $2.34 | 54 t/s | 76.14초 | 85.32초 | 1M |
| 02 | Claude Opus 5 (xhigh)Anthropic추론 xhigh | 60 | $1.80 | 55 t/s | 38.37초 | 47.52초 | 1M |
| 03 | Claude Fable 5 (with fallback)Anthropicfallback | 60 | $3.15 | 74 t/s | 143.98초 | 150.75초 | 1M |
| 04 | GPT-5.6 Sol (max)OpenAI추론 max | 59 | $1.23 | 68 t/s | 137.84초 | 145.23초 | 1M |
| 05 | Claude Opus 5 (high)Anthropic추론 high | 59 | $1.23 | 51 t/s | 17.72초 | 27.44초 | 1M |
| 06 | GPT-5.6 Sol (xhigh)OpenAI추론 xhigh | 58 | $0.83 | 69 t/s | 49.15초 | 56.40초 | 1M |
| 07 | Kimi K3 (max)Moonshot AI오픈 웨이트 | 57 | $0.86 | 35 t/s | 2.76초 | 74.70초 | 1.05M |
| 08 | Claude Opus 5 (medium)Anthropic추론 medium | 56 | $0.72 | 50 t/s | 5.21초 | 15.12초 | 1M |
| 09 | GPT-5.6 Sol (high)OpenAI추론 high | 56 | $0.55 | 60 t/s | 9.32초 | 17.71초 | 1M |
| 10 | GPT-5.6 Terra (max)OpenAI추론 max | 55 | $0.51 | 138 t/s | 163.26초 | 166.89초 | 1M |
SOURCE LEDGER
출처부터 공개합니다
수치는 원본 리더보드의 최신 공개 스냅샷이며, 코딩하는 상인은 점수의 의미와 한계를 한국어로 설명합니다. 모델 회사의 자체 발표 점수는 이 표에 섞지 않습니다.
- 01
Artificial Analysis
성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가?
- 02
Arena Text
실제 사용자는 어떤 모델의 답변을 더 선호하는가?
- 03
Arena Code
코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?
- 04
Arena Agent
실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가?
- 05
Arena Vision
이미지와 텍스트를 함께 이해하는 답변에서 무엇이 더 선호되는가?
- 06
SWE-bench Verified
실제 코드베이스 문제를 해결해 테스트까지 통과한 시스템은 무엇인가?
EDITOR'S NOTE
다음 단계는 한국어 실사용 벤치입니다
공개 벤치마크에는 한국어 문체, 국내 문서 요약, JSON 준수, 실무 오류 복구 같은 맥락이 충분하지 않습니다. 동일 프롬프트·채점 기준·원본 응답을 공개하는 자체 테스트를 이 데이터 위에 순차적으로 더합니다.