AI 모델 순위

지금 어떤 AI를 쓸지, 성능과 비용을 함께 비교하세요.

AI 에이전트 현재 수록 1위

Anthropic · Max

15.87% ±2.84%순 개선도 · %p

Arena Agent · · 해당 평가의 원점수

Arena Agent 원본 순위와 점수. 모델 이름을 누르면 상세 정보가 열립니다.
비교 선택모델 눌러서 자세히제공사순위 추이 ↗
1Anthropic15.87% ±2.84%22.45% ±3.71%6,796이전 미수록
2Anthropic12.68% ±1.73%13.30% ±3.69%22,5942026. 08. 17. 1위 → 2026. 09. 03. 1위 → 2026. 09. 07. 2위. 직전 기록 대비 1계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
3Anthropic11.67% ±1.96%14.89% ±3.95%18,1122026. 08. 17. 3위 → 2026. 09. 03. 2위 → 2026. 09. 07. 3위. 직전 기록 대비 1계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
4Anthropic10.23% ±1.46%7.37% ±3.17%36,2042026. 08. 17. 2위 → 2026. 09. 03. 3위 → 2026. 09. 07. 4위. 직전 기록 대비 1계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
5OpenAI9.31% ±1.49%6.68% ±3.13%29,7302026. 08. 17. 4위 → 2026. 09. 03. 4위 → 2026. 09. 07. 5위. 직전 기록 대비 1계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
6Anthropic9.17% ±1.48%5.27% ±3.07%38,1482026. 08. 17. 6위 → 2026. 09. 03. 5위 → 2026. 09. 07. 6위. 직전 기록 대비 1계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
7Moonshot7.96% ±0.68%16.58% ±1.40%97,9152026. 08. 17. 5위 → 2026. 09. 03. 6위 → 2026. 09. 07. 7위. 직전 기록 대비 1계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
8Anthropic7.41% ±1.95%2.80% ±4.13%28,6622026. 08. 17. 12위 → 2026. 09. 03. 8위 → 2026. 09. 07. 8위. 직전 기록 대비 변동 없음. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
9OpenAI7.21% ±1.08%2.07% ±2.42%51,2552026. 08. 17. 7위 → 2026. 09. 03. 7위 → 2026. 09. 07. 9위. 직전 기록 대비 2계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
10Tencent6.92% ±1.51%13.56% ±2.96%14,4052026. 09. 03. 13위 → 2026. 09. 07. 10위. 직전 기록 대비 3계단 상승. 동일 항목으로 확인되는 연속 기록만 연결했습니다. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
10 / 59개 항목 · 실행 설정별 구분

Arena Agent

실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가?
원본 보기 ↗
AI 에이전트 전체 표와 선택 기준
점수와 순위를 읽는 방법

도구 호출이 포함된 실제 세션에서 성공 확인, 칭찬·불만, 조향 가능성, Bash 복구와 환각 신호를 함께 봅니다.

수치는 절대 성공률이 아니라 평균 모델 대비 변화(%p)입니다. 음수는 감소를 뜻하며 도구 환각은 낮을수록 좋습니다. 다른 벤치마크와 점수를 합산할 수 없습니다.

막대는 현재 표의 원점수 범위 안에서 길이를 비교하며, 음수는 0선 왼쪽에 표시합니다. 출처가 다른 막대 길이를 비교하지 마세요.

표의 순위는 원본 값입니다. 검색하거나 정렬해도 새 순위를 매기지 않습니다. 비용의 단위는 평가 작업 비용과 API 토큰 요금에 따라 다릅니다.

코딩하는 상인의 분석

순위에서 한 걸음 더

작업별 선택 기준과 모델별 실행 조건을 확인하세요.

평가별 상위 결과 한눈에 보기

각 출처에서 가장 높은 순위의 항목을 모았습니다. 평가마다 점수 단위와 실행 조건이 다르므로, 이 여섯 행을 서로 비교해 종합 1위를 정할 수는 없습니다.

출처별 원본 상위 항목과 점수, 데이터 저장 날짜
평가원본 상위 항목평가 결과저장 날짜
Artificial Analysis종합·효율Claude Fable 5.1 (max with fallback)원본 1위 · Anthropic추론 설정폴백 포함57지능 지수
Arena Text대화 선호claude-fable-5원본 1위 · Anthropic1507 ±5Arena 점수
Arena Code코딩 선호gpt-6-astra-max원본 1위 · OpenAI1797+24 / -24Code Arena 점수
Arena Agent에이전트 실사용Claude Fable 5.1 (Max)원본 1위 · Anthropic15.87% ±2.84%순 개선도 · 변화량 %p
Arena Vision이미지 이해claude-fable-5원본 1위 · Anthropic1313 ±8Vision Arena 점수
SWE-bench Verified저장소 수정live-SWE-agent + Claude 4.5 Opus medium (20251101)원본 1위 · UIUC오픈 시스템79.2%해결률14일 이상 경과

비교 다음에는, 실제 사용.

내 사용량에서는 얼마일까?

평가 작업 비용은 내 서비스의 요금 견적이 아닙니다. 요청 횟수와 입력·출력 토큰을 넣어 월 API 비용을 따로 계산하세요.

API 비용 계산기

점수 차이보다 사용 조건이 중요할 때도 있습니다. AI 선택 가이드에서 비용과 벤치마크의 단위를 확인하세요.

출처와 저장 날짜

갱신·정정 기준 →

6개 평가의 559개 항목은 저장 시점의 공개 결과입니다. 출처마다 날짜가 다르며 실시간 순위를 보장하지 않습니다. 항목 수에는 같은 모델의 추론 설정과 에이전트 구성이 각각 포함됩니다.

Artificial Analysis
100개 항목
Arena Text
100개 항목
Arena Code
100개 항목
Arena Agent
59개 항목
Arena Vision
100개 항목
SWE-bench Verified
100개 항목14일 이상 경과