AI 모델 순위

지금 어떤 AI를 쓸지, 성능과 비용을 함께 비교하세요.

대화·글쓰기 현재 수록 1위

Anthropic

1507 ±5Arena 점수

Arena Text · · 해당 평가의 원점수

Arena Text 원본 순위와 점수. 모델 이름을 누르면 상세 정보가 열립니다.
비교 선택모델 눌러서 자세히제공사순위 추이 ↗
1Anthropic1507 ±527,189$10 / $502026. 08. 17. 1위 → 2026. 09. 03. 1위. 직전 기록 대비 변동 없음. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
2Anthropic1505 ±472,099$5 / $252026. 08. 17. 2위 → 2026. 09. 03. 2위. 직전 기록 대비 변동 없음. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
3Anthropic1504 ±112,906$10 / $50이전 미수록
4Anthropic1502 ±460,103$5 / $252026. 08. 17. 3위 → 2026. 09. 03. 4위. 직전 기록 대비 1계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
5Meta1499 ±103,240$1.25 / $4.252026. 08. 17. 4위 → 2026. 09. 03. 5위. 직전 기록 대비 1계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
6Anthropic1498 ±376,015$5 / $252026. 08. 17. 5위 → 2026. 09. 03. 6위. 직전 기록 대비 1계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
7Anthropic1494 ±461,238$5 / $252026. 08. 17. 6위 → 2026. 09. 03. 7위. 직전 기록 대비 1계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
8Google1494 ±95,125$0.75 / $3.75이전 미수록
9Anthropic1493 ±535,174$5 / $252026. 08. 17. 7위 → 2026. 09. 03. 9위. 직전 기록 대비 2계단 하락. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
10Meta1492 ±524,064$1.25 / $4.252026. 08. 17. 11위 → 2026. 09. 03. 10위. 직전 기록 대비 1계단 상승. 저장 시점별 순위입니다. 평가 버전과 참가 모델의 변화가 반영될 수 있으며, 순위 상승이 성능 향상을 뜻하지는 않습니다.
10 / 100개 항목 · 실행 설정별 구분

Arena Text

실제 사용자는 어떤 모델의 답변을 더 선호하는가?
원본 보기 ↗
대화·글쓰기 전체 표와 선택 기준
점수와 순위를 읽는 방법

두 모델의 익명 답변을 사용자가 직접 비교해 투표한 결과로, 정답률보다 체감 품질과 선호를 보여줍니다.

사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.

막대는 현재 표의 원점수 범위 안에서 길이를 비교하며, 음수는 0선 왼쪽에 표시합니다. 출처가 다른 막대 길이를 비교하지 마세요.

표의 순위는 원본 값입니다. 검색하거나 정렬해도 새 순위를 매기지 않습니다. 비용의 단위는 평가 작업 비용과 API 토큰 요금에 따라 다릅니다.

코딩하는 상인의 분석

순위에서 한 걸음 더

작업별 선택 기준과 모델별 실행 조건을 확인하세요.

평가별 상위 결과 한눈에 보기

각 출처에서 가장 높은 순위의 항목을 모았습니다. 평가마다 점수 단위와 실행 조건이 다르므로, 이 여섯 행을 서로 비교해 종합 1위를 정할 수는 없습니다.

출처별 원본 상위 항목과 점수, 데이터 저장 날짜
평가원본 상위 항목평가 결과저장 날짜
Artificial Analysis종합·효율Claude Fable 5.1 (max with fallback)원본 1위 · Anthropic추론 설정폴백 포함57지능 지수
Arena Text대화 선호claude-fable-5원본 1위 · Anthropic1507 ±5Arena 점수
Arena Code코딩 선호gpt-6-astra-max원본 1위 · OpenAI1797+24 / -24Code Arena 점수
Arena Agent에이전트 실사용Claude Fable 5.1 (Max)원본 1위 · Anthropic15.87% ±2.84%순 개선도 · 변화량 %p
Arena Vision이미지 이해claude-fable-5원본 1위 · Anthropic1313 ±8Vision Arena 점수
SWE-bench Verified저장소 수정live-SWE-agent + Claude 4.5 Opus medium (20251101)원본 1위 · UIUC오픈 시스템79.2%해결률14일 이상 경과

비교 다음에는, 실제 사용.

내 사용량에서는 얼마일까?

평가 작업 비용은 내 서비스의 요금 견적이 아닙니다. 요청 횟수와 입력·출력 토큰을 넣어 월 API 비용을 따로 계산하세요.

API 비용 계산기

점수 차이보다 사용 조건이 중요할 때도 있습니다. AI 선택 가이드에서 비용과 벤치마크의 단위를 확인하세요.

출처와 저장 날짜

갱신·정정 기준 →

6개 평가의 559개 항목은 저장 시점의 공개 결과입니다. 출처마다 날짜가 다르며 실시간 순위를 보장하지 않습니다. 항목 수에는 같은 모델의 추론 설정과 에이전트 구성이 각각 포함됩니다.

Artificial Analysis
100개 항목
Arena Text
100개 항목
Arena Code
100개 항목
Arena Agent
59개 항목
Arena Vision
100개 항목
SWE-bench Verified
100개 항목14일 이상 경과