AI 벤치마크, 이렇게 읽습니다

모델을 고를 때 필요한 것은 내 일에 맞는 근거입니다. 어떤 질문을 평가했는지, 점수의 단위가 무엇인지, 어떤 설정으로 실행했는지를 알아야 순위가 쓸모 있어집니다.

코딩하는 상인은 외부 평가 기관의 공개 결과를 정리하고 한국어로 해석합니다. 현재 순위표의 점수를 직접 측정하거나 모델을 인증한 것은 아닙니다.

6개 표가 서로 다른 순위를 보여주는 이유

종합 평가, 사용자 선호, 테스트 해결률은 답하려는 질문이 다릅니다. 각 평가 안에서 후보를 비교하고, 평가가 달라지면 순위도 새로 읽습니다. 이 사이트는 여섯 점수를 합친 자체 종합 순위를 만들지 않습니다.

01

Artificial Analysis

종합·효율

여러 과제의 결과를 정해진 비중으로 묶은 Intelligence Index입니다. 같은 평가 버전 안에서 모델의 전반적인 능력을 비교하는 출발점으로 사용합니다. 지능 지수는 IQ나 모든 질문의 정답률이 아닙니다.

성능 후보를 고른 뒤 작업 비용·출력 속도·첫 응답 시간을 함께 보세요. 추론을 오래 하는 설정은 점수와 함께 비용·대기시간도 늘 수 있습니다. 평가 버전이 바뀌면 이전 점수와 그대로 비교하지 마세요.

02

Arena Text

대화 선호

사용자가 익명으로 제시된 두 답변 중 더 마음에 드는 쪽을 고른 결과입니다. 사람들이 선호한 대화의 품질을 보여주지만, 그 답변의 사실관계가 모두 맞는지 검사한 정답률은 아닙니다.

일상 대화나 글쓰기 후보를 추릴 때 참고하세요. 점수가 비슷하면 투표 수와 신뢰구간도 확인합니다. 한국어 고객 응대라면 존댓말, 금지 표현, 실제 문의 답변을 별도로 시험해야 합니다.

03

Arena Code

코딩 선호

코딩 요청에 대한 결과를 비교한 사용자 선호 점수입니다. 코드를 이해하기 쉬운지, 요청한 결과가 만족스러운지 같은 판단이 포함되므로 테스트 통과율과 구별해야 합니다.

코딩 답변에 대한 선호를 확인한 다음 저장소 수정 평가와 함께 보세요. 모델 이름에 도구나 에이전트 구성이 붙었다면 그 실행 환경까지 포함한 결과입니다. 같은 이름의 API를 호출해도 같은 결과가 나오리라고 단정할 수 없습니다.

04

Arena Agent

에이전트 실사용

실제 도구 사용 세션에서 성공 확인, 사용자 반응, 명령 실패 후 복구, 도구 환각 등의 신호를 분석합니다. Text·Code의 두 답변 투표와 다른 평가 방식입니다. 수치는 평균 모델 대비 변화량(%p)으로 읽습니다.

순 개선도와 개별 신호를 함께 보세요. 성공 신호가 높아도 도구 환각이 늘어날 수 있습니다. 도구 환각의 음수는 감소를 뜻하므로 유리한 방향입니다. +5라는 수치를 성공률 5%나 정확도 5%로 바꾸어 말하지 않습니다.

05

Arena Vision

이미지 이해

이미지가 포함된 질문에 대한 답변을 사용자가 비교한 선호 점수입니다. 이미지에서 정보를 읽고 설명하는 능력을 참고할 수 있습니다. 이미지를 생성하는 모델의 순위는 아닙니다.

문서 이미지, 차트, 화면 캡처처럼 내 업무의 입력을 따로 시험하세요. 선호 점수가 높아도 작은 한글 글씨를 빠짐없이 읽는지, 표의 숫자를 정확히 추출하는지는 별도 확인이 필요합니다.

06

SWE-bench Verified

저장소 수정

실제 GitHub 이슈에 맞는 패치를 만들고 테스트로 해결 여부를 평가합니다. Verified는 사람이 해결 가능성을 확인한 500개 문제를 사용합니다. 공개 순위의 평가 대상은 모델과 에이전트 구성을 합친 시스템입니다.

해결률과 함께 시도 횟수, 시스템 공개 여부, 제출일을 읽으세요. 다른 도구 구성이나 반복 시도로 얻은 결과를 모델 단독 성능으로 표현하지 않습니다. 특정 저장소 집합의 결과이므로 내 프로젝트 언어·의존성에 대한 성공률은 아닙니다.

숫자 옆의 단위가 판단을 바꿉니다

작업당 비용과 토큰당 가격
Artificial Analysis의 작업 비용은 평가 과제를 수행하는 데 드는 비용입니다. Arena의 가격 열은 입력·출력 각각 100만 토큰당 달러 단가입니다. 작업 하나에 쓰는 토큰이 모델과 설정마다 다르므로 두 숫자를 같은 가격으로 비교하면 안 됩니다. 구독 앱의 월 요금과 API 사용료도 별개입니다.
출력 속도와 기다리는 시간
초당 토큰 수는 출력을 내보내는 속도입니다. 사용자가 느끼는 대기시간에는 답변을 시작하기 전의 추론과 도구 실행도 영향을 줍니다. 빠른 출력 속도만 보고 바로 답하는 모델이라고 판단하지 말고 첫 응답과 전체 응답 시간까지 확인하세요.
신뢰구간과 표본 수
점수 옆 ± 표시는 추정의 불확실성을 함께 보여줍니다. 점수가 근접한 두 모델의 순위가 한두 칸 다르다는 이유만으로 큰 성능 차이를 단정하지 않습니다. 표본 수가 많다는 사실만으로 내 업무에 더 적합하다는 결론도 나오지 않습니다.
미등재·미측정과 0점
표에 모델이 없으면 수록 범위 밖이거나 해당 평가 결과를 확보하지 못했을 수 있습니다. 실패했다는 뜻이 아닙니다. 측정값이 없는 칸은 0으로 채우지 않습니다. 숫자로 정렬할 수 있는 열에서 미측정 항목은 마지막에 놓고, 원본 순위 숫자는 그대로 둡니다.
모델 이름 뒤의 실행 조건
high·max 같은 추론 설정, fallback, 에이전트 도구 구성이 점수에 영향을 줄 수 있습니다. 제공사별 상위 모델 하나만 보고 그 회사의 모든 모델이 같은 성능이라고 생각하지 마세요. API를 선택할 때는 모델 ID와 사용할 수 있는 설정을 제공사의 문서에서 다시 확인합니다.
사용량으로 월 API 비용 계산하기 →

내 업무에 맞는 후보를 고르는 순서

다음은 코딩하는 상인이 제안하는 비교 절차입니다. 외부 평가 기관의 채점법이나 이 사이트에서 이미 수행한 실험 결과를 뜻하지 않습니다.

  1. 1.

    통과해야 할 조건부터 적습니다.

    예를 들어 한국어 문의 답변이라면 금액·날짜 오류 없음, 환불 정책 준수, 허용한 표현 사용을 확인 항목으로 둡니다. 문장이 자연스럽다는 느낌만으로 통과시키지 않습니다.

  2. 2.

    가까운 평가에서 후보 두세 개를 고릅니다.

    대화라면 Text, 이미지 문서라면 Vision, 저장소 수정이라면 SWE-bench를 출발점으로 삼습니다. 내 예산과 제공 조건을 만족하지 못하는 모델은 이 단계에서 제외합니다.

  3. 3.

    같은 입력과 조건으로 직접 비교합니다.

    같은 프롬프트·입력 자료·도구 권한을 주고 모델 ID, 추론 설정, 실행일을 기록합니다. 결과를 볼 때 모델 이름을 가려 두면 이름에서 오는 기대를 줄일 수 있습니다.

  4. 4.

    실패한 경우와 수정 비용까지 기록합니다.

    반드시 틀리면 안 되는 조건은 따로 판정하고, 사실 확인이나 수작업 수정에 걸린 시간도 적습니다. 한 번 잘된 응답만 고르지 않고 애매한 입력과 실패 사례를 포함해 다시 실행합니다.

  5. 5.

    품질을 통과한 후보끼리 비용을 비교합니다.

    토큰 사용량, 요청 횟수, 재시도, 대기시간을 함께 봅니다. 공개 벤치마크 1위보다 내 업무의 필수 조건을 안정적으로 통과하는 모델이 실용적인 선택일 수 있습니다.

데이터 반영·갱신·정정 기준

코딩하는 상인은 원본 리더보드의 공개 행을 출처별로 저장합니다. 순위, 점수의 부호, 신뢰구간, 추론 설정과 공개 조건을 보존하며, 수록한 범위는 각 표에 표시합니다. 공급자의 출시 발표를 근거로 독립 평가의 점수를 만들거나 다른 모델의 결과를 복사하지 않습니다.

스냅샷 날짜는 해당 데이터가 저장된 시점입니다. 원본을 다시 읽었더라도 값이 그대로라면 이전 저장 날짜를 유지할 수 있습니다. 출처마다 갱신 시점이 다르므로 사이트 전체가 같은 날 검증됐다는 의미로 사용하지 않습니다. 저장 후 14일이 지난 표에는 경과 안내를 표시합니다. 이는 원본 대조를 돕는 표시이며 순위가 틀렸다는 판정은 아닙니다.

Artificial Analysis 저장 · 100개 항목
Arena Text 저장 · 100개 항목
Arena Code 저장 · 100개 항목
Arena Agent 저장 · 59개 항목
Arena Vision 저장 · 100개 항목
SWE-bench Verified 저장 · 100개 항목

운영자는 원본과 모델의 실행 조건을 대조한 뒤 데이터를 반영합니다. AI가 번역이나 정리를 도울 수 있지만, 출처 확인과 게시 내용의 책임은 운영자에게 있습니다. 오류를 발견하면 페이지 주소·모델명·문제가 된 값·원본 링크를 [email protected]로 보내 주세요. 확인 후 관련 표와 설명을 함께 정정합니다.

별도의 자체 실험을 공개할 경우 외부 순위와 구분하고, 입력·모델 설정·실행일·채점 기준·실패 사례를 함께 제시해야 합니다. 이 페이지에 적힌 비교 절차만으로 자체 테스트를 완료했다고 주장하지 않습니다.

데이터 업데이트 기록 보기 →