AI MODEL BOARD2026. 08. 03. 갱신

누가 1위인가보다,
무슨 일에 강한가

대화 선호, 코딩, 에이전트, 비전, 실제 저장소 수정, 비용과 속도까지. 서로 다른 평가를 원본 그대로 분리하고 한국어로 해석합니다.

SOURCES
6
평가 관점
ENTRIES
52
공개 항목
COMPOSITE
OFF
임의 합산 없음
종합·효율

Claude Opus 5 (max)

Anthropic61
대화 선호

claude-fable-5

Anthropic1509 ±6
저장소 수정

live-SWE-agent + Claude 4.5 Opus medium

UIUC79.2%
01

먼저 목적을 고릅니다

대화, 코딩, 에이전트, 비전은 서로 다른 능력입니다.

02

점수의 단위를 확인합니다

선호 점수와 테스트 통과율을 같은 숫자로 비교하지 않습니다.

03

가격·속도로 다시 거릅니다

가장 높은 점수가 실제 운영의 최선은 아닐 수 있습니다.

MULTI-LENS LEADERBOARD

하나의 1위 대신, 여섯 개의 관점

점수 단위가 다른 벤치마크를 임의 합산하지 않습니다. 지금 하려는 일과 가장 가까운 평가를 먼저 고르세요.

Artificial Analysis상위 10개 항목

지능·비용·속도를 한 화면에서

에이전트, 코딩, 과학 추론, 일반 능력을 묶은 Intelligence Index와 실제 API 비용·속도를 함께 봅니다.

성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가?

모델·시스템
01Claude Opus 5 (max)Anthropic추론 max61$2.3454 t/s76.14초85.32초1M
02Claude Opus 5 (xhigh)Anthropic추론 xhigh60$1.8055 t/s38.37초47.52초1M
03Claude Fable 5 (with fallback)Anthropicfallback60$3.1574 t/s143.98초150.75초1M
04GPT-5.6 Sol (max)OpenAI추론 max59$1.2368 t/s137.84초145.23초1M
05Claude Opus 5 (high)Anthropic추론 high59$1.2351 t/s17.72초27.44초1M
06GPT-5.6 Sol (xhigh)OpenAI추론 xhigh58$0.8369 t/s49.15초56.40초1M
07Kimi K3 (max)Moonshot AI오픈 웨이트57$0.8635 t/s2.76초74.70초1.05M
08Claude Opus 5 (medium)Anthropic추론 medium56$0.7250 t/s5.21초15.12초1M
09GPT-5.6 Sol (high)OpenAI추론 high56$0.5560 t/s9.32초17.71초1M
10GPT-5.6 Terra (max)OpenAI추론 max55$0.51138 t/s163.26초166.89초1M

해석할 때 주의할 점

영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.

동기화 2026년 8월 3일 오전 9:00방법론 ↗원본 순위 ↗

SOURCE LEDGER

출처부터 공개합니다

수치는 원본 리더보드의 최신 공개 스냅샷이며, 코딩하는 상인은 점수의 의미와 한계를 한국어로 설명합니다. 모델 회사의 자체 발표 점수는 이 표에 섞지 않습니다.

  1. 01

    Artificial Analysis

    성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가?

  2. 02

    Arena Text

    실제 사용자는 어떤 모델의 답변을 더 선호하는가?

  3. 03

    Arena Code

    코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?

  4. 04

    Arena Agent

    실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가?

  5. 05

    Arena Vision

    이미지와 텍스트를 함께 이해하는 답변에서 무엇이 더 선호되는가?

  6. 06

    SWE-bench Verified

    실제 코드베이스 문제를 해결해 테스트까지 통과한 시스템은 무엇인가?

EDITOR'S NOTE

다음 단계는 한국어 실사용 벤치입니다

공개 벤치마크에는 한국어 문체, 국내 문서 요약, JSON 준수, 실무 오류 복구 같은 맥락이 충분하지 않습니다. 동일 프롬프트·채점 기준·원본 응답을 공개하는 자체 테스트를 이 데이터 위에 순차적으로 더합니다.

테스트 제안하기