코딩하는 상인 · 공개 데이터 분석
AI 모델 가성비 비교
최고 점수 모델을 고르면 비용과 대기시간도 감당할 만할까요? 필요한 지수와 기다릴 수 있는 시간을 정하고, 같은 평가에서 비용이 낮은 후보를 찾아보세요.
기본 조건에서 읽은 결과
지능 지수 50 이상에서 평가 작업 비용이 가장 낮은 항목은 Muse Spark 1.3 (xhigh)입니다. 지수 52, 평가 작업당 $0.84입니다. 첫 응답 상한 적용 전 최고 지수 항목 GPT-6 Astra (max)(55)와 비교하면 지수는 3점 낮고 평가 작업 비용은 67.3% 낮습니다.
폴백 포함·일반 제공 전·Preview·Alpha·Beta로 표시된 행을 기본적으로 제외했습니다. 지수 하한은 분석 대상 최고 지수에서 5점을 낮춘 편집 기준이며, 품질 보장선이나 정답률이 아닙니다.내 조건으로 좁히기
지수와 기다릴 수 있는 시간을 정하면 후보가 바로 바뀝니다.
기본 제외 조건의 최고 지수보다 5점 낮은 50점에서 시작합니다. 포함 조건을 바꿔도 입력한 기준은 유지됩니다.
첫 청크가 나오기까지의 시간입니다. 전체 작업 완료 시간과 다릅니다.
표기가 없는 항목의 실제 이용 가능 여부까지 확인한 것은 아닙니다. 제공사의 현재 제공 조건을 확인하세요.
조건에 맞는 14개 평가 항목
지능 지수 50 이상에서 평가 작업 비용이 가장 낮은 항목은 Muse Spark 1.3 (xhigh)입니다. 지수 52, 평가 작업당 $0.84입니다. 첫 응답 상한 적용 전 최고 지수 항목 GPT-6 Astra (max)(55)와 비교하면 지수는 3점 낮고 평가 작업 비용은 67.3% 낮습니다.
평가 작업 비용이 낮은 순서입니다. 모델 이름을 누르면 해당 설정의 비교나 상세를 볼 수 있습니다.
| 모델·실행 설정 | 지능 지수 | 작업 비용 | 첫 응답 | 같은 조건의 대안 |
|---|---|---|---|---|
| Muse Spark 1.3xhigh | 52 | $0.84 | 41.29 초 | 지수·비용 후보 |
| GPT-5.6 Solxhigh | 50 | $0.89 | 64.00 초 | Muse Spark 1.3 (xhigh)과 비교 → |
| GPT-6 Astramedium | 52 | $1.16 | 6.96 초 | Muse Spark 1.3 (xhigh)과 비교 → |
| GPT-5.6 Solmax | 51 | $1.25 | 255.98 초 | Muse Spark 1.3 (xhigh)과 비교 → |
| Grok 4.6high | 51 | $1.25 | 39.94 초 | Muse Spark 1.3 (xhigh)과 비교 → |
| Claude Opus 5medium | 50 | $1.36 | 4.68 초 | Muse Spark 1.3 (xhigh)과 비교 → |
| GPT-6 Astrahigh | 53 | $1.41 | 46.10 초 | 지수·비용 후보 |
| Kimi K3max | 50 | $1.58 | 3.26 초 | Muse Spark 1.3 (xhigh)과 비교 → |
| Grok 4.6xhigh | 50 | $1.61 | 52.91 초 | Muse Spark 1.3 (xhigh)과 비교 → |
| GPT-6 Astraxhigh | 54 | $1.85 | 169.19 초 | 지수·비용 후보 |
| Claude Opus 5high | 52 | $2.44 | 17.97 초 | Muse Spark 1.3 (xhigh)과 비교 → |
| GPT-6 Astramax | 55 | $2.57 | 354.72 초 | 지수·비용 후보 |
| Claude Opus 5xhigh | 53 | $3.36 | 33.25 초 | GPT-6 Astra (high)과 비교 → |
| Claude Opus 5max | 54 | $4.21 | 94.82 초 | GPT-6 Astra (xhigh)과 비교 → |
‘지수·비용 후보’ 4개는 같은 조건에서 지수가 같거나 더 높으면서 비용이 더 낮은 항목, 또는 비용이 같으면서 지수가 더 높은 항목이 없습니다. 응답 시간은 입력한 상한으로만 거릅니다. 원본의 Non-reasoning 등 표기가 실제 API에서 그대로 지원되는 설정을 뜻하지는 않습니다.
분석 범위와 제외 이유 · 100개 중 86개 제외
아래 순서로 처음 해당하는 이유를 한 번만 집계합니다. 첫 응답 수치가 없어도 상한을 비워 두면 분석에 포함됩니다.
- 폴백 포함 표기
- 6개
- 사전 공개 표기
- 5개
- 지수·비용 수치 없음 또는 유효하지 않음
- 35개
- 최소 지수 미달
- 40개
- 첫 응답 수치 없음 또는 유효하지 않음
- 0개
- 첫 응답 상한 초과
- 0개
CSV에는 수록된 100개 원본 행, 원문 수치, 선택 조건, 각 행의 제외 이유와 우위 대안이 모두 들어갑니다. 미수록 모델까지 포함한 시장 전체의 최저 비용 결과는 아닙니다.
조건 하나를 바꾸면 선택도 달라질까?
아래는 모두 같은 저장본을 다시 계산한 결과입니다. 모델 성능을 새로 측정한 실험은 아니며, 최소 지수와 첫 응답 조건이 비용 후보를 어떻게 바꾸는지 살펴본 분석입니다.
| 분석 조건 | 최저 비용 후보 | 지수 | 작업 비용 | 첫 응답 |
|---|---|---|---|---|
| 기본 조건지수 50 이상 · 첫 응답 제한 없음 | Muse Spark 1.3 (xhigh) | 52 | $0.84 | 41.29 초 |
| 대기시간을 30초로 제한지수 50 이상 · 첫 응답 30초 이하 | GPT-6 Astra (medium) | 52 | $1.16 | 6.96 초 |
| 지수 조건을 2점 높이면지수 52 이상 · 첫 응답 제한 없음 | Muse Spark 1.3 (xhigh) | 52 | $0.84 | 41.29 초 |
기본 조건에서는 Muse Spark 1.3 (xhigh)이 가장 저렴하지만, 첫 응답을 30초로 제한하면 GPT-6 Astra (medium)으로 바뀝니다. 첫 응답까지 기다리는 시간이 중요한 대화형 제품에서는 비용 순서만으로 모델을 고르기 어렵다는 뜻입니다.
반면 최소 지수를 50에서 52로 높여도 최저 비용 후보는 유지됩니다. 처음 고른 후보가 높아진 지수 조건도 이미 충족하기 때문입니다. 조건을 조금 바꾼다고 항상 다른 모델이 필요한 것은 아닙니다.
이 분석에서 ‘저렴하다’는 말은 수록된 평가 작업 비용에 한정합니다. 한국어 상담의 정확도, 오류를 고치는 사람의 시간, 재시도 횟수까지 포함한 운영 비용은 실제 업무 샘플로 별도 확인해야 합니다.
같은 결과를 다시 계산하는 방법
코딩하는 상인은 외부 평가 수치를 그대로 합쳐 새 종합 점수를 만들지 않습니다. 이 페이지의 추가 분석은 사용자가 정한 조건으로 후보를 거르고, 같은 표의 지수·비용 관계를 계산하는 것입니다. 원본: Artificial Analysis 모델 순위 · Intelligence Index 평가 방법.
- 한 출처·한 저장본을 사용합니다. 2026. 09. 07. 저장한 100개 행이 범위입니다. 같은 모델도 max·high 등 실행 설정이 다르면 별도 항목으로 유지합니다. 다른 벤치마크나 다른 날짜의 점수·비용을 섞지 않습니다.
- 분석 대상을 먼저 정합니다. 기본값은 폴백 포함 표기, ‘일반 제공 전’ 배지 또는 Preview·Alpha·Beta 명칭이 있는 행을 제외합니다. 이용 가능 여부를 모델군 전체로 추정하지 않습니다. 지수와 비용에 유효한 수치가 없는 행도 제외하며, 0달러는 누락값과 구분해 유효한 값으로 처리합니다.
- 최소 지수와 대기시간으로 거릅니다. 시작 하한은 기본 제외 조건의 최고 지수 − 5에서 소수점을 내리고, 0보다 작으면 0으로 정합니다. 이후 포함 조건을 바꿔도 입력한 하한은 유지합니다. 지수 ≥ 입력한 하한, 첫 응답 ≤ 입력한 초 조건을 적용하며 경계값은 포함합니다. 첫 응답 상한을 지정하면 응답 수치가 없는 행도 제외하고, 비워 두면 이 조건은 적용하지 않습니다.
- 지수·비용상 우위 대안을 찾습니다. A의 지수 ≥ B의 지수이고 A의 비용 ≤ B의 비용이며 둘 중 하나가 엄격히 더 좋으면 A는 B의 우위 대안입니다. 이런 대안이 없는 행을 ‘지수·비용 후보’로 표시합니다. 두 수치가 모두 같은 항목은 함께 남깁니다. 첫 응답 시간은 이 우위 판정의 세 번째 축이 아닙니다.
- 비용과 지수의 차이는 따로 계산합니다. 지수 차이 = 분석 대상 최고 지수 − 선택 항목 지수. 비용 변화율 = (선택 항목 비용 − 최고 지수 항목 비용) ÷ 최고 지수 항목 비용 × 100. 최고 지수 동점은 비용이 낮은 항목을 기준으로 하며, 비용도 같으면 원본 순서로 정합니다. 기준 비용이 0이면 변화율을 표시하지 않습니다.
비교 기준인 ‘최고 지수 항목’은 폴백·사전 공개 설정과 유효한 지수·비용 조건을 적용한 집합에서 고릅니다. 사용자가 입력한 첫 응답 상한을 만족하지 않을 수도 있으므로, 추천 후보와 대조하는 기준점으로만 읽어 주세요.
표는 비용 오름차순이며 비용이 같으면 지수 내림차순, 이어 원본 순서로 정렬합니다. 계산에는 저장된 숫자를 사용하고 원본 표시와 별표(*)를 보존합니다. 반올림된 공개 수치의 미세한 차이는 통계적으로 유의미한 차이를 입증하지 않습니다. 화면의 CSV로 원문 수치·조건·각 행의 제외 이유를 함께 내려받을 수 있습니다.
실제 결제 전에 구분할 세 가지
작업 비용과 API 토큰 단가는 다릅니다
여기 표시한 달러는 Artificial Analysis의 평가 작업당 비용입니다. API의 입력·출력 100만 토큰 단가나 ChatGPT·Claude 구독료가 아닙니다. 평가사의 토큰 사용량·캐시 조건 등이 반영된 수치이므로 내 요청 한 번의 청구액으로 대입하면 안 됩니다. 실제 사용량별 예산은 API 비용 계산기에서 별도로 계산하세요.
지수 5점 차이가 성능 5% 차이는 아닙니다
Intelligence Index는 여러 평가를 묶은 지수입니다. 영어 중심 평가로 한국어 업무 전체를 대표하지 않으며, 지수를 비용으로 나눈 값을 보편적인 ‘가성비 점수’로 해석하기도 어렵습니다. 이 페이지는 지수의 절대 차이와 비용의 변화율만 구분해 보여 줍니다.
후보를 고른 다음에는 내 작업으로 확인해야 합니다
한국어 상담이라면 같은 질문과 판정 기준으로 오류·답변 시간·재시도를 기록하고, 코딩이라면 같은 저장소·테스트·도구 조건을 맞추는 편이 좋습니다. 이 페이지에 그런 자체 실험을 했다는 뜻은 아닙니다. 공개 평가를 분석한 결과와 직접 실행한 실험은 구분해 공개합니다.