claude-opus-4-7-high와 claude-fable-5의 대표 점수 차이입니다. 같은 출처의 원점수를 뺀 값이며 정확도 차이가 아닙니다.
Arena Vision · 코딩하는 상인 해설
이미지 이해 AI 순위·비교: 비전 모델과 OCR·차트 선택 기준
이미지 이해 AI는 사진·문서·차트를 보고 답하는 모델입니다. 그림을 만드는 이미지 생성 AI와는 다른 용도입니다. Arena Vision의 사용자 선호 순위로 후보를 살펴보고, 내가 읽힐 이미지의 문자·숫자·관계를 정확히 옮기는지 확인합니다.
코딩하는 상인 분석
상위권 점수, 얼마나 구분해서 볼 수 있을까?
상위 10행에서 1위를 제외하고 ± 값이 있는 행만 비교했습니다. 구간 겹침을 통계적 동률이나 유의성 판정으로 쓰지 않습니다.
10개 공개 값의 최솟값과 최댓값입니다. 관측 수가 다른 결과이므로 점수와 신뢰구간을 함께 읽어야 합니다.
Arena Vision
전체 100개 평가 항목
점수의 ±는 원본의 신뢰구간 표시입니다. API 가격은 입력 / 출력 100만 토큰당 USD이며, 확인 시점은 표의 기록 기준일입니다. 넓은 표는 가로로 밀어볼 수 있습니다.
| 순위 | 모델·실행 설정 | Vision Arena 점수 | 투표 수 | API 가격 | 컨텍스트 |
|---|---|---|---|---|---|
| 1 | claude-fable-5Anthropic | 1313 ±8 | 10,002 | $10 / $50 | 1M |
| 2 | claude-opus-4-7-highAnthropic | 1301 ±7 | 21,137 | $5 / $25 | 1M |
| 3 | qwen3.8-maxAlibaba | 1300 ±8 | 7,244 | $2 / $6 | 1M |
| 4 | claude-opus-4-7Anthropic | 1299 ±7 | 21,457 | $5 / $25 | 1M |
| 5 | claude-opus-4-6-highAnthropic | 1299 ±7 | 20,883 | $5 / $25 | 1M |
| 6 | muse-sparkMeta | 1294 ±9 | 5,585 | N/A | N/A |
| 7 | claude-opus-4-6Anthropic | 1293 ±7 | 25,210 | $5 / $25 | 1M |
| 8 | 1292 ±15 | 1,844 | $1.25 / $4.25 | N/A | |
| 9 | claude-opus-5-highAnthropic | 1290 ±8 | 8,271 | $5 / $25 | 1M |
| 10 | gemini-3-proGoogle | 1289 ±8 | 13,019 | $2 / $12 | 1M |
| 11 | gpt-5.5OpenAI | 1286 ±7 | 21,389 | $5 / $30 | 1.1M |
| 12 | claude-opus-4-8-highAnthropic | 1285 ±7 | 13,521 | $5 / $25 | 1M |
| 13 | gemini-3.6-flash-highGoogle | 1285 ±11 | 3,816 | $0.75 / $3.75 | 1M |
| 14 | gemini-3.5-flash-highGoogle | 1284 ±8 | 8,259 | $0.75 / $4.50 | 1M |
| 15 | gpt-5.5-highOpenAI | 1284 ±7 | 20,121 | $5 / $30 | 1.1M |
| 16 | gemini-3.5-flash-mediumGoogle | 1283 ±8 | 8,261 | $0.75 / $4.50 | 1M |
| 17 | gpt-5.6-sol-xhighOpenAI | 1282 ±9 | 5,837 | $4 / $20 | N/A |
| 18 | grok-4.5SpaceXAI | 1282 ±9 | 6,401 | $2 / $6 | 500K |
| 19 | gpt-5.4-highOpenAI | 1281 ±7 | 23,263 | $1.25 / $7.50 | 1.1M |
| 20 | gpt-5.4OpenAI | 1281 ±7 | 21,245 | $1.25 / $7.50 | 1.1M |
| 21 | claude-opus-4-8Anthropic | 1279 ±7 | 13,980 | $5 / $25 | 1M |
| 22 | muse-spark-1.1Meta | 1279 ±9 | 6,769 | $1.25 / $4.25 | 1M |
| 23 | 1279 ±7 | 15,446 | $1.75 / $14 | 128K | |
| 24 | gemini-3.1-pro-previewGoogle | 1278 ±6 | 39,412 | $1 / $6 | 1M |
| 25 | gpt-5.5-instantOpenAI | 1278 ±9 | 7,225 | $5 / $30 | 1.1M |
| 26 | claude-sonnet-4-6Anthropic | 1275 ±6 | 25,610 | $1.50 / $7.50 | 1M |
| 27 | glm-5.3-flashZ.ai | 1273 ±17 | 1,389 | $0.15 / $0.50 | 1M |
| 28 | gemini-3-flashGoogle | 1272 ±5 | 36,747 | $0.50 / $3 | 1M |
| 29 | claude-sonnet-5-highAnthropic | 1267 ±8 | 8,522 | $2 / $10 | 1M |
| 30 | gemini-3.5-flash-liteGoogle | 1266 ±11 | 3,886 | $0.15 / $1.25 | 1M |
| 31 | qwen3.7-plusAlibaba | 1266 ±8 | 9,132 | $0.32 / $1.28 | 1M |
| 32 | gpt-5.6-terra-xhighOpenAI | 1266 ±9 | 5,774 | $2 / $12 | N/A |
| 33 | kimi-k2.6Moonshot | 1263 ±7 | 15,378 | $0.95 / $4 | 262.1K |
| 34 | gemma-4-31bGoogle | 1261 ±6 | 34,348 | $0.99 / $1.49 | 131.1K |
| 35 | 1260 ±6 | 34,908 | $0.50 / $3 | 1M | |
| 36 | dola-seed-2.0-proBytedance | 1257 ±8 | 10,297 | N/A | N/A |
| 37 | grok-4.20-beta-0309-reasoningSpaceXAI | 1256 ±6 | 25,150 | $1.25 / $2.50 | 1M |
| 38 | gpt-5.6-luna-xhighOpenAI | 1254 ±9 | 5,857 | $0.20 / $1.20 | N/A |
| 39 | gpt-5.4-mini-highOpenAI | 1252 ±7 | 24,076 | $0.75 / $4.50 | 400K |
| 40 | qwen3.8-27bAlibaba | 1251 ±12 | 2,954 | $0.40 / $3 | 262.1K |
| 41 | grok-4.20-multi-agent-beta-0309SpaceXAI | 1251 ±6 | 22,988 | $1.25 / $2.50 | 1M |
| 42 | gpt-5.1-highOpenAI | 1250 ±8 | 9,353 | $0.63 / $5 | 400K |
| 43 | kimi-k2.5-thinkingMoonshot | 1250 ±6 | 26,728 | $0.60 / $3 | N/A |
| 44 | qwen3.5-397b-a17bAlibaba | 1247 ±6 | 25,997 | $0.39 / $2.34 | 262.1K |
| 45 | gemini-2.5-proGoogle | 1246 ±5 | 87,719 | $1.25 / $10 | 1M |
| 46 | gpt-5.2-highOpenAI | 1244 ±6 | 17,959 | $0.88 / $7 | 400K |
| 47 | gemma-4-26b-a4bGoogle | 1242 ±7 | 22,710 | N/A | N/A |
| 48 | grok-4.3SpaceXAI | 1241 ±7 | 20,787 | $1.25 / $2.50 | 1M |
| 49 | gpt-5.1OpenAI | 1240 ±8 | 10,223 | $0.63 / $5 | 400K |
| 50 | 1240 ±6 | 23,098 | $5 / $15 | 128K | |
| 51 | minimax-m3MiniMax | 1237 ±8 | 13,390 | $0.30 / $1.20 | 524.3K |
| 52 | kimi-k2.5-instantMoonshot | 1237 ±11 | 3,878 | $0.45 / $2.25 | 262.1K |
| 53 | 1235 ±6 | 25,988 | $0.25 / $1.50 | 1M | |
| 54 | mimo-v2.5Xiaomi | 1235 ±7 | 23,076 | $0.14 / $0.28 | 1.1M |
| 55 | gpt-5.2OpenAI | 1230 ±6 | 19,024 | $0.88 / $7 | 400K |
| 56 | glm-5v-turboZ.ai | 1229 ±6 | 34,352 | $1.20 / $4 | 202.8K |
| 57 | 1229 ±10 | 4,736 | $0.30 / $2.50 | 1M | |
| 58 | qwen3.5-122b-a10bAlibaba | 1227 ±7 | 12,493 | $0.29 / $2.40 | 262.1K |
| 59 | 1226 ±12 | 2,925 | $75 / $150 | 128K | |
| 60 | gpt-5-chatOpenAI | 1225 ±7 | 39,886 | $1.25 / $10 | N/A |
| 61 | qwen3.5-27bAlibaba | 1219 ±6 | 23,705 | $0.20 / $1.56 | 262.1K |
| 62 | 1219 ±11 | 3,233 | N/A | N/A | |
| 63 | mimo-v2-omniXiaomi | 1217 ±8 | 10,131 | $0.40 / $2 | 262.1K |
| 64 | o3-2025-04-16OpenAI | 1216 ±7 | 45,594 | $2 / $8 | 200K |
| 65 | qwen3-vl-235b-a22b-instructAlibaba | 1215 ±7 | 12,277 | $0.21 / $1.90 | 262.1K |
| 66 | gemini-2.5-flashGoogle | 1214 ±5 | 58,968 | $0.30 / $2.50 | 1M |
| 67 | gpt-4.1-2025-04-14OpenAI | 1214 ±7 | 41,034 | $2 / $8 | 1M |
| 68 | gpt-5-highOpenAI | 1210 ±7 | 34,389 | $0.63 / $5 | 400K |
| 69 | claude-opus-4-20250514-thinking-16kAnthropic | 1207 ±16 | 1,291 | $15 / $75 | 200K |
| 70 | Inkling SmallThinking Machines | 1207 ±11 | 3,524 | $0.50 / $1.20 | 524.3K |
| 71 | 1207 ±17 | 1,147 | $3 / $15 | 1M | |
| 72 | mistral-large-3Mistral | 1205 ±10 | 4,751 | $0.50 / $1.50 | N/A |
| 73 | gpt-5.4-nano-highOpenAI | 1201 ±7 | 23,952 | $0.20 / $1.25 | 400K |
| 74 | gpt-4.1-mini-2025-04-14OpenAI | 1201 ±8 | 40,292 | $0.40 / $1.60 | 1M |
| 75 | o4-mini-2025-04-16OpenAI | 1200 ±7 | 41,375 | $1.10 / $4.40 | 200K |
| 76 | mistral-medium-3.5Mistral | 1199 ±10 | 5,091 | $0.75 / $3.75 | 32.8K |
| 77 | grok-4-1-fast-reasoningSpaceXAI | 1195 ±7 | 12,505 | $1.25 / $2.50 | 2M |
| 78 | o1-2024-12-17OpenAI | 1193 ±11 | 3,694 | $15 / $60 | 200K |
| 79 | 1193 ±16 | 1,440 | $3 / $15 | 200K | |
| 80 | claude-opus-4-20250514Anthropic | 1189 ±13 | 2,178 | $15 / $75 | 200K |
| 81 | claude-sonnet-4-20250514Anthropic | 1188 ±14 | 1,810 | $3 / $15 | 1M |
| 82 | 1188 ±8 | 35,977 | $0.10 / $0.40 | 1M | |
| 83 | qwen3-vl-235b-a22b-thinkingAlibaba | 1188 ±12 | 2,394 | $0.40 / $4 | 131.1K |
| 84 | qwen-vl-max-2025-08-13Alibaba | 1185 ±12 | 3,181 | $0.52 / $2.08 | 131.1K |
| 85 | grok-4-0709SpaceXAI | 1184 ±7 | 30,195 | $1.25 / $2.50 | 256K |
| 86 | gpt-5-mini-highOpenAI | 1182 ±8 | 28,982 | $0.13 / $1 | 400K |
| 87 | gemini-1.5-pro-002Google | 1179 ±9 | 8,902 | $3.50 / $10.50 | 2.1M |
| 88 | claude-3-7-sonnet-20250219Anthropic | 1175 ±9 | 4,523 | $3 / $15 | 200K |
| 89 | 1173 ±10 | 4,790 | $0.10 / $0.40 | 1M | |
| 90 | gemini-2.0-flash-001Google | 1172 ±7 | 10,124 | $0.10 / $0.40 | 1M |
| 91 | gpt-4o-2024-05-13OpenAI | 1162 ±9 | 23,273 | $5 / $15 | 128K |
| 92 | claude-3-5-sonnet-20241022Anthropic | 1161 ±8 | 10,380 | $3 / $15 | 200K |
| 93 | glm-4.6vZ.ai | 1161 ±14 | 2,356 | $0.30 / $0.90 | 131.1K |
| 94 | mistral-medium-2508Mistral | 1159 ±6 | 41,301 | $0.40 / $2 | 131.1K |
| 95 | gemma-3-27b-itGoogle | 1159 ±8 | 17,003 | $0.08 / $0.45 | 131.1K |
| 96 | hunyuan-vision-1.5-thinkingTencent | 1156 ±12 | 2,433 | N/A | N/A |
| 97 | step-1o-turbo-202506Stepfun | 1156 ±14 | 1,900 | N/A | N/A |
| 98 | mistral-medium-2505Mistral | 1155 ±8 | 10,835 | $0.40 / $2 | 131.1K |
| 99 | glm-4.5vZ.ai | 1154 ±12 | 3,255 | $0.60 / $1.80 | 65.5K |
| 100 | hunyuan-large-visionTencent | 1149 ±17 | 1,277 | N/A | N/A |
OCR, 차트, 공간 추론 등 세부 능력을 하나의 선호 점수로 압축합니다. 용도별 테스트가 추가로 필요합니다. 빈 값은 0점이 아니며, 수록 행 수는 고유 모델 수와 다릅니다.
순위를 실제 선택에 쓰려면
비전 모델은 입력 이미지에 맞춰 고릅니다
설명 품질과 문자 인식은 별개
사진 설명이 자연스러워도 작은 글자나 표의 숫자를 틀릴 수 있습니다. Arena Vision의 전체 선호 점수를 OCR 정확도나 한국어 문서 정확도로 표현하지 않습니다. 내 문서와 비슷한 해상도·레이아웃의 샘플이 필요합니다.
차트는 수치와 단위를 따로 확인
추세를 잘 설명하는 것과 눈금·범례를 정확히 읽는 것은 다른 문제입니다. 축의 시작점, 단위, 표에 없는 값을 추측하는지 확인하세요. 정답이 없는 설명보다 원본과 대조할 수 있는 질문이 비교에 유리합니다.
텍스트 단가로 이미지 비용을 확정하지 않기
표의 API 가격은 출처가 공개한 입력·출력 토큰 단가입니다. 이미지 해상도, 이미지 토큰 계산, 요청 옵션과 도구 비용은 별도로 확인해야 합니다. 같은 사진 한 장의 비용으로 바로 환산하지 않습니다.
직접 비교할 때 쓸 과제
이미지 이해 도입 전 확인 과제
아래는 코딩하는 상인이 제안하는 비교 절차입니다. 아직 이 과제로 모델을 실행·채점한 결과는 아니며, 위 순위에도 반영하지 않았습니다. 모델 ID·실행일·설정·원본 입력·전체 출력을 함께 남겨야 다음 업데이트 때 같은 조건으로 다시 비교할 수 있습니다.
01한국어 표에서 정확히 옮기기
- 같이 줄 과제
- 개인정보를 지운 실제 양식이나 직접 만든 표 이미지를 주고, 항목명·수량·금액을 정해둔 열의 CSV로 옮기게 합니다.
- 통과 기준
- 각 셀의 값과 행·열 대응이 원본과 일치해야 합니다. 비어 있거나 읽기 어려운 칸을 임의로 채우면 실패로 남깁니다.
- 남길 기록
- 전체 셀 수, 틀린 셀 수, 빈칸 추정 수를 기록합니다.
02차트 수치와 관계 읽기
- 같이 줄 과제
- 축과 범례가 있는 차트에서 최고값의 항목, 두 지점의 차이, 단위를 묻습니다. 답에는 읽은 원래 숫자도 쓰게 합니다.
- 통과 기준
- 항목과 단위가 맞고, 계산에 쓴 값이 차트에서 확인되어야 합니다. 정확한 눈금이 없으면 근삿값임을 밝혀야 합니다.
- 남길 기록
- 원본 수치 오류, 단위 오류, 계산 오류를 각각 기록합니다.
03모르는 부분을 인정하는지
- 같이 줄 과제
- 작은 글자나 일부가 가려진 대상을 포함한 이미지에서, 확실히 보이는 것과 확인할 수 없는 것을 나눠 설명하게 합니다.
- 통과 기준
- 보이지 않는 이름·수치·사물을 단정하지 않고, 추가 이미지가 필요한 부분을 구체적으로 밝혀야 합니다.
- 남길 기록
- 확인 불가능한 단정 수와 추가 촬영·확대 요청의 적절성을 기록합니다.
선택 순서사진 설명, OCR, 차트 중 주로 쓸 작업을 먼저 정하세요. 같은 파일과 같은 해상도로 후보를 비교하고 원본 정답을 별도로 보관합니다. 입력을 축소하거나 잘라 보낼 계획이라면 그 조건도 다시 시험해야 합니다.
분석 기준과 출처
위 숫자는 2026. 09. 07. 저장한 Arena Vision 스냅샷의 100행에서 계산했습니다. 원본 순위를 오름차순으로 정렬한 첫 10행을 상위권으로 삼고, 모델 버전·실행 설정을 합치지 않았습니다. 100행에 대표 점수가 있고, 100행에 읽을 수 있는 ± 값이 있습니다.
점수 차이는 첫 두 행의 대표 점수 차이의 절댓값입니다. 구간 겹침은 표시 점수에서 ± 값을 뺀 하한과 더한 상한을 대조합니다. 제공사 수는 표의 제공사명을 기준으로 세고, 투표 수는 항목별 최솟값과 최댓값만 사용합니다. 누락 값을 0으로 채우거나 서로 다른 출처의 점수를 합치지 않습니다.
이 계산과 선택 기준은 코딩하는 상인의 해석입니다. 측정은 Arena가 수행했으며, 자체 실험 성적이나 통계적 우월성 검정으로 표현하지 않습니다. 원본 방법론 확인일: 이 날짜는 스냅샷 갱신일과 다릅니다.