Arena Vision · 코딩하는 상인 해설

이미지 이해 AI 순위·비교: 비전 모델과 OCR·차트 선택 기준

이미지 이해 AI는 사진·문서·차트를 보고 답하는 모델입니다. 그림을 만드는 이미지 생성 AI와는 다른 용도입니다. Arena Vision의 사용자 선호 순위로 후보를 살펴보고, 내가 읽힐 이미지의 문자·숫자·관계를 정확히 옮기는지 확인합니다.

기록 기준 100개 평가 항목원본 순위 ↗
공개 순위 1claude-fable-5Anthropic · 모델명에 실행 설정 포함
Vision Arena 점수1313 ±8사용자 선호 점수 · 원문 ± 유지

코딩하는 상인 분석

상위권 점수, 얼마나 구분해서 볼 수 있을까?

계산 기준 ↓
공개 순위 첫 두 행의 점수 차이12점

claude-opus-4-7-highclaude-fable-5의 대표 점수 차이입니다. 같은 출처의 원점수를 뺀 값이며 정확도 차이가 아닙니다.

상위권 중 1위와 표시 구간이 겹치는 행5 / 9개

상위 10행에서 1위를 제외하고 ± 값이 있는 행만 비교했습니다. 구간 겹침을 통계적 동률이나 유의성 판정으로 쓰지 않습니다.

상위 10행의 항목별 투표 수 범위1,844–25,210

10개 공개 값의 최솟값과 최댓값입니다. 관측 수가 다른 결과이므로 점수와 신뢰구간을 함께 읽어야 합니다.

Arena Vision

전체 100개 평가 항목

검색·필터로 좁히기 →

점수의 ±는 원본의 신뢰구간 표시입니다. API 가격은 입력 / 출력 100만 토큰당 USD이며, 확인 시점은 표의 기록 기준일입니다. 넓은 표는 가로로 밀어볼 수 있습니다.

Arena Vision · 2026. 09. 07. 저장 · 실행 설정을 포함한 전체 100
순위모델·실행 설정Vision Arena 점수투표 수API 가격컨텍스트
11313 ±810,002$10 / $501M
21301 ±721,137$5 / $251M
31300 ±87,244$2 / $61M
41299 ±721,457$5 / $251M
51299 ±720,883$5 / $251M
61294 ±95,585N/AN/A
71293 ±725,210$5 / $251M
81292 ±151,844$1.25 / $4.25N/A
91290 ±88,271$5 / $251M
101289 ±813,019$2 / $121M
11
gpt-5.5OpenAI
1286 ±721,389$5 / $301.1M
121285 ±713,521$5 / $251M
131285 ±113,816$0.75 / $3.751M
141284 ±88,259$0.75 / $4.501M
151284 ±720,121$5 / $301.1M
161283 ±88,261$0.75 / $4.501M
171282 ±95,837$4 / $20N/A
18
grok-4.5SpaceXAI
1282 ±96,401$2 / $6500K
191281 ±723,263$1.25 / $7.501.1M
20
gpt-5.4OpenAI
1281 ±721,245$1.25 / $7.501.1M
211279 ±713,980$5 / $251M
221279 ±96,769$1.25 / $4.251M
231279 ±715,446$1.75 / $14128K
241278 ±639,412$1 / $61M
251278 ±97,225$5 / $301.1M
261275 ±625,610$1.50 / $7.501M
271273 ±171,389$0.15 / $0.501M
281272 ±536,747$0.50 / $31M
291267 ±88,522$2 / $101M
301266 ±113,886$0.15 / $1.251M
311266 ±89,132$0.32 / $1.281M
321266 ±95,774$2 / $12N/A
33
kimi-k2.6Moonshot
1263 ±715,378$0.95 / $4262.1K
341261 ±634,348$0.99 / $1.49131.1K
351260 ±634,908$0.50 / $31M
361257 ±810,297N/AN/A
371256 ±625,150$1.25 / $2.501M
381254 ±95,857$0.20 / $1.20N/A
391252 ±724,076$0.75 / $4.50400K
401251 ±122,954$0.40 / $3262.1K
411251 ±622,988$1.25 / $2.501M
421250 ±89,353$0.63 / $5400K
431250 ±626,728$0.60 / $3N/A
441247 ±625,997$0.39 / $2.34262.1K
451246 ±587,719$1.25 / $101M
461244 ±617,959$0.88 / $7400K
471242 ±722,710N/AN/A
48
grok-4.3SpaceXAI
1241 ±720,787$1.25 / $2.501M
49
gpt-5.1OpenAI
1240 ±810,223$0.63 / $5400K
501240 ±623,098$5 / $15128K
51
minimax-m3MiniMax
1237 ±813,390$0.30 / $1.20524.3K
521237 ±113,878$0.45 / $2.25262.1K
531235 ±625,988$0.25 / $1.501M
54
mimo-v2.5Xiaomi
1235 ±723,076$0.14 / $0.281.1M
55
gpt-5.2OpenAI
1230 ±619,024$0.88 / $7400K
561229 ±634,352$1.20 / $4202.8K
571229 ±104,736$0.30 / $2.501M
581227 ±712,493$0.29 / $2.40262.1K
591226 ±122,925$75 / $150128K
601225 ±739,886$1.25 / $10N/A
611219 ±623,705$0.20 / $1.56262.1K
621219 ±113,233N/AN/A
631217 ±810,131$0.40 / $2262.1K
641216 ±745,594$2 / $8200K
651215 ±712,277$0.21 / $1.90262.1K
661214 ±558,968$0.30 / $2.501M
671214 ±741,034$2 / $81M
681210 ±734,389$0.63 / $5400K
691207 ±161,291$15 / $75200K
70
Inkling SmallThinking Machines
1207 ±113,524$0.50 / $1.20524.3K
711207 ±171,147$3 / $151M
721205 ±104,751$0.50 / $1.50N/A
731201 ±723,952$0.20 / $1.25400K
741201 ±840,292$0.40 / $1.601M
751200 ±741,375$1.10 / $4.40200K
761199 ±105,091$0.75 / $3.7532.8K
771195 ±712,505$1.25 / $2.502M
781193 ±113,694$15 / $60200K
791193 ±161,440$3 / $15200K
801189 ±132,178$15 / $75200K
811188 ±141,810$3 / $151M
821188 ±835,977$0.10 / $0.401M
831188 ±122,394$0.40 / $4131.1K
841185 ±123,181$0.52 / $2.08131.1K
85
grok-4-0709SpaceXAI
1184 ±730,195$1.25 / $2.50256K
861182 ±828,982$0.13 / $1400K
871179 ±98,902$3.50 / $10.502.1M
881175 ±94,523$3 / $15200K
891173 ±104,790$0.10 / $0.401M
901172 ±710,124$0.10 / $0.401M
911162 ±923,273$5 / $15128K
921161 ±810,380$3 / $15200K
931161 ±142,356$0.30 / $0.90131.1K
941159 ±641,301$0.40 / $2131.1K
951159 ±817,003$0.08 / $0.45131.1K
961156 ±122,433N/AN/A
971156 ±141,900N/AN/A
981155 ±810,835$0.40 / $2131.1K
991154 ±123,255$0.60 / $1.8065.5K
1001149 ±171,277N/AN/A

OCR, 차트, 공간 추론 등 세부 능력을 하나의 선호 점수로 압축합니다. 용도별 테스트가 추가로 필요합니다. 빈 값은 0점이 아니며, 수록 행 수는 고유 모델 수와 다릅니다.

순위를 실제 선택에 쓰려면

비전 모델은 입력 이미지에 맞춰 고릅니다

01

설명 품질과 문자 인식은 별개

사진 설명이 자연스러워도 작은 글자나 표의 숫자를 틀릴 수 있습니다. Arena Vision의 전체 선호 점수를 OCR 정확도나 한국어 문서 정확도로 표현하지 않습니다. 내 문서와 비슷한 해상도·레이아웃의 샘플이 필요합니다.

02

차트는 수치와 단위를 따로 확인

추세를 잘 설명하는 것과 눈금·범례를 정확히 읽는 것은 다른 문제입니다. 축의 시작점, 단위, 표에 없는 값을 추측하는지 확인하세요. 정답이 없는 설명보다 원본과 대조할 수 있는 질문이 비교에 유리합니다.

03

텍스트 단가로 이미지 비용을 확정하지 않기

표의 API 가격은 출처가 공개한 입력·출력 토큰 단가입니다. 이미지 해상도, 이미지 토큰 계산, 요청 옵션과 도구 비용은 별도로 확인해야 합니다. 같은 사진 한 장의 비용으로 바로 환산하지 않습니다.

직접 비교할 때 쓸 과제

이미지 이해 도입 전 확인 과제

출처와 검증 범위 →

아래는 코딩하는 상인이 제안하는 비교 절차입니다. 아직 이 과제로 모델을 실행·채점한 결과는 아니며, 위 순위에도 반영하지 않았습니다. 모델 ID·실행일·설정·원본 입력·전체 출력을 함께 남겨야 다음 업데이트 때 같은 조건으로 다시 비교할 수 있습니다.

01한국어 표에서 정확히 옮기기

같이 줄 과제
개인정보를 지운 실제 양식이나 직접 만든 표 이미지를 주고, 항목명·수량·금액을 정해둔 열의 CSV로 옮기게 합니다.
통과 기준
각 셀의 값과 행·열 대응이 원본과 일치해야 합니다. 비어 있거나 읽기 어려운 칸을 임의로 채우면 실패로 남깁니다.
남길 기록
전체 셀 수, 틀린 셀 수, 빈칸 추정 수를 기록합니다.

02차트 수치와 관계 읽기

같이 줄 과제
축과 범례가 있는 차트에서 최고값의 항목, 두 지점의 차이, 단위를 묻습니다. 답에는 읽은 원래 숫자도 쓰게 합니다.
통과 기준
항목과 단위가 맞고, 계산에 쓴 값이 차트에서 확인되어야 합니다. 정확한 눈금이 없으면 근삿값임을 밝혀야 합니다.
남길 기록
원본 수치 오류, 단위 오류, 계산 오류를 각각 기록합니다.

03모르는 부분을 인정하는지

같이 줄 과제
작은 글자나 일부가 가려진 대상을 포함한 이미지에서, 확실히 보이는 것과 확인할 수 없는 것을 나눠 설명하게 합니다.
통과 기준
보이지 않는 이름·수치·사물을 단정하지 않고, 추가 이미지가 필요한 부분을 구체적으로 밝혀야 합니다.
남길 기록
확인 불가능한 단정 수와 추가 촬영·확대 요청의 적절성을 기록합니다.

선택 순서사진 설명, OCR, 차트 중 주로 쓸 작업을 먼저 정하세요. 같은 파일과 같은 해상도로 후보를 비교하고 원본 정답을 별도로 보관합니다. 입력을 축소하거나 잘라 보낼 계획이라면 그 조건도 다시 시험해야 합니다.

분석 기준과 출처

위 숫자는 2026. 09. 07. 저장한 Arena Vision 스냅샷의 100행에서 계산했습니다. 원본 순위를 오름차순으로 정렬한 첫 10행을 상위권으로 삼고, 모델 버전·실행 설정을 합치지 않았습니다. 100행에 대표 점수가 있고, 100행에 읽을 수 있는 ± 값이 있습니다.

점수 차이는 첫 두 행의 대표 점수 차이의 절댓값입니다. 구간 겹침은 표시 점수에서 ± 값을 뺀 하한과 더한 상한을 대조합니다. 제공사 수는 표의 제공사명을 기준으로 세고, 투표 수는 항목별 최솟값과 최댓값만 사용합니다. 누락 값을 0으로 채우거나 서로 다른 출처의 점수를 합치지 않습니다.

이 계산과 선택 기준은 코딩하는 상인의 해석입니다. 측정은 Arena가 수행했으며, 자체 실험 성적이나 통계적 우월성 검정으로 표현하지 않습니다. 원본 방법론 확인일: 이 날짜는 스냅샷 갱신일과 다릅니다.