모델명·체크포인트·제공사를 확인한 항목만 모았습니다. 순위는 각 원본 전체의 순위이며, 출처가 다른 점수나 순위를 평균내지 않습니다. 빈 값과 별표, 신뢰구간은 원본 표기를 유지합니다.
성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가?
GPT-5.6 Sol, Artificial Analysis, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | 지능 지수 | 평가 작업 비용 | 출력 속도 | 첫 응답 | 전체 응답 | 컨텍스트 |
|---|
| 15 | GPT-5.6 Sol (max)추론 설정 | 51 | $1.25 | 76 t/s | 255.98 초 | 262.57 초 | 1M |
|---|
| 20 | GPT-5.6 Sol (xhigh)추론 설정 | 50 | $0.89 | 75 t/s | 64.00 초 | 70.71 초 | 1M |
|---|
| 25 | GPT-5.6 Sol (high)추론 설정 | 48 | $0.61 | 72 t/s | 16.23 초 | 23.18 초 | 1M |
|---|
| 34 | GPT-5.6 Sol (medium)추론 설정 | 46 | $0.37 | 70 t/s | 5.85 초 | 12.95 초 | 1M |
|---|
| 51 | GPT-5.6 Sol (low)추론 설정 | 41 | $0.23 | 71 t/s | 2.88 초 | 9.93 초 | 1M |
|---|
| 74 | GPT-5.6 Sol (Non-reasoning) | 33* | -- | 67 t/s | 0.93 초 | 8.35 초 | 1M |
|---|
영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.
실제 사용자는 어떤 모델의 답변을 더 선호하는가?
GPT-5.6 Sol, Arena Text, 2026. 09. 03. 저장 결과| 순위 | 모델·실행 설정 | Arena 점수 | 투표 수 | API 가격 | 컨텍스트 |
|---|
| 17 | gpt-5.6-sol-xhigh | 1483 ±5 | 23,413 | $4 / $20 | N/A |
|---|
사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.
표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.
코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?
GPT-5.6 Sol, Arena Code, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | Code Arena 점수 | 투표 수 | API 가격 | 컨텍스트 |
|---|
| 13 | gpt-5.6-sol-xhigh (codex-harness) | 1617+7 / -7 | 11,014 | $4 / $20 | 1.1M |
|---|
코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.
표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.
이미지와 텍스트를 함께 이해하는 답변에서 무엇이 더 선호되는가?
GPT-5.6 Sol, Arena Vision, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | Vision Arena 점수 | 투표 수 | API 가격 | 컨텍스트 |
|---|
| 17 | gpt-5.6-sol-xhigh | 1282 ±9 | 5,837 | $4 / $20 | N/A |
|---|
OCR, 차트, 공간 추론 등 세부 능력을 하나의 선호 점수로 압축합니다. 용도별 테스트가 추가로 필요합니다.
표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.
다른 출처에 결과가 없다는 사실은 0점이나 해당 기능 미지원의 근거가 아닙니다. 동일 모델인지 확인되지 않은 항목은 연결하지 않았습니다.