모델 분석 · OpenAI

GPT-5.6 Sol성능·벤치마크·API 가격

GPT-5.6 솔의 추론 강도별 지능·비용·속도와 xhigh 대화·코딩·비전 결과를 비교합니다. Codex 하네스와 미확인 API 단가를 구분합니다.

GPT 5.6 솔 · 코딩하는 상인 분석 · 출처별 저장일은 아래 표에 표시

Artificial Analysis 최고 순위 설정

GPT-5.6 Sol (max)2026. 09. 07. 저장 · 전체 15
지능 지수
51
평가 작업 비용
$1.25
첫 응답
255.98 초

코딩하는 상인의 해석

초당 출력이 빨라도 최종 답을 오래 기다릴 수 있을까?

Sol을 고를 때 초당 출력 토큰만 보면 추론 대기시간을 놓칠 수 있습니다. 첫 응답과 전체 응답은 출력 속도와 별개의 지표입니다. high와 max의 점수 차이 옆에 세 시간 지표를 함께 놓아 대화형 서비스에 필요한 지연을 판단하도록 했습니다.

GPT-5.6 Sol (high)GPT-5.6 Sol (max)

지능 지수 차이
+3점
4851
평가 작업 비용 차이
+0.64달러
기준 설정 대비 +104.9%
첫 응답 시간 차이
+239.75초
첫 출력이 시작될 때까지
전체 응답 시간 차이
+239.39초
응답을 마칠 때까지

같은 2026. 09. 07. Artificial Analysis 스냅샷의 오른쪽 설정 값에서 왼쪽 설정 값을 뺀 결과입니다. 지능 지수의 점수 차이는 정확도 개선율이 아닙니다. 비용 비율만 기준 설정의 작업 비용으로 나눠 계산합니다.

이 두 설정을 직접 비교하기 →

Arena Code의 codex-harness 항목을 별도로 표시합니다. 평가표의 가격 표기만으로 공식 API 가격을 채우지 않았으며, 확인된 Sol 단가가 등록되기 전에는 토큰 비용을 계산하지 않습니다.

외부 기관이 측정한 공개 결과에 대한 2차 분석입니다. 코딩하는 상인이 직접 모델을 실행한 실험 결과는 포함하지 않았습니다.

원점수와 실행 조건

GPT-5.6 Sol의 출처별 평가 결과

모델명·체크포인트·제공사를 확인한 항목만 모았습니다. 순위는 각 원본 전체의 순위이며, 출처가 다른 점수나 순위를 평균내지 않습니다. 빈 값과 별표, 신뢰구간은 원본 표기를 유지합니다.

종합·효율

Artificial Analysis

2026. 09. 07. 저장

성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가?

GPT-5.6 Sol, Artificial Analysis, 2026. 09. 07. 저장 결과
순위모델·실행 설정지능 지수평가 작업 비용출력 속도첫 응답전체 응답컨텍스트
15GPT-5.6 Sol (max)추론 설정51$1.2576 t/s255.98 초262.57 초1M
20GPT-5.6 Sol (xhigh)추론 설정50$0.8975 t/s64.00 초70.71 초1M
25GPT-5.6 Sol (high)추론 설정48$0.6172 t/s16.23 초23.18 초1M
34GPT-5.6 Sol (medium)추론 설정46$0.3770 t/s5.85 초12.95 초1M
51GPT-5.6 Sol (low)추론 설정41$0.2371 t/s2.88 초9.93 초1M
74GPT-5.6 Sol (Non-reasoning)33*--67 t/s0.93 초8.35 초1M

영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.

대화 선호

Arena Text

2026. 09. 03. 저장

실제 사용자는 어떤 모델의 답변을 더 선호하는가?

GPT-5.6 Sol, Arena Text, 2026. 09. 03. 저장 결과
순위모델·실행 설정Arena 점수투표 수API 가격컨텍스트
17gpt-5.6-sol-xhigh1483 ±523,413$4 / $20N/A

사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.

표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.

코딩 선호

Arena Code

2026. 09. 07. 저장

코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?

GPT-5.6 Sol, Arena Code, 2026. 09. 07. 저장 결과
순위모델·실행 설정Code Arena 점수투표 수API 가격컨텍스트
13gpt-5.6-sol-xhigh (codex-harness)1617+7 / -711,014$4 / $201.1M

코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.

표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.

이미지 이해

Arena Vision

2026. 09. 07. 저장

이미지와 텍스트를 함께 이해하는 답변에서 무엇이 더 선호되는가?

GPT-5.6 Sol, Arena Vision, 2026. 09. 07. 저장 결과
순위모델·실행 설정Vision Arena 점수투표 수API 가격컨텍스트
17gpt-5.6-sol-xhigh1282 ±95,837$4 / $20N/A

OCR, 차트, 공간 추론 등 세부 능력을 하나의 선호 점수로 압축합니다. 용도별 테스트가 추가로 필요합니다.

표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.

다른 출처에 결과가 없다는 사실은 0점이나 해당 기능 미지원의 근거가 아닙니다. 동일 모델인지 확인되지 않은 항목은 연결하지 않았습니다.

평가 작업 비용과 별개

GPT-5.6 Sol 공식 API 가격

이 평가 항목과 일치하는 공식 API 단가를 아직 등록하지 않았습니다. 평가 작업 비용이나 Arena의 가격 표기를 공식 단가의 대체값으로 사용하지 않습니다.

검증된 단가로 API 예상 비용 계산하기 →

도입 전 판단

내 작업에서는 무엇을 확인해야 할까?

짧은 응답을 자주 보여주는 기능이라면 낮은 추론 설정부터 지연과 오류를 함께 재보세요. 비동기 분석에는 high·max를 같은 과제로 비교할 수 있습니다. Arena Code의 xhigh 결과에는 codex-harness가 붙어 있으므로 일반 챗봇 결과를 예측하는 근거로 쓰지 마세요.

한국어 업무에 적용할 때는 실제로 반복하는 과제를 고정하고 모델 ID, 추론 설정, 입력·출력, 오류, 응답 시간과 청구 토큰을 함께 기록하세요. 이 페이지의 종합 지능 지수는 한국어 업무의 정확도나 수익 개선을 직접 측정한 결과가 아닙니다.