GPT-5.6 Sol·Terra·Luna 비교: 가격과 선택 기준

GPT-5.6 출시일과 Sol·Terra·Luna의 차이, 2026년 8월 API 가격, 장문맥 할증과 추론 설정을 공식 문서 기준으로 정리했다.

읽는 시간 약 8

AI는 자료 조사와 초안 정리에 보조적으로 사용했으며, 편집부가 출처와 사실을 확인했습니다.

GPT-5.6 Sol·Terra·Luna의 성능과 비용 계층을 세 개의 연산 구체로 표현한 편집 이미지

2026년 8월 24일 기준 GPT-5.6 API는 Sol·Terra·Luna 세 계층으로 나뉜다. 세 모델은 7월 9일 출시됐고 Terra·Luna는 7월 30일, Sol은 8월 21일 가격이 다시 바뀌었다. 출시 당일 가격표가 아니라 현재 단가와 27만2천 토큰 장문맥 경계를 함께 봐야 한다.

공식 가격과 모델 포지셔닝만 놓고 보면 새 워크로드의 첫 비교 기준은 Terra가 무난하다. 같은 평가 세트에서 Luna가 품질을 유지하면 비용을 낮춘다. Terra가 실패한 고가치 사례에만 Sol을 추가해 본다. 또 gpt-5.6 별칭은 현재 Sol로 연결되므로 예상 비용을 통제하려면 모델 ID를 명시해야 한다.

가격과 사양은 OpenAI 공개 문서 기준이다. 세 모델을 같은 업무 데이터로 독립 벤치마크하지는 않았다. 모델별 성능 설명과 운영 추천은 공급사 포지셔닝을 바탕으로 한 편집 판단이다.

GPT-5.6 출시일보다 가격 변경일을 함께 봐야 한다

OpenAI API 변경 기록에 따르면 GPT-5.6 제품군의 API 출시일은 2026년 7월 9일이다. 제품군은 다음 세 모델로 나뉜다.

  • Sol: 복잡하고 개방적인 고가치 작업을 겨냥한 최상위 계층
  • Terra: 성능과 비용의 균형을 겨냥한 범용 계층
  • Luna: 명확하고 반복적인 대량 작업을 겨냥한 저비용 계층

출시일만 기록해 두면 현재 비용을 놓치기 쉽다. Terra와 Luna는 7월 30일, Sol은 8월 21일에 가격이 바뀌었다. Sol의 현행 가격은 최소 2026년 11월 21일까지 유지된다고 안내돼 있다. 이 날짜를 가격 종료일로 단정할 수는 없다.

세 모델은 모두 105만 토큰 컨텍스트 창, 최대 92만2천 토큰 입력, 최대 12만8천 토큰 출력을 지원한다. 지식 컷오프는 2026년 2월 16일이며 텍스트와 이미지를 입력받아 텍스트를 출력한다. Responses API, Chat Completions API, Batch API에서 쓸 수 있지만 API Free 티어는 지원하지 않는다. 자세한 값은 Sol, Terra, Luna 모델 문서에 각각 명시돼 있다.

현재 API 가격은 캐시 쓰기까지 따로 계산한다

아래 표는 글로벌 Standard 처리, 입력 27만2천 토큰 이하 요청의 100만 토큰당 달러 가격이다. ChatGPT 구독료나 Codex 워크스페이스 크레딧과는 다른 API 요금이다.

모델일반 입력캐시된 입력캐시 쓰기출력
GPT-5.6 Sol$4.00$0.40$5.00$20.00
GPT-5.6 Terra$2.00$0.20$2.50$12.00
GPT-5.6 Luna$0.20$0.02$0.25$1.20

세 모델 모두 출력 단가가 일반 입력 단가보다 높다. Sol은 5배, Terra와 Luna는 6배이므로 긴 답변이나 코드 생성이 많은 서비스는 요청 수보다 입력·캐시·출력 토큰을 나눠 기록해야 한다. 대략적인 계산식은 다음과 같다.

(일반 입력 토큰×입력 단가 + 캐시 입력 토큰×캐시 입력 단가 + 캐시 쓰기 토큰×캐시 쓰기 단가 + 출력 토큰×출력 단가) ÷ 1,000,000

도구 호출 비용과 재시도, 지역 처리 할증은 이 식 밖에서 더해질 수 있다. OpenAI API 가격 문서는 대상 지역 처리 엔드포인트에 10%가 추가될 수 있다고 안내한다.

예산을 잡을 때는 모델 가격과 제품 크레딧도 나눠야 한다. Codex 제품에서 쓰는 크레딧과 API 달러 비용이 어떻게 다른지는 저장소 단위 AI 코딩 도구 테스트에서 별도로 확인했다. 조직 단위 사용량과 초과 비용 경계는 ChatGPT Enterprise 사용량·크레딧 관리 가이드에 정리해 두었다.

27만2천 토큰을 넘으면 초과분만 비싸지는 게 아니다

105만 토큰 컨텍스트는 매력적이지만 가격 경계는 그보다 훨씬 앞에 있다. 입력이 27만2천 토큰을 넘으면 요청 전체의 입력 단가는 2배, 출력 단가는 1.5배가 된다. 경계를 넘긴 토큰에만 할증되는 구조가 아니다.

모델장문맥 입력장문맥 캐시 입력장문맥 캐시 쓰기장문맥 출력
GPT-5.6 Sol$8.00$0.80$10.00$30.00
GPT-5.6 Terra$4.00$0.40$5.00$18.00
GPT-5.6 Luna$0.40$0.04$0.50$1.80

입력이 27만2천 토큰을 넘는 순간 요청 전체에 장문맥 단가가 적용된다. 저장소 전체나 여러 PDF를 매번 넣기 전에 검색·요약으로 입력을 줄인 경우와 그대로 넣은 경우를 같은 평가 세트로 비교해야 한다. 큰 컨텍스트가 정확도를 올리는지, 아니면 관련 없는 정보와 비용만 늘리는지는 실제 실패 사례로 판단한다.

GPT-5.6 비교의 첫 기준선은 Terra로 잡는다

OpenAI는 최신 모델 선택 가이드에서 Sol을 가장 복잡한 작업, Terra를 성능과 비용의 균형, Luna를 명확한 대량 작업에 배치한다. 이 설명을 실제 운영 선택으로 옮기면 다음과 같다.

Luna부터 시험할 일은 분류, 필드 추출, 형식 변환, 짧은 요약처럼 정답 형식이 분명하고 사람이 재검수할 수 있는 작업이다. 건당 차이가 작아 보여도 하루 수십만 건이면 비용 격차가 커진다. 다만 예외 입력에서 판단이 흔들리는지 별도 표본으로 확인해야 한다.

Terra를 기본값으로 둘 일은 고객지원 초안, 일반적인 코드 수정, 문서 분석, 여러 단계의 구조화된 업무처럼 품질과 단가를 함께 봐야 하는 작업이다. 어느 계층이 맞는지 아직 모르는 신규 기능이라면 내가 먼저 잡을 기준선도 Terra다. 이후 동일한 평가 세트로 Luna가 품질을 유지하는지, Sol이 실패율을 충분히 낮추는지 비교한다.

Sol에 비용을 쓸 일은 어려운 디버깅, 긴 흐름의 에이전트 작업, 여러 출처를 엮는 조사, 한 번의 오판이 후속 작업 전체를 망치는 경우다. ‘가장 강하다’는 설명만으로 전 요청을 Sol에 보내지는 않는다. 재작업 비용이나 사람 검수 시간을 줄인 금액이 모델 가격 차이보다 클 때 선택할 이유가 생긴다.

공식 발표에는 성능 개선에 대한 OpenAI의 평가가 담겨 있다. 이를 독립 검증 결과로 읽으면 안 된다. 특히 서로 다른 에이전트 설정과 프롬프트로 나온 점수를 서비스 품질의 보증처럼 옮기는 건 위험하다. 공개 벤치마크 한 줄보다 우리 작업의 최초 승인률과 재작업 시간을 보는 편이 낫다.

2026년 8월 24일 현재 gpt-5.6 별칭은 Sol을 가리킨다

API ID는 gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna다. 여기서 놓치기 쉬운 점이 하나 있다. 모델명을 gpt-5.6으로만 지정하면 현재 Sol로 라우팅된다. 저비용 계층을 기대하고 일반 별칭을 쓰면 처음부터 가장 비싼 모델을 호출한다.

비용을 통제하려면 모델 ID를 명시한다. 요청 로그에는 ID와 가격 확인일을 함께 남기는 편이 안전하다. 현재 문서에 표시된 스냅샷도 날짜가 붙은 고정 버전이 아니라 같은 비날짜형 ID다. 가격과 동작이 영구히 고정된다고 가정해서는 안 된다.

API의 reasoning.effortnone, low, medium, high, xhigh, max 여섯 단계이며 기본값은 medium이다. OpenAI 추론 모드 문서의 Pro는 별도 모델명이 아니라 Responses API 실행 모드다. Codex의 Ultra 역시 추론 강도 이름이 아니라 여러 하위 에이전트를 병렬로 쓰는 방식이다. 모델 계층, 추론 강도, 실행 모드를 한 축으로 섞지 말아야 한다.

Codex의 공식 기능표는 GPT-5.6을 Plus 이상 플랜과 API Key 사용 범위에 표시한다. ChatGPT 데스크톱 앱이 Free 플랜에도 있다는 사실이 Free에서 GPT-5.6 제품군 전체를 선택할 권리까지 보장하지는 않는다. 플랜을 비교할 때는 ChatGPT·Claude·Gemini 개인용 플랜 비교처럼 앱 제공 여부와 모델 사용 한도를 따로 확인해야 한다.

모델 이름보다 우리 업무 30건으로 결정한다

1차 평가는 최근 실패 사례와 정상 사례를 섞은 20~50건으로 시작한다. 이 숫자는 일반 기준이 아니라 팀이 직접 검토하기 쉬운 작은 표본을 만들기 위한 출발점이다.

  1. Terra와 기본 추론 강도 medium을 기준선으로 실행한다.
  2. 같은 입력을 Luna에 보내 최초 승인률이 유지되는지 본다.
  3. Terra가 실패한 고가치 사례만 Sol에서 다시 확인한다.
  4. 입력·캐시·출력 토큰, 지연 시간, 도구 호출, 재시도, 사람의 수정 시간을 함께 기록한다.
  5. 정확도만이 아니라 ‘승인된 결과 한 건당 총비용’을 비교한다.

추론 강도도 무조건 올리지 않는다. 현재 품질을 기록한 뒤 한 단계 낮춰 최초 승인률과 재작업 시간이 유지되는지 확인한다. 검수 시간이 늘어난다면 Sol이나 더 높은 추론 강도가 오히려 총비용을 낮출 수도 있다.

이 글의 권장 출발점은 Terra를 기준선으로 두는 방식이다. 반복 업무는 Luna, 실패 비용이 큰 일부는 Sol로 비교한다. 최종 선택은 105만 토큰 최대치가 아니라 27만2천 토큰 가격 경계, 최초 승인률, 재작업 시간을 함께 보고 정한다.

2026년 8월 24일 수정: 출시 직후의 추정과 비교 문구를 걷어냈다. 가격 변경 이력과 Sol·Terra·Luna의 현재 API 요금, 장문맥 할증, 모델 선택 절차를 공식 문서 기준으로 전면 수정했다.

참고한 출처

공식 발표·문서·changelog 기반으로 작성했습니다. 전체 8개 중 공식 출처는 8개입니다.

함께 보면 좋은 글