GPT·Claude·Gemini 비교 준비: 한국어 업무 10개 테스트와 미실행 기록
한국어 업무 10개를 같은 조건으로 비교할 프로토콜을 고정하고 실제 수집 범위를 기록했습니다. 세 모델을 모두 실행하지 못한 상태에서는 점수와 승자를 만들지 않았습니다.
AI는 자료 조사와 초안 정리에 보조적으로 사용했으며, 편집부가 출처와 사실을 확인했습니다.
GPT·Claude·Gemini 비교를 세 칸짜리 점수표부터 시작하면 결과를 믿기 어렵다. 2026년 8월 18일 이 글의 테스트 환경에는 세 회사 API 자격 증명이 없었다. 기존 브라우저 세션에서 세 서비스의 로그인 상태는 확인했다. ChatGPT 첫 과제 뒤 자동 수집이 멈춰 나머지 실행도 중단했다.
이번 기록에는 순위나 승자가 없다. 세 회사의 현행 일반 목적 API 모델과 한국어 업무 10개의 고정 문항, 실제로 끝난 자동화 점검 한 건, 다음 실행을 공개할 조건만 남겼다. 일부 결과를 세 모델의 품질 차이처럼 포장하지 않기 위해서다.
GPT·Claude·Gemini 비교에서 실제로 확인한 범위
| 확인 항목 | GPT | Claude | Gemini |
|---|---|---|---|
| API 실행 | 미실행 | 미실행 | 미실행 |
| 기존 웹 로그인 상태 | 확인 | 확인 | 확인 |
| 한국어 과제 실행 | T01 한 건 | 미실행 | 미실행 |
| 3자 공통 채점 포함 | 제외 | 제외 | 제외 |
API 키 이름은 환경에서 찾았지만 세 값이 모두 비어 있었다. 인증하지 않은 모델 목록 요청도 각각 401, 401, 403으로 끝났다. 계정을 새로 만들거나 결제하지 않는 범위에서 웹 세션을 확인했다. ChatGPT에만 T01을 한 번 보냈다.
이 응답은 8.822초 뒤 도착했고 요청한 JSON 형식을 지켰다. 다만 화면에는 정확한 모델 ID가 나오지 않았고 Claude와 Gemini의 짝이 되는 결과도 없다. 자동 수집은 다음 문항부터 180초 안에 완료되지 않았다. T01은 브라우저 조작이 가능한지 살핀 기록일 뿐, GPT 점수나 3자 비교표의 첫 행이 아니다. 프롬프트와 비식별 원문, 중단 시점은 별도 실행 기록에 보존했다.
비교할 API 모델과 현재 가격을 함께 고정했다
모델 이름만 고정하면 가격 변동 때문에 다음 실행과 조건이 달라질 수 있다. 이번 프로토콜은 2026년 8월 18일 제공 중인 일반 목적 모델과 당일 표준 단가를 함께 기록했다.
| 공급자 | 고정 모델 ID | 입력 100만 토큰 | 출력 100만 토큰 | 추론 설정 |
|---|---|---|---|---|
| OpenAI | gpt-5.6-terra | $2 | $12 | medium |
| Anthropic | claude-sonnet-5 | $2 | $10 | medium |
gemini-3.6-flash | $0.75 | $3.75 | medium |
OpenAI 모델 문서는 gpt-5.6-terra의 표준 입력·출력 단가를 공개한다. 최신 모델 사용 안내는 추론 강도에서 medium을 균형 잡힌 시작점으로 설명한다.
Anthropic은 Claude 모델 표와 API 가격표에서 claude-sonnet-5의 모델 ID와 단가를 안내한다.
effort 문서에 따르면 이 모델은 medium 설정을 지원한다.
Google의 Gemini API 가격표는 gemini-3.6-flash 표준 단가에 2026년 12월 31일까지 입력 $0.75, 출력 $3.75를 적용한다. 2027년 1월 1일부터는 $1.50와 $7.50다.
출력 가격에는 생각 토큰이 포함된다. thinking 설정 문서에서 이 모델의 thinking level을 medium으로 맞출 수 있다.
세 모델의 가격대부터 같지 않다. 세 회사가 추론 토큰과 캐시 입력을 계산하는 방식도 다르다. 향후 실행에서는 공급자가 돌려준 토큰 항목을 원래 이름과 단위로 저장한다. 당시 공식 가격으로 계산한 비용은 따로 붙인다. 공개 가격을 작업당 실제 청구액으로 바꿔 적지는 않는다.
웹 채팅 구독을 고르는 문제라면 API 가격 대신 ChatGPT·Claude·Gemini 무료·유료 요금제 비교를 봐야 한다. 앱 구독료와 API 사용료는 별도다.
한국어 업무 10개는 형식 준수와 판단을 함께 본다
한 가지 요약 문항으로 업무용 모델을 고르면 프롬프트 운이 크게 작용한다. 고정 세트는 서로 다른 실패가 드러나도록 만들었다.
| 문항 | 맡긴 일 | 결과에서 보는 것 |
|---|---|---|
| T01 | 회의록의 결정·담당자 추출 | JSON 유효성, 누락과 추측 |
| T02 | 환불 문의 답장 | 220자 제한, 정책의 조건부 적용 |
| T03 | 개인정보 문구 충돌 판정 | 범위의 모호성, 확인할 사실 |
| T04 | 월 API 비용 수식 작성 | 빈 값 처리, 토큰 단위 계산 |
| T05 | 모호한 점검 공지 다듬기 | 추측 대신 확인 질문 제시 |
| T06 | 채널별 증가량 계산 | 절대 증가와 증가율 구분 |
| T07 | 공개되지 않은 매출 답변 | 숫자 날조 방지, 1차 확인 경로 |
| T08 | 영문 장애 공지 번역 | 고유명·시간·상태 보존 |
| T09 | 짧은 JavaScript 수정 | 빈 배열 처리, 테스트 실행 가능성 |
| T10 | 가중치로 도구 선택 | 산식 정확성, 조건부 판단 |
예를 들어 T06은 7월과 8월 전환 수를 주고 절대 증가가 가장 큰 채널과 증가율이 가장 높은 채널을 따로 묻는다. 정답은 검색 30건과 파트너 52.0%다. 문장이 매끄러워도 둘을 같은 채널로 고르면 계산 항목에서 실패한다.
T07은 “A사의 2026년 2분기 API 매출은 공개되지 않았다”는 문장만 제공한다. 매출액과 전년 대비 증가율을 추정하지 않고 공시나 IR 같은 1차 확인 경로를 제시해야 통과한다. 이런 문항을 넣은 까닭은 지식량이 아니라, 자료가 없을 때 멈추는지를 보기 위해서다.
전체 프롬프트와 문항별 정답 조건은 실행 전에 고정했다. 결과를 본 뒤 잘 나온 모델에 맞춰 채점 기준을 바꾸지 않는다.
같은 질문도 실행 조건이 다르면 비교가 아니다
세 API에는 매번 새 요청을 보내고 이전 대화나 메모리를 붙이지 않는다. 시스템 문구와 사용자 프롬프트는 같은 바이트를 사용한다. 웹 검색, 코드 실행, 파일 검색 같은 도구는 모두 끄고 텍스트만 주고받는다.
추론 설정은 각 공급자의 medium, 최대 출력은 1,200토큰으로 고정한다. temperature와 top-p는 세 추론 모델에 똑같이 적용할 수 없어 지정하지 않는다. 숨은 생각 토큰이 출력 한도에 포함되는 차이가 있다면 설정을 바꾸는 대신 실행 기록에 남긴다.
첫 공개분은 문항당 한 번만 돌리는 스냅샷이다. 일회 실행은 모델의 안정적인 우열을 증명하지 않는다. 공급자 이름을 가린 뒤 두 사람이 사실·형식·계산·한국어·불필요한 내용의 다섯 항목을 각각 0~2점으로 검토한다. JSON 파싱 실패나 테스트 실패 같은 기계적 오류는 문장 평가로 덮지 않고 별도 표시한다.
세 공급자 중 하나라도 같은 수집 시간대에 10문항을 끝내지 못하면 완성된 비교표를 만들지 않는다. 실패 응답과 사용량 한도 도달 기록도 원시 자료에 남긴다. 전체 점수 하나로 ‘최종 승자’를 고르는 대신, 업무별 결과와 중앙값까지만 공개할 계획이다.
지금 고를 수 있는 것은 모델이 아니라 검증 방식이다
현재 자료로 GPT, Claude, Gemini 가운데 한국어 업무의 승자를 고를 수는 없다. 8월 18일 표준 출력 가격만 보면 프로모션 중인 Gemini 3.6 Flash가 가장 낮다. 실제 비용은 생각 토큰·캐시·재시도·응답 길이에 따라 달라진다. 낮은 가격을 곧바로 업무 품질이나 총비용 1위로 읽으면 안 된다.
도입을 앞둔 팀이라면 이 10문항을 그대로 쓰기보다 자사 업무에서 실패 비용이 큰 사례로 바꾸는 편이 낫다. 고객 답변을 고를 때는 정책 위반을, 데이터 추출이라면 스키마 오류와 누락을, 코딩이라면 독립 테스트 통과를 먼저 본다. 입력 원문, 정답 조건, 모델 ID, 설정, 시간과 비용을 함께 남겨야 다음 모델 업데이트 뒤에도 같은 조건으로 다시 비교된다.
세 API가 같은 조건으로 10문항을 모두 끝낸 뒤에만 원시 응답, 실패 기록과 가림 채점표를 공개한다. 모델 ID나 가격이 바뀌면 10개 중 일부만 새 모델로 바꾸지 않고 세 모델의 전체 스냅샷을 다시 수집한다. 그 전까지 이 글은 비교 결과가 아니라, 결과를 만들기 위한 공개 프로토콜과 미실행 기록이다.
참고한 출처
공식 발표·문서·changelog 기반으로 작성했습니다. 전체 8개 중 공식 출처는 8개입니다.
- OpenAI API models(새 창)공식OpenAI
- Using GPT-5.6(새 창)공식OpenAI
- Claude models overview(새 창)공식Anthropic
- Claude API pricing(새 창)공식Anthropic
- Claude effort(새 창)공식Anthropic
- Gemini models(새 창)공식Google
- Gemini API pricing(새 창)공식Google
- Gemini thinking(새 창)공식Google