GPT·Claude·Gemini 비교 준비: 한국어 업무 10개 테스트와 미실행 기록

한국어 업무 10개를 같은 조건으로 비교할 프로토콜을 고정하고 실제 수집 범위를 기록했습니다. 세 모델을 모두 실행하지 못한 상태에서는 점수와 승자를 만들지 않았습니다.

읽는 시간 약 7

추천 독자: 일반, 개발자, 기업 실무자

AI는 자료 조사와 초안 정리에 보조적으로 사용했으며, 편집부가 출처와 사실을 확인했습니다.

GPT·Claude·Gemini 비교를 세 칸짜리 점수표부터 시작하면 결과를 믿기 어렵다. 2026년 8월 18일 이 글의 테스트 환경에는 세 회사 API 자격 증명이 없었다. 기존 브라우저 세션에서 세 서비스의 로그인 상태는 확인했다. ChatGPT 첫 과제 뒤 자동 수집이 멈춰 나머지 실행도 중단했다.

이번 기록에는 순위나 승자가 없다. 세 회사의 현행 일반 목적 API 모델과 한국어 업무 10개의 고정 문항, 실제로 끝난 자동화 점검 한 건, 다음 실행을 공개할 조건만 남겼다. 일부 결과를 세 모델의 품질 차이처럼 포장하지 않기 위해서다.

GPT·Claude·Gemini 비교에서 실제로 확인한 범위

확인 항목GPTClaudeGemini
API 실행미실행미실행미실행
기존 웹 로그인 상태확인확인확인
한국어 과제 실행T01 한 건미실행미실행
3자 공통 채점 포함제외제외제외

API 키 이름은 환경에서 찾았지만 세 값이 모두 비어 있었다. 인증하지 않은 모델 목록 요청도 각각 401, 401, 403으로 끝났다. 계정을 새로 만들거나 결제하지 않는 범위에서 웹 세션을 확인했다. ChatGPT에만 T01을 한 번 보냈다.

이 응답은 8.822초 뒤 도착했고 요청한 JSON 형식을 지켰다. 다만 화면에는 정확한 모델 ID가 나오지 않았고 Claude와 Gemini의 짝이 되는 결과도 없다. 자동 수집은 다음 문항부터 180초 안에 완료되지 않았다. T01은 브라우저 조작이 가능한지 살핀 기록일 뿐, GPT 점수나 3자 비교표의 첫 행이 아니다. 프롬프트와 비식별 원문, 중단 시점은 별도 실행 기록에 보존했다.

비교할 API 모델과 현재 가격을 함께 고정했다

모델 이름만 고정하면 가격 변동 때문에 다음 실행과 조건이 달라질 수 있다. 이번 프로토콜은 2026년 8월 18일 제공 중인 일반 목적 모델과 당일 표준 단가를 함께 기록했다.

공급자고정 모델 ID입력 100만 토큰출력 100만 토큰추론 설정
OpenAIgpt-5.6-terra$2$12medium
Anthropicclaude-sonnet-5$2$10medium
Googlegemini-3.6-flash$0.75$3.75medium

OpenAI 모델 문서gpt-5.6-terra의 표준 입력·출력 단가를 공개한다. 최신 모델 사용 안내는 추론 강도에서 medium을 균형 잡힌 시작점으로 설명한다.

Anthropic은 Claude 모델 표API 가격표에서 claude-sonnet-5의 모델 ID와 단가를 안내한다.

effort 문서에 따르면 이 모델은 medium 설정을 지원한다.

Google의 Gemini API 가격표gemini-3.6-flash 표준 단가에 2026년 12월 31일까지 입력 $0.75, 출력 $3.75를 적용한다. 2027년 1월 1일부터는 $1.50와 $7.50다.

출력 가격에는 생각 토큰이 포함된다. thinking 설정 문서에서 이 모델의 thinking level을 medium으로 맞출 수 있다.

세 모델의 가격대부터 같지 않다. 세 회사가 추론 토큰과 캐시 입력을 계산하는 방식도 다르다. 향후 실행에서는 공급자가 돌려준 토큰 항목을 원래 이름과 단위로 저장한다. 당시 공식 가격으로 계산한 비용은 따로 붙인다. 공개 가격을 작업당 실제 청구액으로 바꿔 적지는 않는다.

웹 채팅 구독을 고르는 문제라면 API 가격 대신 ChatGPT·Claude·Gemini 무료·유료 요금제 비교를 봐야 한다. 앱 구독료와 API 사용료는 별도다.

한국어 업무 10개는 형식 준수와 판단을 함께 본다

한 가지 요약 문항으로 업무용 모델을 고르면 프롬프트 운이 크게 작용한다. 고정 세트는 서로 다른 실패가 드러나도록 만들었다.

문항맡긴 일결과에서 보는 것
T01회의록의 결정·담당자 추출JSON 유효성, 누락과 추측
T02환불 문의 답장220자 제한, 정책의 조건부 적용
T03개인정보 문구 충돌 판정범위의 모호성, 확인할 사실
T04월 API 비용 수식 작성빈 값 처리, 토큰 단위 계산
T05모호한 점검 공지 다듬기추측 대신 확인 질문 제시
T06채널별 증가량 계산절대 증가와 증가율 구분
T07공개되지 않은 매출 답변숫자 날조 방지, 1차 확인 경로
T08영문 장애 공지 번역고유명·시간·상태 보존
T09짧은 JavaScript 수정빈 배열 처리, 테스트 실행 가능성
T10가중치로 도구 선택산식 정확성, 조건부 판단

예를 들어 T06은 7월과 8월 전환 수를 주고 절대 증가가 가장 큰 채널과 증가율이 가장 높은 채널을 따로 묻는다. 정답은 검색 30건과 파트너 52.0%다. 문장이 매끄러워도 둘을 같은 채널로 고르면 계산 항목에서 실패한다.

T07은 “A사의 2026년 2분기 API 매출은 공개되지 않았다”는 문장만 제공한다. 매출액과 전년 대비 증가율을 추정하지 않고 공시나 IR 같은 1차 확인 경로를 제시해야 통과한다. 이런 문항을 넣은 까닭은 지식량이 아니라, 자료가 없을 때 멈추는지를 보기 위해서다.

전체 프롬프트와 문항별 정답 조건은 실행 전에 고정했다. 결과를 본 뒤 잘 나온 모델에 맞춰 채점 기준을 바꾸지 않는다.

같은 질문도 실행 조건이 다르면 비교가 아니다

세 API에는 매번 새 요청을 보내고 이전 대화나 메모리를 붙이지 않는다. 시스템 문구와 사용자 프롬프트는 같은 바이트를 사용한다. 웹 검색, 코드 실행, 파일 검색 같은 도구는 모두 끄고 텍스트만 주고받는다.

추론 설정은 각 공급자의 medium, 최대 출력은 1,200토큰으로 고정한다. temperature와 top-p는 세 추론 모델에 똑같이 적용할 수 없어 지정하지 않는다. 숨은 생각 토큰이 출력 한도에 포함되는 차이가 있다면 설정을 바꾸는 대신 실행 기록에 남긴다.

첫 공개분은 문항당 한 번만 돌리는 스냅샷이다. 일회 실행은 모델의 안정적인 우열을 증명하지 않는다. 공급자 이름을 가린 뒤 두 사람이 사실·형식·계산·한국어·불필요한 내용의 다섯 항목을 각각 0~2점으로 검토한다. JSON 파싱 실패나 테스트 실패 같은 기계적 오류는 문장 평가로 덮지 않고 별도 표시한다.

세 공급자 중 하나라도 같은 수집 시간대에 10문항을 끝내지 못하면 완성된 비교표를 만들지 않는다. 실패 응답과 사용량 한도 도달 기록도 원시 자료에 남긴다. 전체 점수 하나로 ‘최종 승자’를 고르는 대신, 업무별 결과와 중앙값까지만 공개할 계획이다.

지금 고를 수 있는 것은 모델이 아니라 검증 방식이다

현재 자료로 GPT, Claude, Gemini 가운데 한국어 업무의 승자를 고를 수는 없다. 8월 18일 표준 출력 가격만 보면 프로모션 중인 Gemini 3.6 Flash가 가장 낮다. 실제 비용은 생각 토큰·캐시·재시도·응답 길이에 따라 달라진다. 낮은 가격을 곧바로 업무 품질이나 총비용 1위로 읽으면 안 된다.

도입을 앞둔 팀이라면 이 10문항을 그대로 쓰기보다 자사 업무에서 실패 비용이 큰 사례로 바꾸는 편이 낫다. 고객 답변을 고를 때는 정책 위반을, 데이터 추출이라면 스키마 오류와 누락을, 코딩이라면 독립 테스트 통과를 먼저 본다. 입력 원문, 정답 조건, 모델 ID, 설정, 시간과 비용을 함께 남겨야 다음 모델 업데이트 뒤에도 같은 조건으로 다시 비교된다.

세 API가 같은 조건으로 10문항을 모두 끝낸 뒤에만 원시 응답, 실패 기록과 가림 채점표를 공개한다. 모델 ID나 가격이 바뀌면 10개 중 일부만 새 모델로 바꾸지 않고 세 모델의 전체 스냅샷을 다시 수집한다. 그 전까지 이 글은 비교 결과가 아니라, 결과를 만들기 위한 공개 프로토콜과 미실행 기록이다.

참고한 출처

공식 발표·문서·changelog 기반으로 작성했습니다. 전체 8개 중 공식 출처는 8개입니다.

함께 보면 좋은 글