내 기준으로 AI 모델 비교

후보를 최대 3개 고르고, 같은 평가의 점수와 실행 조건을 나란히 보세요. API 단가가 확인된 모델은 내 사용량으로 월 비용까지 비교할 수 있습니다.

비교 기준·모델 바꾸기

Arena Agent · 3개 선택

평가 기준을 바꾸면 해당 출처의 대표 항목으로 선택을 새로 시작합니다.

비교할 모델과 실행 설정

적용하면 비교 결과와 공유 주소가 함께 바뀝니다.

처음에는 주요 제공사별 상위 항목을 보여줍니다. 위에서 원하는 모델과 실행 설정으로 바꿀 수 있습니다.

Arena Agent

선택한 3개 항목, 같은 평가로 비교

자료 저장 2026년 9월 7일 · 순위는 수록된 원본 기준

표를 좌우로 밀어 모든 모델을 확인하세요.

Arena Agent의 동일 스냅샷에서 선택한 모델별 원본 순위, 지표와 실행 설정을 비교합니다.
모델·실행 설정AnthropicClaude Fable 5.1 (Max)Claude 상세 보기 →OpenAIGPT 5.6 Sol (xHigh)GPT 상세 보기 →GoogleGemini 3.8 Flash (High)Gemini 상세 보기 →
공개 순위1517
순 개선도평균 모델 대비 여러 행동 신호의 종합 개선도(%p)15.87% ±2.84%9.31% ±1.49%5.47% ±1.92%
확인된 성공평균 모델 대비 사용자가 확인한 성공 신호 변화(%p)22.45% ±3.71%6.68% ±3.13%10.42% ±4.42%
칭찬 대 불만평균 모델 대비 칭찬·불만 신호 변화(%p)42.45% ±10.94%22.07% ±5.50%14.25% ±6.25%
Bash 복구평균 모델 대비 명령 실패 후 복구 신호 변화(%p)13.11% ±1.33%8.14% ±0.96%3.72% ±1.14%
도구 환각평균 모델 대비 도구 환각 변화(%p); 음수일수록 감소-0.78% ±0.13%-0.78% ±0.13%-0.70% ±0.15%
세션 수평가에 포함된 실제 세션 수6,79629,73010,104
원본 확인평가 항목·출처 ↗평가 항목·출처 ↗평가 항목·출처 ↗

수치는 절대 성공률이 아니라 평균 모델 대비 변화(%p)입니다. 음수는 감소를 뜻하며 도구 환각은 낮을수록 좋습니다. 다른 벤치마크와 점수를 합산할 수 없습니다. 이름에 표시된 추론 강도·폴백·하네스를 포함한 결과이며, 동일 모델이라도 실행 조건에 따라 수치가 달라집니다.

평가 방법 확인 ↗

내 사용량으로 계산

한 달에 얼마가 들까요?

위에서 고른 모델에 같은 토큰 사용량을 적용합니다. 평가 작업 비용과 별개의 텍스트 API 예상 요금입니다.

다른 모델·직접 단가로 계산 →
월 API 예상 사용량

한 달 동안 호출하는 총횟수

지시문·대화 기록을 포함한 평균

과금되는 추론 토큰도 함께 포함

직접 입력하는 가정값 · 실시간 아님

입력하면 아래 금액이 바로 바뀝니다. 사용량은 현재 화면에만 적용되며 공유 주소에는 포함되지 않습니다.

Anthropic

Claude Fable 5.1 (Max)

공식 단가 미등록

이 평가 항목과 일치하는 공식 API 단가를 아직 등록하지 않았습니다.

OpenAI

GPT 5.6 Sol (xHigh)

공식 단가 미등록

이 평가 항목과 일치하는 공식 API 단가를 아직 등록하지 않았습니다.

Google

Gemini 3.8 Flash (High)

$10.13/ 월

14,175원

입력 $4.50 + 출력 $5.63

계산에 사용한 API 모델 ID
gemini-3.8-flash
100만 토큰당 입력 / 출력
$0.75 / $3.75

유료 Standard, 2026-12-31까지 적용. 공식표의 2027-01-01 이후 단가는 입력 $1.50, 출력 $7.50입니다.

단가 확인 2026-09-07 · 적용 기한 2026-12-31

공식 가격·조건 ↗

같은 입력·출력 토큰 수를 가정한 추정치입니다. 실제 모델마다 답변 길이와 추론 토큰 수가 달라질 수 있습니다. 캐시 할인·도구 호출·검색·이미지·오디오·재시도·세금은 제외하며, 벤치마크 점수나 실행 시간을 재현하는 계산이 아닙니다.

수치 다음에는 실제 작업으로 확인하세요

같은 문서와 지시문으로 결과의 정확도, 수정 횟수, 응답 시간과 청구 토큰을 기록해 보세요. 이 페이지는 외부 공개 평가를 비교하며, 코딩하는 상인이 직접 수행한 실험 결과를 뜻하지 않습니다.