Anthropic
Claude Fable 5.1 (Max)
공식 단가 미등록
이 평가 항목과 일치하는 공식 API 단가를 아직 등록하지 않았습니다.
후보를 최대 3개 고르고, 같은 평가의 점수와 실행 조건을 나란히 보세요. API 단가가 확인된 모델은 내 사용량으로 월 비용까지 비교할 수 있습니다.
평가 기준을 바꾸면 해당 출처의 대표 항목으로 선택을 새로 시작합니다.
처음에는 주요 제공사별 상위 항목을 보여줍니다. 위에서 원하는 모델과 실행 설정으로 바꿀 수 있습니다.
Arena Agent
자료 저장 2026년 9월 7일 · 순위는 수록된 원본 기준
표를 좌우로 밀어 모든 모델을 확인하세요.
| 모델·실행 설정 | AnthropicClaude Fable 5.1 (Max)Claude 상세 보기 → | OpenAIGPT 5.6 Sol (xHigh)GPT 상세 보기 → | GoogleGemini 3.8 Flash (High)Gemini 상세 보기 → |
|---|---|---|---|
| 공개 순위 | 1위 | 5위 | 17위 |
| 순 개선도평균 모델 대비 여러 행동 신호의 종합 개선도(%p) | 15.87% ±2.84% | 9.31% ±1.49% | 5.47% ±1.92% |
| 확인된 성공평균 모델 대비 사용자가 확인한 성공 신호 변화(%p) | 22.45% ±3.71% | 6.68% ±3.13% | 10.42% ±4.42% |
| 칭찬 대 불만평균 모델 대비 칭찬·불만 신호 변화(%p) | 42.45% ±10.94% | 22.07% ±5.50% | 14.25% ±6.25% |
| Bash 복구평균 모델 대비 명령 실패 후 복구 신호 변화(%p) | 13.11% ±1.33% | 8.14% ±0.96% | 3.72% ±1.14% |
| 도구 환각평균 모델 대비 도구 환각 변화(%p); 음수일수록 감소 | -0.78% ±0.13% | -0.78% ±0.13% | -0.70% ±0.15% |
| 세션 수평가에 포함된 실제 세션 수 | 6,796 | 29,730 | 10,104 |
| 원본 확인 | 평가 항목·출처 ↗ | 평가 항목·출처 ↗ | 평가 항목·출처 ↗ |
수치는 절대 성공률이 아니라 평균 모델 대비 변화(%p)입니다. 음수는 감소를 뜻하며 도구 환각은 낮을수록 좋습니다. 다른 벤치마크와 점수를 합산할 수 없습니다. 이름에 표시된 추론 강도·폴백·하네스를 포함한 결과이며, 동일 모델이라도 실행 조건에 따라 수치가 달라집니다.
평가 방법 확인 ↗내 사용량으로 계산
위에서 고른 모델에 같은 토큰 사용량을 적용합니다. 평가 작업 비용과 별개의 텍스트 API 예상 요금입니다.
Anthropic
공식 단가 미등록
이 평가 항목과 일치하는 공식 API 단가를 아직 등록하지 않았습니다.
OpenAI
공식 단가 미등록
이 평가 항목과 일치하는 공식 API 단가를 아직 등록하지 않았습니다.
$10.13/ 월
약 14,175원
입력 $4.50 + 출력 $5.63
유료 Standard, 2026-12-31까지 적용. 공식표의 2027-01-01 이후 단가는 입력 $1.50, 출력 $7.50입니다.
단가 확인 2026-09-07 · 적용 기한 2026-12-31
공식 가격·조건 ↗같은 입력·출력 토큰 수를 가정한 추정치입니다. 실제 모델마다 답변 길이와 추론 토큰 수가 달라질 수 있습니다. 캐시 할인·도구 호출·검색·이미지·오디오·재시도·세금은 제외하며, 벤치마크 점수나 실행 시간을 재현하는 계산이 아닙니다.
같은 문서와 지시문으로 결과의 정확도, 수정 횟수, 응답 시간과 청구 토큰을 기록해 보세요. 이 페이지는 외부 공개 평가를 비교하며, 코딩하는 상인이 직접 수행한 실험 결과를 뜻하지 않습니다.