모델 분석 · Anthropic

Claude Fable 5.1성능·벤치마크·API 가격

클로드 페이블 5.1의 폴백 포함 추론 설정별 지능 지수·평가 비용·대기시간과 Arena Agent 결과를 분리해 분석합니다.

클로드 페이블 5.1 · 코딩하는 상인 분석 · 출처별 저장일은 아래 표에 표시

Artificial Analysis 최고 순위 설정

Claude Fable 5.1 (max with fallback)2026. 09. 07. 저장 · 전체 1
지능 지수
57
평가 작업 비용
$6.12
첫 응답
272.30 초

코딩하는 상인의 해석

max의 추가 점수를 얻으려면 얼마나 더 기다려야 할까?

Fable 5.1은 설정 이름의 ‘with fallback’을 빼고 읽으면 안 됩니다. 여기서 지능 지수와 비용은 폴백을 포함한 평가 결과입니다. Arena Agent의 Max 결과는 별도의 실제 세션 신호이므로, 같은 점수 척도나 같은 실행 과정으로 취급하지 않습니다.

Claude Fable 5.1 (high with fallback)Claude Fable 5.1 (max with fallback)

지능 지수 차이
+3점
5457
평가 작업 비용 차이
+3.26달러
기준 설정 대비 +114%
첫 응답 시간 차이
+246.63초
첫 출력이 시작될 때까지
전체 응답 시간 차이
+245.1초
응답을 마칠 때까지

같은 2026. 09. 07. Artificial Analysis 스냅샷의 오른쪽 설정 값에서 왼쪽 설정 값을 뺀 결과입니다. 지능 지수의 점수 차이는 정확도 개선율이 아닙니다. 비용 비율만 기준 설정의 작업 비용으로 나눠 계산합니다.

이 두 설정을 직접 비교하기 →

Artificial Analysis의 다섯 설정은 모두 폴백 포함입니다. 단일 모델 API 호출의 가격으로 환산하지 않으며, Arena Agent의 Max와도 설정별 비용을 직접 연결하지 않습니다.

외부 기관이 측정한 공개 결과에 대한 2차 분석입니다. 코딩하는 상인이 직접 모델을 실행한 실험 결과는 포함하지 않았습니다.

원점수와 실행 조건

Claude Fable 5.1의 출처별 평가 결과

모델명·체크포인트·제공사를 확인한 항목만 모았습니다. 순위는 각 원본 전체의 순위이며, 출처가 다른 점수나 순위를 평균내지 않습니다. 빈 값과 별표, 신뢰구간은 원본 표기를 유지합니다.

종합·효율

Artificial Analysis

2026. 09. 07. 저장

성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가?

Claude Fable 5.1, Artificial Analysis, 2026. 09. 07. 저장 결과
순위모델·실행 설정지능 지수평가 작업 비용출력 속도첫 응답전체 응답컨텍스트
1Claude Fable 5.1 (max with fallback)추론 설정 · 폴백 포함57$6.1268 t/s272.30 초279.63 초1M
2Claude Fable 5.1 (xhigh with fallback)추론 설정 · 폴백 포함56$4.6465 t/s107.33 초115.07 초1M
4Claude Fable 5.1 (high with fallback)추론 설정 · 폴백 포함54$2.8656 t/s25.67 초34.53 초1M
11Claude Fable 5.1 (medium with fallback)추론 설정 · 폴백 포함53$2.1456 t/s14.92 초23.83 초1M
16Claude Fable 5.1 (low with fallback)추론 설정 · 폴백 포함51$1.7054 t/s5.86 초15.19 초1M

영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.

에이전트 실사용

Arena Agent

2026. 09. 07. 저장

실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가?

Claude Fable 5.1, Arena Agent, 2026. 09. 07. 저장 결과
순위모델·실행 설정순 개선도확인된 성공칭찬 대 불만Bash 복구도구 환각세션 수
1Claude Fable 5.1 (Max)15.87% ±2.84%22.45% ±3.71%42.45% ±10.94%13.11% ±1.33%-0.78% ±0.13%6,796

수치는 절대 성공률이 아니라 평균 모델 대비 변화(%p)입니다. 음수는 감소를 뜻하며 도구 환각은 낮을수록 좋습니다. 다른 벤치마크와 점수를 합산할 수 없습니다.

다른 출처에 결과가 없다는 사실은 0점이나 해당 기능 미지원의 근거가 아닙니다. 동일 모델인지 확인되지 않은 항목은 연결하지 않았습니다.

평가 작업 비용과 별개

Claude Fable 5.1 공식 API 가격

하네스·폴백·제공 조건이 포함된 평가여서 단일 모델의 토큰 단가로 계산하지 않습니다. 평가 작업 비용이나 Arena의 가격 표기를 공식 단가의 대체값으로 사용하지 않습니다.

검증된 단가로 API 예상 비용 계산하기 →

도입 전 판단

내 작업에서는 무엇을 확인해야 할까?

즉시 답을 보여주는 서비스라면 high와 max의 첫 응답 시간을 먼저 비교하세요. 기다려도 되는 분석 작업이라면 추가 점수가 재시도나 사람의 수정 시간을 줄여 주는지 자신의 과제로 확인할 수 있습니다. 폴백 없는 실행에서 같은 결과가 나올지는 이 표로 판단할 수 없습니다.

한국어 업무에 적용할 때는 실제로 반복하는 과제를 고정하고 모델 ID, 추론 설정, 입력·출력, 오류, 응답 시간과 청구 토큰을 함께 기록하세요. 이 페이지의 종합 지능 지수는 한국어 업무의 정확도나 수익 개선을 직접 측정한 결과가 아닙니다.