모델명·체크포인트·제공사를 확인한 항목만 모았습니다. 순위는 각 원본 전체의 순위이며, 출처가 다른 점수나 순위를 평균내지 않습니다. 빈 값과 별표, 신뢰구간은 원본 표기를 유지합니다.
성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가?
DeepSeek V4 Pro 0813, Artificial Analysis, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | 지능 지수 | 평가 작업 비용 | 출력 속도 | 첫 응답 | 전체 응답 | 컨텍스트 |
|---|
| 43 | DeepSeek V4 Pro 0813 (max)추론 설정 | 42 | $0.33 | 71 t/s | 1.66 초 | 37.09 초 | 1M |
|---|
영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.
실제 사용자는 어떤 모델의 답변을 더 선호하는가?
DeepSeek V4 Pro 0813, Arena Text, 2026. 09. 03. 저장 결과| 순위 | 모델·실행 설정 | Arena 점수 | 투표 수 | API 가격 | 컨텍스트 |
|---|
| 52 | deepseek-v4-pro-high-20260813 | 1460 ±8 | 5,557 | $1.32 / $3.96 | N/A |
|---|
사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.
표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.
코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?
DeepSeek V4 Pro 0813, Arena Code, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | Code Arena 점수 | 투표 수 | API 가격 | 컨텍스트 |
|---|
| 19 | deepseek-v4-pro-high-20260813 | 1582+11 / -11 | 3,518 | $1.32 / $3.96 | N/A |
|---|
코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.
표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.
실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가?
DeepSeek V4 Pro 0813, Arena Agent, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | 순 개선도 | 확인된 성공 | 칭찬 대 불만 | Bash 복구 | 도구 환각 | 세션 수 |
|---|
| 18 | DeepSeek V4 Pro (High) (0813) | 5.43% ±0.90% | 11.75% ±1.91% | 5.24% ±3.13% | 8.70% ±0.71% | -0.78% ±0.13% | 34,397 |
|---|
수치는 절대 성공률이 아니라 평균 모델 대비 변화(%p)입니다. 음수는 감소를 뜻하며 도구 환각은 낮을수록 좋습니다. 다른 벤치마크와 점수를 합산할 수 없습니다.
다른 출처에 결과가 없다는 사실은 0점이나 해당 기능 미지원의 근거가 아닙니다. 동일 모델인지 확인되지 않은 항목은 연결하지 않았습니다.