모델 계열 · 딥시크

DeepSeek 최신 모델
벤치마크 순위·성능 비교

딥시크는 버전·체크포인트와 추론 설정이 이름에 드러납니다. 최신 항목과 이전 버전을 섞지 않고 평가별 위치를 확인합니다.

데이터 갱신 2026. 08. 17.

한눈에 보기

현재 DeepSeek 대표 항목은 DeepSeek V4 Pro 0813 (max)

Artificial Analysis 공개 순위에서 가장 높은 DeepSeek 계열 항목은 DeepSeek V4 Pro 0813 (max)입니다. 전체 20위, 지능 지수 53로 집계됐습니다.

이는 출시일 순서가 아니라 현재 독립 평가 스냅샷에서 가장 높은 실행 설정입니다. 같은 모델의 추론 강도별 항목은 별도 결과일 수 있습니다.

공개 결과
24
총 공개 결과 수
평가 출처
5
결과가 있는 평가

출처별 비교

평가별 DeepSeek 상위 결과

서로 단위가 다른 점수를 합산하지 않습니다. 각 표의 순위는 해당 원본 리더보드 전체에서의 위치이며, DeepSeek 결과만 최대 5개 추렸습니다.

종합·효율 · Artificial Analysis

DeepSeek 지능·비용·속도를 한 화면에서

해석: 성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가? 에이전트, 코딩, 과학 추론, 일반 능력을 묶은 Intelligence Index와 실제 API 비용·속도를 함께 봅니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
20DeepSeek V4 Pro 0813 (max)DeepSeek53지능
25DeepSeek V4 Flash 0731 (max)DeepSeek52지능
40DeepSeek V4 Pro (max)DeepSeek45지능
41DeepSeek V4 Pro (high)DeepSeek44지능
80DeepSeek V4 ProDeepSeek32*지능

한계: 영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.

대화 선호 · Arena Text

DeepSeek 사람들이 실제 대화에서 고른 모델

해석: 실제 사용자는 어떤 모델의 답변을 더 선호하는가? 두 모델의 익명 답변을 사용자가 직접 비교해 투표한 결과로, 정답률보다 체감 품질과 선호를 보여줍니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
43deepseek-v4-pro-max-20260813DeepSeek1465 ±10점수
51deepseek-v4-proDeepSeek1458 ±4점수
57deepseek-v4-pro-high-previewDeepSeek1456 ±4점수
81deepseek-v4-flash-high-previewDeepSeek1438 ±4점수
85deepseek-v4-flashDeepSeek1435 ±4점수

한계: 사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.

코딩 선호 · Arena Code

DeepSeek 코드 답변을 직접 비교한 사용자 선택

해석: 코딩 대화에서 사용자가 더 만족한 모델은 무엇인가? 코딩 요청에서 어떤 모델의 결과가 더 낫다고 평가됐는지 보여주는 공개 사용자 선호 리더보드입니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
10deepseek-v4-pro-high-20260813DeepSeek1584+14 / -14점수
11deepseek-v4-flash-highDeepSeek1581+12 / -12점수
41deepseek-v4-pro-high-previewDeepSeek1464+7 / -7점수
47deepseek-v4-proDeepSeek1446+7 / -7점수
56deepseek-v4-flash-high-previewDeepSeek1431+7 / -7점수

한계: 코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.

에이전트 실사용 · Arena Agent

DeepSeek 도구를 쓰는 에이전트의 실제 세션 신호

해석: 실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가? 도구 호출이 포함된 실제 세션에서 성공 확인, 칭찬·불만, 조향 가능성, Bash 복구와 환각 신호를 함께 봅니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
19Deepseek V4 Flash (High) (20260731)DeepSeek4.04% ±0.81%순 개선
28DeepSeek V4 ProDeepSeek0.14% ±0.88%순 개선
35DeepSeek V4 FlashDeepSeek2.20% ±0.90%순 개선

한계: 여러 행동 신호를 인과 추정으로 합친 실사용 지표입니다. 단일 정답형 벤치마크와 점수 단위를 비교할 수 없습니다.

저장소 수정 · SWE-bench Verified

DeepSeek 실제 GitHub 이슈를 해결한 에이전트

해석: 실제 코드베이스 문제를 해결해 테스트까지 통과한 시스템은 무엇인가? 실제 오픈소스 저장소의 이슈를 재현하고 패치를 적용해 테스트를 통과한 비율을 비교합니다.

2026. 08. 17. 기준

순위모델·설정주요 점수
46mini-SWE-agent + DeepSeek V3.2 (high)DeepSeek70.0%해결률
78mini-SWE-agent + DeepSeek V3.2 Reasonerdeepseek60.0%해결률

한계: 모델뿐 아니라 에이전트 하네스, 시도 횟수, 도구와 프롬프트가 결과에 영향을 줍니다. 모델 단독 순위가 아닙니다.