종합·효율
Artificial Analysis
| 모델군 | 대표 항목 | 순위 | 지능 |
|---|---|---|---|
| Qwen | Qwen3.8 Max | 10위 | 58 |
| DeepSeek | DeepSeek V4 Pro 0813 (max) | 20위 | 53 |
같은 출처로 비교
현재 AA 대표: Qwen3.8 Max · DeepSeek V4 Pro 0813 (max)
큐원과 딥시크는 버전·체크포인트·추론 설정이 빠르게 늘어나는 계열입니다. 최신 대표 항목의 정확한 이름을 유지한 채 API 효율과 코딩 결과를 분리해 봅니다.
데이터 갱신 2026년 8월 17일
주요 수치 · 같은 실행 기준
아래 세 수치는 Artificial Analysis의 동일한 두 대표 항목입니다. 서로 다른 평가의 점수를 섞지 않으며 종합 승자를 정하지 않습니다.
| 기준 | Qwen | DeepSeek |
|---|---|---|
| 지능 지수 | 58 | 53 |
| 평가 작업 비용 | $1.13 | $0.25 |
| 출력 속도 | 46 t/s | 80 t/s |
출처별 비교
종합·효율
| 모델군 | 대표 항목 | 순위 | 지능 |
|---|---|---|---|
| Qwen | Qwen3.8 Max | 10위 | 58 |
| DeepSeek | DeepSeek V4 Pro 0813 (max) | 20위 | 53 |
대화 선호
| 모델군 | 대표 항목 | 순위 | 점수 |
|---|---|---|---|
| Qwen | qwen3.8-max | 8위 | 1491 ±8 |
| DeepSeek | deepseek-v4-pro-max-20260813 | 43위 | 1465 ±10 |
코딩 선호
| 모델군 | 대표 항목 | 순위 | 점수 |
|---|---|---|---|
| Qwen | qwen3.8-max | 3위 | 1667+13 / -13 |
| DeepSeek | deepseek-v4-pro-high-20260813 | 10위 | 1584+14 / -14 |
에이전트 실사용
| 모델군 | 대표 항목 | 순위 | 순 개선 |
|---|---|---|---|
| Qwen | Qwen3.7 Max | 27위 | 0.20% ±0.87% |
| DeepSeek | Deepseek V4 Flash (High) (20260731) | 19위 | 4.04% ±0.81% |
저장소 수정
| 모델군 | 대표 항목 | 순위 | 해결률 |
|---|---|---|---|
| Qwen | OpenHands + Qwen3-Coder-480B-A35B-Instruct | 47위 | 69.6% |
| DeepSeek | mini-SWE-agent + DeepSeek V3.2 (high) | 46위 | 70.0% |
어떤 표를 볼까요?
평가 방법과 한계
모델명 정규식으로 각 공개 소스에서 모델군별 최고 순위 항목 하나를 고릅니다. 양쪽 항목이 모두 있는 소스만 표시하고, 소스 사이 순위와 점수는 합산하지 않습니다.
SWE-bench 결과는 모델 단독 성적이 아니라 에이전트 하네스까지 포함합니다. 일반 API 모델 순위와 직접 합산하지 않습니다.