같은 출처로 비교

Qwen(큐원·큐웬) vs DeepSeek(딥시크)성능·가격·코딩 비교

현재 AA 대표: Qwen3.8 Max · DeepSeek V4 Pro 0813 (max)

큐원과 딥시크는 버전·체크포인트·추론 설정이 빠르게 늘어나는 계열입니다. 최신 대표 항목의 정확한 이름을 유지한 채 API 효율과 코딩 결과를 분리해 봅니다.

데이터 갱신 2026년 8월 17일

주요 수치 · 같은 실행 기준

지능·비용·속도 빠른 비교

아래 세 수치는 Artificial Analysis의 동일한 두 대표 항목입니다. 서로 다른 평가의 점수를 섞지 않으며 종합 승자를 정하지 않습니다.

기준QwenDeepSeek
지능 지수5853
평가 작업 비용$1.13$0.25
출력 속도46 t/s80 t/s

출처별 비교

같은 평가 안에서만 보는 순위

코딩 선호

Arena Code

모델군대표 항목순위점수
Qwenqwen3.8-max31667+13 / -13
DeepSeekdeepseek-v4-pro-high-20260813101584+14 / -14

에이전트 실사용

Arena Agent

모델군대표 항목순위순 개선
QwenQwen3.7 Max270.20% ±0.87%
DeepSeekDeepseek V4 Flash (High) (20260731)194.04% ±0.81%

저장소 수정

SWE-bench Verified

모델군대표 항목순위해결률
QwenOpenHands + Qwen3-Coder-480B-A35B-Instruct4769.6%
DeepSeekmini-SWE-agent + DeepSeek V3.2 (high)4670.0%

어떤 표를 볼까요?

용도에 맞는 평가 고르기

  • API 성능·비용Artificial Analysis에서 지능 지수, 작업 비용, 출력 속도를 동일 기준으로 비교합니다.
  • 코드 답변·도구 세션코드 응답 선호는 Arena Code, 도구 사용 흐름은 Arena Agent를 각각 확인합니다.
  • 저장소 수정 자동화SWE-bench Verified에서 해결률과 하네스 공개 여부를 함께 보고 실제 도입 테스트로 재검증합니다.

평가 방법과 한계

비교 방법과 한계

모델명 정규식으로 각 공개 소스에서 모델군별 최고 순위 항목 하나를 고릅니다. 양쪽 항목이 모두 있는 소스만 표시하고, 소스 사이 순위와 점수는 합산하지 않습니다.

SWE-bench 결과는 모델 단독 성적이 아니라 에이전트 하네스까지 포함합니다. 일반 API 모델 순위와 직접 합산하지 않습니다.

  • Artificial Analysis: 영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.
  • Arena Text: 사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.
  • Arena Code: 코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.
  • Arena Agent: 여러 행동 신호를 인과 추정으로 합친 실사용 지표입니다. 단일 정답형 벤치마크와 점수 단위를 비교할 수 없습니다.
  • SWE-bench Verified: 모델뿐 아니라 에이전트 하네스, 시도 횟수, 도구와 프롬프트가 결과에 영향을 줍니다. 모델 단독 순위가 아닙니다.