내 기준으로 AI 모델 비교

후보를 최대 3개 고르고, 같은 평가의 점수와 실행 조건을 나란히 보세요. API 단가가 확인된 모델은 내 사용량으로 월 비용까지 비교할 수 있습니다.

비교 기준·모델 바꾸기

SWE-bench Verified · 3개 선택

평가 기준을 바꾸면 해당 출처의 대표 항목으로 선택을 새로 시작합니다.

비교할 모델과 실행 설정

적용하면 비교 결과와 공유 주소가 함께 바뀝니다.

처음에는 주요 제공사별 상위 항목을 보여줍니다. 위에서 원하는 모델과 실행 설정으로 바꿀 수 있습니다.

SWE-bench Verified

선택한 3개 항목, 같은 평가로 비교

자료 저장 2026년 8월 17일 · 순위는 수록된 원본 기준

표를 좌우로 밀어 모든 모델을 확인하세요.

SWE-bench Verified의 동일 스냅샷에서 선택한 모델별 원본 순위, 지표와 실행 설정을 비교합니다.
모델·실행 설정UIUClive-SWE-agent + Claude 4.5 Opus medium (20251101)오픈 시스템Claude 상세 보기 →SonarSonar Foundation Agent + Claude 4.5 OpusClaude 상세 보기 →ByteDanceTRAE + Doubao-Seed-Code오픈 시스템
공개 순위123
해결률검증 세트 중 테스트를 통과한 비율79.2%79.2%78.8%
시도 횟수공개 제출 정보의 문제당 시도 구간1회1회2+회
시스템 공개에이전트 시스템 코드 공개 여부공개비공개공개
제출일리더보드 제출 날짜2025.12.152025.12.052025.09.28
원본 확인평가 항목·출처 ↗평가 항목·출처 ↗평가 항목·출처 ↗

모델뿐 아니라 에이전트 하네스, 시도 횟수, 도구와 프롬프트가 결과에 영향을 줍니다. 모델 단독 순위가 아닙니다. 이름에 표시된 추론 강도·폴백·하네스를 포함한 결과이며, 동일 모델이라도 실행 조건에 따라 수치가 달라집니다.

평가 방법 확인 ↗

내 사용량으로 계산

한 달에 얼마가 들까요?

위에서 고른 모델에 같은 토큰 사용량을 적용합니다. 평가 작업 비용과 별개의 텍스트 API 예상 요금입니다.

다른 모델·직접 단가로 계산 →

선택한 항목에 등록된 공식 API 단가가 없어 월 비용을 계산하지 않습니다. 위에서 다른 모델을 고르거나 비용 계산기에 직접 단가를 입력할 수 있습니다.

UIUC

live-SWE-agent + Claude 4.5 Opus medium (20251101)

공식 단가 미등록

하네스·폴백·제공 조건이 포함된 평가여서 단일 모델의 토큰 단가로 계산하지 않습니다.

Sonar

Sonar Foundation Agent + Claude 4.5 Opus

공식 단가 미등록

하네스·폴백·제공 조건이 포함된 평가여서 단일 모델의 토큰 단가로 계산하지 않습니다.

ByteDance

TRAE + Doubao-Seed-Code

공식 단가 미등록

하네스·폴백·제공 조건이 포함된 평가여서 단일 모델의 토큰 단가로 계산하지 않습니다.

같은 입력·출력 토큰 수를 가정한 추정치입니다. 실제 모델마다 답변 길이와 추론 토큰 수가 달라질 수 있습니다. 캐시 할인·도구 호출·검색·이미지·오디오·재시도·세금은 제외하며, 벤치마크 점수나 실행 시간을 재현하는 계산이 아닙니다.

수치 다음에는 실제 작업으로 확인하세요

같은 문서와 지시문으로 결과의 정확도, 수정 횟수, 응답 시간과 청구 토큰을 기록해 보세요. 이 페이지는 외부 공개 평가를 비교하며, 코딩하는 상인이 직접 수행한 실험 결과를 뜻하지 않습니다.