모델명·체크포인트·제공사를 확인한 항목만 모았습니다. 순위는 각 원본 전체의 순위이며, 출처가 다른 점수나 순위를 평균내지 않습니다. 빈 값과 별표, 신뢰구간은 원본 표기를 유지합니다.
성능뿐 아니라 비용과 대기시간까지 고려하면 어떤 모델이 유리한가?
Gemini 3.8 Flash, Artificial Analysis, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | 지능 지수 | 평가 작업 비용 | 출력 속도 | 첫 응답 | 전체 응답 | 컨텍스트 |
|---|
| 27 | Gemini 3.8 Flash (high)추론 설정 | 47 | $0.74 | 281 t/s | 11.32 초 | 13.10 초 | 1M |
|---|
| 30 | Gemini 3.8 Flash (medium)추론 설정 | 47* | -- | 246 t/s | 8.29 초 | 10.32 초 | 1M |
|---|
| 50 | Gemini 3.8 Flash (low)추론 설정 | 41 | -- | 265 t/s | 0.78 초 | 2.66 초 | 1M |
|---|
영어 중심의 합성 지표이며 실제 한국어 업무 성능을 직접 보장하지 않습니다. 추론 강도별 결과는 같은 모델의 별도 실행 설정입니다.
실제 사용자는 어떤 모델의 답변을 더 선호하는가?
Gemini 3.8 Flash, Arena Text, 2026. 09. 03. 저장 결과| 순위 | 모델·실행 설정 | Arena 점수 | 투표 수 | API 가격 | 컨텍스트 |
|---|
| 8 | gemini-3.8-flash-high예비 | 1494 ±9 | 5,125 | $0.75 / $3.75 | 1M |
|---|
사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다.
표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.
코딩 대화에서 사용자가 더 만족한 모델은 무엇인가?
Gemini 3.8 Flash, Arena Code, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | Code Arena 점수 | 투표 수 | API 가격 | 컨텍스트 |
|---|
| 21 | gemini-3.8-flash-high예비 | 1567+12 / -12 | 2,727 | $0.75 / $3.75 | 1M |
|---|
코드 실행 성공률만 측정하는 테스트가 아닙니다. 에이전트 하네스가 붙은 항목은 기본 모델과 동일하게 비교하면 안 됩니다.
표의 API 가격 열은 이 평가사의 저장 당시 표기입니다. 검증한 공식 단가와 적용 조건은 아래 API 가격 영역에서 별도로 안내합니다.
실제 도구 사용 세션에서 끝까지 일을 잘 마친 모델은 무엇인가?
Gemini 3.8 Flash, Arena Agent, 2026. 09. 07. 저장 결과| 순위 | 모델·실행 설정 | 순 개선도 | 확인된 성공 | 칭찬 대 불만 | Bash 복구 | 도구 환각 | 세션 수 |
|---|
| 17 | Gemini 3.8 Flash (High) | 5.47% ±1.92% | 10.42% ±4.42% | 14.25% ±6.25% | 3.72% ±1.14% | -0.70% ±0.15% | 10,104 |
|---|
수치는 절대 성공률이 아니라 평균 모델 대비 변화(%p)입니다. 음수는 감소를 뜻하며 도구 환각은 낮을수록 좋습니다. 다른 벤치마크와 점수를 합산할 수 없습니다.
다른 출처에 결과가 없다는 사실은 0점이나 해당 기능 미지원의 근거가 아닙니다. 동일 모델인지 확인되지 않은 항목은 연결하지 않았습니다.