Arena Agent · 코딩하는 상인 해설

AI 에이전트 순위·비교: 도구 사용, 성공 신호와 오류 복구

에이전트는 답을 잘 쓰는 것만으로 충분하지 않습니다. 도구를 선택하고, 오류에서 복구하고, 끝난 일을 증거로 확인할 수 있어야 합니다. Arena Agent의 실제 세션 신호를 나눠 보고 내 자동화 작업에 필요한 항목을 고릅니다.

기록 기준 59개 평가 항목원본 순위 ↗
공개 순위 1Claude Fable 5.1 (Max)Anthropic · 모델명에 실행 설정 포함
순 개선도15.87% ±2.84%기준 대비 변화 · %p 해석

코딩하는 상인 분석

종합 순위와 개별 행동은 다릅니다

계산 기준 ↓
공개 순위 첫 두 행의 점수 차이3.19%p

Claude Opus 5 (High)Claude Fable 5.1 (Max)의 대표 점수 차이입니다. 성공률 차이나 상대적인 개선 비율로 해석하지 않습니다.

상위 10행 중 성공 ↑ · 환각 ↓9개 항목

확인된 성공이 양수이고 도구 환각이 음수인 행의 수입니다. 두 조건을 만족해도 개별 작업의 성공을 보장하지 않습니다.

상위 10행의 항목별 세션 수 범위6,796–97,915

10개 공개 값의 최솟값과 최댓값입니다. 관측 수가 다른 결과이므로 점수와 신뢰구간을 함께 읽어야 합니다.

상위 10행 중 Bash 복구 표시값이 가장 높은 항목은 Claude Opus 5 (Max) (15.69% ±0.82%)입니다. 순 개선도 1위와 같은지 비교해 보세요. 이 역시 표시값의 정렬이며 유의성 검정은 아닙니다.

Arena Agent

전체 59개 평가 항목

검색·필터로 좁히기 →

원본의 %, ±, 음수 표기를 보존했습니다. 도구 환각은 낮을수록 좋으며, 수치는 절대 성공률이 아닙니다. 넓은 표는 가로로 밀어볼 수 있습니다.

Arena Agent · 2026. 09. 07. 저장 · 실행 설정을 포함한 전체 59
순위모델·실행 설정순 개선도높을수록 좋음확인된 성공높을수록 좋음칭찬 대 불만높을수록 좋음Bash 복구높을수록 좋음도구 환각낮을수록 좋음세션 수
115.87% ±2.84%22.45% ±3.71%42.45% ±10.94%13.11% ±1.33%-0.78% ±0.13%6,796
212.68% ±1.73%13.30% ±3.69%18.27% ±6.49%15.03% ±0.84%-0.73% ±0.13%22,594
311.67% ±1.96%14.89% ±3.95%17.30% ±7.10%15.69% ±0.82%-0.76% ±0.13%18,112
410.23% ±1.46%7.37% ±3.17%19.36% ±5.29%11.73% ±1.72%-0.78% ±0.13%36,204
59.31% ±1.49%6.68% ±3.13%22.07% ±5.50%8.14% ±0.96%-0.78% ±0.13%29,730
69.17% ±1.48%5.27% ±3.07%18.04% ±5.19%10.17% ±1.68%0.24% ±0.81%38,148
77.96% ±0.68%16.58% ±1.40%14.03% ±2.36%7.16% ±0.58%-0.78% ±0.13%97,915
87.41% ±1.95%2.80% ±4.13%11.19% ±6.78%10.91% ±1.35%-0.63% ±0.15%28,662
97.21% ±1.08%2.07% ±2.42%11.41% ±3.77%13.25% ±1.29%-0.78% ±0.13%51,255
106.92% ±1.51%13.56% ±2.96%10.26% ±5.61%10.20% ±0.79%-0.66% ±0.14%14,405
116.03% ±1.49%3.51% ±3.15%9.92% ±4.88%10.31% ±2.77%-0.70% ±0.14%36,571
126.03% ±0.76%8.63% ±1.64%11.73% ±2.67%4.51% ±0.77%-0.78% ±0.13%69,385
13
Grok 4.5SpaceXAI
5.73% ±1.15%6.30% ±2.55%5.07% ±4.02%9.65% ±1.19%-0.78% ±0.13%35,237
145.66% ±1.51%2.64% ±3.30%10.01% ±4.88%7.64% ±2.85%-0.72% ±0.13%37,121
155.55% ±1.05%1.20% ±2.23%10.27% ±3.60%10.44% ±1.71%-0.78% ±0.13%73,882
165.51% ±1.09%10.37% ±2.35%6.58% ±3.80%6.72% ±1.02%0.28% ±0.25%20,691
175.47% ±1.92%10.42% ±4.42%14.25% ±6.25%3.72% ±1.14%-0.70% ±0.15%10,104
185.43% ±0.90%11.75% ±1.91%5.24% ±3.13%8.70% ±0.71%-0.78% ±0.13%34,397
194.98% ±1.20%7.83% ±2.76%3.77% ±4.11%8.65% ±1.00%-0.78% ±0.13%18,119
204.65% ±1.41%2.50% ±3.17%6.76% ±4.73%8.61% ±1.86%-0.78% ±0.13%36,366
21
GPT 5.5OpenAI
4.39% ±0.90%0.95% ±2.06%5.49% ±3.05%9.61% ±1.17%-0.78% ±0.13%79,166
223.80% ±0.71%12.10% ±1.52%5.75% ±2.41%-0.28% ±0.75%-0.78% ±0.13%53,898
233.67% ±1.03%14.14% ±2.16%5.45% ±3.49%-2.24% ±1.02%-0.78% ±0.13%18,992
243.29% ±0.80%8.46% ±1.76%3.90% ±2.76%3.33% ±0.65%-0.76% ±0.13%57,183
253.04% ±1.20%-2.84% ±2.98%1.41% ±4.02%7.33% ±1.36%-0.78% ±0.13%17,972
262.99% ±0.90%1.14% ±2.14%0.71% ±3.06%8.19% ±0.89%-0.78% ±0.13%78,359
272.61% ±1.21%12.46% ±2.49%0.24% ±4.15%1.90% ±0.70%0.39% ±0.21%20,296
282.09% ±1.12%0.83% ±2.63%-0.22% ±3.63%7.23% ±1.13%-0.78% ±0.13%19,435
291.85% ±2.81%5.93% ±3.43%11.17% ±5.62%10.01% ±1.88%27.22% ±11.50%33,690
301.03% ±0.99%6.98% ±2.26%0.78% ±3.28%-2.31% ±0.90%-0.08% ±0.22%22,585
310.75% ±2.65%1.15% ±5.92%0.99% ±9.03%-3.86% ±2.97%-0.78% ±0.13%11,142
320.58% ±1.08%0.91% ±2.76%-3.07% ±3.61%5.80% ±0.90%-0.12% ±0.19%32,155
330.50% ±1.28%-5.90% ±3.22%-0.50% ±3.99%9.16% ±1.77%-0.71% ±0.16%39,399
340.46% ±1.18%6.60% ±2.81%-6.33% ±3.75%7.46% ±1.56%-0.77% ±0.13%20,816
350.43% ±0.92%9.54% ±2.17%-1.72% ±2.99%-0.39% ±1.13%-0.71% ±0.14%24,413
36
Kimi K2.6Moonshot
-0.29% ±2.80%-5.43% ±6.19%5.02% ±9.28%-9.57% ±5.32%-0.78% ±0.13%11,279
37-1.43% ±0.63%5.01% ±1.54%-9.48% ±1.85%2.34% ±1.15%-0.77% ±0.13%91,294
38-1.62% ±0.94%-1.90% ±2.40%-6.49% ±2.86%2.69% ±1.65%-0.21% ±0.24%36,306
39-2.22% ±0.99%0.17% ±2.15%-2.28% ±2.74%-6.23% ±2.38%1.50% ±0.63%71,952
40
Hy3Tencent
-2.50% ±1.32%-5.97% ±3.05%-3.83% ±4.22%-0.90% ±2.30%1.64% ±0.58%24,934
41-3.48% ±0.86%-1.62% ±1.99%-1.38% ±2.64%-6.48% ±1.79%0.11% ±0.18%94,447
42-3.58% ±1.15%-2.49% ±2.91%-6.17% ±3.50%-6.60% ±1.57%-0.69% ±0.18%18,309
43-3.73% ±0.94%-2.55% ±2.21%1.11% ±2.79%-15.70% ±1.80%-0.53% ±0.27%84,469
44
Minimax M3MiniMax
-3.76% ±0.94%-8.25% ±2.54%-9.86% ±2.86%4.42% ±0.90%-0.39% ±0.19%36,707
45-3.81% ±0.98%-5.56% ±2.51%-8.84% ±2.92%-1.66% ±1.73%0.36% ±0.32%37,593
46-3.87% ±1.27%-5.44% ±3.33%-12.53% ±3.61%2.08% ±2.07%0.38% ±0.44%19,845
47-4.71% ±1.52%-8.64% ±3.72%-5.57% ±4.35%-6.16% ±2.69%-0.19% ±0.61%13,762
48
Inkling SmallThinking Machines
-5.43% ±1.73%-19.38% ±4.89%-15.30% ±5.08%11.58% ±1.21%0.10% ±0.46%11,299
49-7.16% ±1.56%-14.49% ±3.95%-12.61% ±4.41%-6.13% ±2.31%2.08% ±1.01%8,793
50
InklingThinking Machines
-7.47% ±1.07%-16.01% ±3.17%-20.15% ±2.88%6.73% ±1.19%-0.35% ±0.21%40,752
51-9.87% ±3.56%-8.60% ±7.42%-13.71% ±9.54%-24.95% ±9.44%0.79% ±1.64%5,770
52-11.57% ±1.17%-13.27% ±2.36%-13.46% ±2.61%-19.71% ±4.12%-0.60% ±0.13%62,791
53-11.64% ±1.39%-16.44% ±3.68%-15.43% ±3.52%-16.30% ±2.90%0.87% ±0.71%23,215
54-11.71% ±1.19%-15.18% ±3.02%-19.07% ±3.00%-19.57% ±2.82%-0.61% ±0.17%37,001
55-12.11% ±1.14%-8.67% ±2.04%-10.55% ±2.36%-29.59% ±3.54%1.24% ±2.36%83,413
56-12.95% ±1.35%-7.43% ±2.43%-11.80% ±2.93%-39.22% ±4.80%-0.46% ±0.13%74,459
57-14.43% ±2.68%-15.71% ±5.60%-14.99% ±7.00%-31.95% ±7.75%-0.23% ±0.27%12,264
58
Grok 4.3SpaceXAI
-20.26% ±1.89%-13.13% ±2.13%-15.39% ±2.38%-62.36% ±8.66%-0.67% ±0.13%82,746
59-23.70% ±3.85%-3.41% ±2.40%-4.53% ±3.12%-71.50% ±17.41%28.37% ±6.71%56,661

수치는 절대 성공률이 아니라 평균 모델 대비 변화(%p)입니다. 음수는 감소를 뜻하며 도구 환각은 낮을수록 좋습니다. 다른 벤치마크와 점수를 합산할 수 없습니다. 빈 값은 0점이 아니며, 수록 행 수는 고유 모델 수와 다릅니다.

순위를 실제 선택에 쓰려면

에이전트 점수는 이렇게 읽습니다

01

성공률이 아니라 기준 대비 변화

순 개선도와 행동 신호는 기준 모델 분포 대비 변화입니다. 예를 들어 +10%p는 열 번 중 한 번 성공한다는 뜻이 아닙니다. 표는 출처의 % 표기를 유지하며, 해석 단위는 퍼센트포인트(%p)입니다.

02

도구 환각은 음수 방향을 확인

확인된 성공과 Bash 복구는 높은 방향을, 도구 환각은 낮은 방향을 봅니다. 모든 열의 큰 수치를 좋은 결과로 읽으면 판단이 뒤집힙니다. 순 개선도 상위 모델도 개별 신호에서는 다른 순서일 수 있습니다.

03

내 도구와 실행 환경에서 다시 확인

Agent Arena는 Arena 환경의 오케스트레이터 모델을 평가합니다. 내 서비스의 도구 명세, 권한, 시스템 프롬프트가 바뀌면 같은 결과를 보장하지 않습니다. 세션 수를 서로 합쳐 고유 사용자 수나 총 업무 수로 해석하지 않습니다.

직접 비교할 때 쓸 과제

AI 에이전트 도입 전 확인 과제

출처와 검증 범위 →

아래는 코딩하는 상인이 제안하는 비교 절차입니다. 아직 이 과제로 모델을 실행·채점한 결과는 아니며, 위 순위에도 반영하지 않았습니다. 모델 ID·실행일·설정·원본 입력·전체 출력을 함께 남겨야 다음 업데이트 때 같은 조건으로 다시 비교할 수 있습니다.

01완료 선언과 실제 결과 대조

같이 줄 과제
테스트용 파일 세 개를 조건에 맞게 수정하고 결과 목록을 제출하게 합니다. 완료 뒤에는 파일 내용과 실행 로그를 직접 확인합니다.
통과 기준
요청한 변경이 모두 존재하고, 하지 않은 작업을 완료했다고 보고하지 않아야 합니다.
남길 기록
실제 완료 항목 수, 허위 완료 보고 수, 사람이 개입한 횟수를 기록합니다.

02도구 오류에서 복구

같이 줄 과제
운영 자원과 분리된 테스트 환경에서 잘못된 경로 같은 재현 가능한 오류를 하나 주고, 원인을 확인한 뒤 계속 진행하게 합니다.
통과 기준
같은 실패를 반복하지 않고, 허용한 도구와 경로 안에서 문제를 해결해야 합니다.
남길 기록
복구까지의 도구 호출 수, 반복 실패 수, 중단 여부를 기록합니다.

03중간 조건 변경 수용

같이 줄 과제
보고서를 만드는 도중 대상 기간이나 출력 형식을 바꾸고, 이미 만든 결과에도 새 조건을 적용하게 합니다.
통과 기준
설명만 바꾸는 데 그치지 않고 최종 파일과 계산에도 바뀐 조건이 반영되어야 합니다.
남길 기록
빠뜨린 수정 항목, 재작업 시간, 전체 토큰·도구 비용을 기록합니다.

선택 순서파일 생성이라면 완료 증거를, 터미널 자동화라면 실패 복구를 먼저 확인하세요. 동일한 도구·권한·중단 조건으로 비교하고, 재시도와 사람의 개입까지 포함한 작업당 비용을 기록합니다. 토큰 단가가 낮아도 호출 횟수가 늘면 최종 비용은 커질 수 있습니다.

분석 기준과 출처

위 숫자는 2026. 09. 07. 저장한 Arena Agent 스냅샷의 59행에서 계산했습니다. 원본 순위를 오름차순으로 정렬한 첫 10행을 상위권으로 삼고, 모델 버전·실행 설정을 합치지 않았습니다. 59행에 대표 점수가 있고, 59행에 읽을 수 있는 ± 값이 있습니다.

점수 차이는 첫 두 행의 대표 점수 차이의 절댓값입니다. 구간 겹침은 표시 점수에서 ± 값을 뺀 하한과 더한 상한을 대조합니다. 제공사 수는 표의 제공사명을 기준으로 세고, 세션 수는 항목별 최솟값과 최댓값만 사용합니다. 누락 값을 0으로 채우거나 서로 다른 출처의 점수를 합치지 않습니다.

성공 ↑·환각 ↓ 항목 수는 확인된 성공 > 0과 도구 환각 < 0을 동시에 만족하는 행을 센 값입니다. Bash 복구 항목은 상위 10행 안에서 공개 값이 가장 높은 행을 표시하며, 같은 값이면 원본 순서의 첫 항목을 사용합니다.

이 계산과 선택 기준은 코딩하는 상인의 해석입니다. 측정은 Arena가 수행했으며, 자체 실험 성적이나 통계적 우월성 검정으로 표현하지 않습니다. 원본 방법론 확인일: 이 날짜는 스냅샷 갱신일과 다릅니다.