Arena Text · 코딩하는 상인 해설

글쓰기 AI 비교·순위: 대화 선호와 한국어 선택 기준

글을 잘 쓰는 AI를 찾는다면 답변 선호 순위로 후보를 좁힌 뒤, 내 글에서 사실과 말투를 지키는지 확인해야 합니다. 이 표는 Arena Text의 전체 대화 선호 결과이며, 한국어 글쓰기만 따로 측정한 순위는 아닙니다.

기록 기준 100개 평가 항목원본 순위 ↗
공개 순위 1claude-fable-5Anthropic · 모델명에 실행 설정 포함
Arena 점수1507 ±5사용자 선호 점수 · 원문 ± 유지

코딩하는 상인 분석

상위 열 행이 열 가지 선택지를 뜻할까?

계산 기준 ↓
공개 순위 첫 두 행의 점수 차이2점

claude-opus-4-6-highclaude-fable-5의 대표 점수 차이입니다. 같은 출처의 원점수를 뺀 값이며 정확도 차이가 아닙니다.

상위 10행에 등장하는 제공사3

같은 제공사의 버전·추론 설정도 각각 한 행입니다. 선택지를 넓히려면 순위 숫자뿐 아니라 제공사와 설정을 함께 확인하세요.

상위 10행의 항목별 투표 수 범위2,906–76,015

10개 공개 값의 최솟값과 최댓값입니다. 관측 수가 다른 결과이므로 점수와 신뢰구간을 함께 읽어야 합니다.

Arena Text

전체 100개 평가 항목

검색·필터로 좁히기 →

점수의 ±는 원본의 신뢰구간 표시입니다. API 가격은 입력 / 출력 100만 토큰당 USD이며, 확인 시점은 표의 기록 기준일입니다. 넓은 표는 가로로 밀어볼 수 있습니다.

Arena Text · 2026. 09. 03. 저장 · 실행 설정을 포함한 전체 100
순위모델·실행 설정Arena 점수투표 수API 가격컨텍스트
11507 ±527,189$10 / $501M
21505 ±472,099$5 / $251M
31504 ±112,906$10 / $501M
41502 ±460,103$5 / $251M
51499 ±103,240$1.25 / $4.25N/A
61498 ±376,015$5 / $251M
71494 ±461,238$5 / $251M
81494 ±95,125$0.75 / $3.751M
91493 ±535,174$5 / $251M
101492 ±524,064$1.25 / $4.25N/A
111491 ±85,682$0.75 / $3.751M
12
kimi-k3-maxMoonshot
1489 ±518,090N/AN/A
131488 ±613,572N/AN/A
141488 ±617,119$5 / $251M
151487 ±3102,999$1 / $61M
161486 ±440,668$2 / $121M
171483 ±523,413$4 / $20N/A
181482 ±448,727$5 / $251M
191482 ±463,547$5 / $301.1M
201482 ±77,668$1.40 / $4.401M
211480 ±522,286$0.75 / $3.751M
221480 ±613,346$2 / $61M
231479 ±434,180$0.75 / $4.501M
24
gpt-5.5OpenAI
1477 ±464,977$5 / $301.1M
251477 ±460,624$2.50 / $151.1M
261476 ±434,217$1.75 / $14128K
271476 ±532,573$0.75 / $4.501M
281475 ±526,630N/AN/A
291474 ±94,672$0.15 / $0.501M
301474 ±430,244$0.50 / $31M
311474 ±525,860$5 / $301.1M
321474 ±103,710$1.48 / $4.421M
331473 ±449,404$5 / $251M
341473 ±436,269$5 / $25200K
351472 ±466,316$1.50 / $7.501M
361472 ±462,251$1.25 / $2.501M
371472 ±533,966$1.40 / $4.401M
38
grok-4.5SpaceXAI
1471 ±526,158$2 / $6500K
391470 ±460,820$1.25 / $2.501M
401469 ±370,052$5 / $25200K
411468 ±457,649$0.43 / $0.871.1M
421468 ±537,129N/AN/A
431466 ±524,200$2 / $12N/A
441466 ±445,650$1.40 / $4.40202.8K
451466 ±521,485$1.20 / $6N/A
46
gpt-5.4OpenAI
1466 ±463,588$2.50 / $151.1M
471465 ±364,198N/AN/A
481462 ±531,387$2 / $101M
49
grok-4.6-highSpaceXAI예비
1461 ±103,453$2 / $6500K
50
kimi-k2.6Moonshot
1461 ±537,568$0.95 / $4262.1K
511460 ±85,196$1.03 / $6.16262.1K
521460 ±85,557$1.32 / $3.96N/A
53
grok-4.1SpaceXAI
1459 ±366,382N/AN/A
541458 ±385,921$0.50 / $31M
551458 ±454,225$1.32 / $3.961M
56
glm-5Z.ai
1458 ±427,647$1 / $3.20204.8K
571457 ±522,122$0.15 / $1.251M
581456 ±381,033$3 / $15200K
591456 ±374,277N/AN/A
60
hy3Tencent
1455 ±86,958$0.08 / $0.33262.1K
611455 ±438,121$0.32 / $1.281M
621455 ±379,668$3 / $15200K
631455 ±451,569$1.32 / $3.961M
641455 ±440,293$0.63 / $5400K
651453 ±524,740$0.20 / $1.20N/A
661451 ±85,898$0.99 / $1.49131.1K
671451 ±370,586$0.60 / $3N/A
681450 ±348,828$15 / $75200K
691449 ±432,743$1.75 / $14128K
701449 ±79,556N/AN/A
711448 ±524,384$1 / $31M
721448 ±459,455$0.75 / $4.50400K
731448 ±375,935$15 / $75200K
741446 ±434,899N/AN/A
751446 ±2122,612$1.25 / $101M
761445 ±614,547$75 / $150128K
771444 ±445,357$0.33 / $1.951M
781443 ±380,696$5 / $15128K
79
grok-4.3SpaceXAI
1443 ±465,316$1.25 / $2.501M
80
minimax-m3MiniMax
1443 ±444,829$0.30 / $1.20524.3K
811442 ±611,889$0.40 / $1.75204.8K
821441 ±373,640$0.39 / $2.34262.1K
83
inklingThinking Machines
1439 ±522,229$1 / $4.05524.3K
84
gpt-5.1OpenAI
1439 ±443,008$0.63 / $5400K
851438 ±448,691$0.44 / $1.321M
861438 ±85,813N/AN/A
871438 ±447,560$0.88 / $7400K
88
gpt-5.2OpenAI
1436 ±379,070$0.88 / $7400K
891436 ±86,913$0.40 / $3262.1K
901436 ±527,983N/AN/A
911436 ±448,950$0.44 / $1.321M
921435 ±527,194$0.78 / $3.90262.1K
931434 ±531,433$0.63 / $5400K
94
mimo-v2.5Xiaomi
1434 ±444,530$0.14 / $0.281.1M
951433 ±79,361$1.20 / $4202.8K
961432 ±460,474$0.25 / $1.501M
971431 ±458,583$2 / $8200K
981431 ±77,998$0.45 / $2.25262.1K
991430 ±355,408$1.25 / $2.502M
1001430 ±361,122$1.15 / $8262.1K

사용자 구성과 프롬프트 분포에 영향을 받는 선호도 지표입니다. 특정 전문 업무의 정확도 순위로 해석하면 안 됩니다. 빈 값은 0점이 아니며, 수록 행 수는 고유 모델 수와 다릅니다.

순위를 실제 선택에 쓰려면

글쓰기 후보를 좁히는 세 가지 기준

01

순위보다 원문을 지키는지

자연스러운 답변과 정확한 답변은 다를 수 있습니다. 요약·교정에 쓸 모델은 원문에 없는 수치나 인용을 덧붙이지 않는지 먼저 확인하세요. 사람의 선호 투표를 사실 정확도의 점수로 바꾸어 읽지 않습니다.

02

모델과 글쓰기 서비스를 구분

표의 모델명에는 버전과 추론 설정이 포함됩니다. 같은 브랜드의 웹·앱에서도 선택 모델, 대화 기록, 검색 사용 여부가 달라질 수 있습니다. 이 순위로 구독 상품 전체의 우열을 정할 수는 없습니다.

03

작은 점수 차이는 후보를 남겨둘 이유

점수 옆 ± 값과 투표 수를 함께 봅니다. 순위가 한두 칸 낮아도 내 문체에 더 맞을 수 있습니다. 공개 신뢰구간의 겹침은 참고 정보이며, 두 모델의 우열을 검정한 결과가 아닙니다.

직접 비교할 때 쓸 과제

글쓰기·대화 도입 전 확인 과제

출처와 검증 범위 →

아래는 코딩하는 상인이 제안하는 비교 절차입니다. 아직 이 과제로 모델을 실행·채점한 결과는 아니며, 위 순위에도 반영하지 않았습니다. 모델 ID·실행일·설정·원본 입력·전체 출력을 함께 남겨야 다음 업데이트 때 같은 조건으로 다시 비교할 수 있습니다.

01요약에서 사실 보존

같이 줄 과제
날짜·금액·고유명사가 포함된 실제 업무 문서 한 편을 주고, 핵심 내용 다섯 문장과 원문 근거를 함께 쓰게 합니다.
통과 기준
다섯 문장의 사실이 모두 원문에 있고, 날짜·금액·이름이 일치해야 합니다. 중요한 예외 조항이 빠진 문장은 따로 표시합니다.
남길 기록
근거 없는 주장 수, 잘못 옮긴 숫자 수, 누락한 핵심 조건을 기록합니다.

02한국어 문체와 수정 대응

같이 줄 과제
같은 초안을 고객 안내문과 내부 보고문으로 각각 고친 뒤, ‘과장 표현을 빼고 존댓말은 유지해 달라’고 한 번 더 요청합니다.
통과 기준
대상 독자에 맞게 문체가 달라지고, 추가 수정 뒤에도 원래 조건과 의미가 유지되어야 합니다.
남길 기록
남은 과장 표현, 바뀐 의미, 사람이 다시 손본 문장 수를 기록합니다.

03짧게 쓰되 조건 유지

같이 줄 과제
배송 지연·환불 조건·문의 방법이 들어간 공지를 지정한 글자 수 안으로 줄이게 합니다. 글자 수는 공백 포함인지 먼저 정합니다.
통과 기준
길이 제한을 지키면서 독자가 알아야 할 세 가지 조건이 모두 남아야 합니다.
남길 기록
실제 글자 수, 누락 조건, 최종 수정 시간을 기록합니다.

선택 순서같은 원문과 지시로 후보 두세 개를 비교하고, 결과물의 모델명을 가린 상태에서 읽어보세요. 선호하는 문장과 사실 오류를 따로 기록한 뒤 수정 시간이 적은 모델을 고르면, 순위만으로 고를 때 놓치는 차이가 드러납니다.

분석 기준과 출처

위 숫자는 2026. 09. 03. 저장한 Arena Text 스냅샷의 100행에서 계산했습니다. 원본 순위를 오름차순으로 정렬한 첫 10행을 상위권으로 삼고, 모델 버전·실행 설정을 합치지 않았습니다. 100행에 대표 점수가 있고, 100행에 읽을 수 있는 ± 값이 있습니다.

점수 차이는 첫 두 행의 대표 점수 차이의 절댓값입니다. 구간 겹침은 표시 점수에서 ± 값을 뺀 하한과 더한 상한을 대조합니다. 제공사 수는 표의 제공사명을 기준으로 세고, 투표 수는 항목별 최솟값과 최댓값만 사용합니다. 누락 값을 0으로 채우거나 서로 다른 출처의 점수를 합치지 않습니다.

이 계산과 선택 기준은 코딩하는 상인의 해석입니다. 측정은 Arena가 수행했으며, 자체 실험 성적이나 통계적 우월성 검정으로 표현하지 않습니다. 원본 방법론 확인일: 이 날짜는 스냅샷 갱신일과 다릅니다.