한국 AI 모델 비교: Solar Pro 4·A.X K2·K-EXAONE 2.0 선택 기준

세 모델은 모두 한국 기업이 공개했지만 제공 방식부터 다릅니다. 2026년 8월 18일 공식 문서와 공개 평가를 확인해 API, 오픈웨이트, 컨텍스트와 배포 부담을 비교했습니다.

읽는 시간 약 7

추천 독자: 개발자, 창업자, 기업 실무자

AI는 자료 조사와 초안 정리에 보조적으로 사용했으며, 편집부가 출처와 사실을 확인했습니다.

Solar Pro 4, A.X K2, K-EXAONE 2.0을 한 줄로 세우면 어느 모델이 앞설까. 한국 AI 모델 비교를 위해 2026년 8월 18일 세 회사의 공식 문서와 공개 벤치마크 방법론을 다시 확인했다. 세 모델을 같은 순위표에 넣는 것부터 무리였다.

Solar Pro 4는 관리형 API로 바로 쓸 수 있다. A.X K2와 K-EXAONE 2.0은 가중치를 내려받아 직접 운영하는 오픈웨이트 모델이다. 답변을 만드는 모델이라는 공통점보다 도입 방식의 차이가 더 컸다.

회사들이 발표한 자체 벤치마크 점수를 더하거나 줄 세우지도 않았다. 평가 세트와 추론 설정이 서로 다르고 세 모델을 같은 조건에서 비교한 독립 한국어 평가도 아직 확인하지 못했다.

한국 AI 모델 비교는 제공 방식부터 갈린다

모델제공 방식공식 컨텍스트공개된 모델 규모시작 방법
Solar Pro 4Upstage 관리형 API·온프레미스512K미공개API, Console, Playground, SolarChat
A.X K2Apache 2.0 오픈웨이트256K총 688B·활성 33BHugging Face에서 내려받아 자체 배포
K-EXAONE 2.0Apache 2.0 오픈웨이트256K총 750B·활성 37BHugging Face 자체 배포 또는 공개 체험 서비스

512K와 256K는 각 회사가 문서에 적은 최대 컨텍스트다. 긴 문서를 그만큼 정확히 처리한다는 보증은 아니다. 모델 규모도 품질 순위로 읽으면 안 된다. MoE 모델은 전체 파라미터와 토큰마다 실제로 쓰는 활성 파라미터를 나눠 봐야 한다.

Solar Pro 4는 API 도입이 빠르다

Upstage 모델 문서에 따르면 Solar Pro 4의 고정 스냅샷은 solar-pro4-260806이다. 컨텍스트는 512K, 최대 출력은 128K다. 영어·한국어·일본어 입출력과 도구 호출, 구조화 출력을 지원한다.

2026년 8월 18일 확인한 정가는 입력 100만 토큰당 0.30달러, 출력 1.20달러, 캐시 입력 0.06달러다. Upstage는 Console 사용량에 2026년 9월 10일 23시 59분(UTC)까지 90% 출시 할인을 적용한다고 안내한다. 실제 청구 전에는 Console의 프로모션 조건을 다시 확인해야 한다.

추론 서버 없이 기능을 붙이려는 팀이라면 세 모델 중 시작이 가장 쉽다. 모델 파일을 배포할 필요가 없기 때문이다. 가중치를 직접 보관하거나 실행 환경을 세밀하게 통제해야 한다면 관리형 API가 맞지 않을 수 있다.

Upstage는 API 입력을 학습에 사용하지 않으며 서비스 제공에 명시적으로 필요한 경우 외에는 저장하지 않는다고 설명한다. 회사 자료를 넣기 전에는 계약 조건, 보존 정책, 리전과 내부 보안 기준도 함께 확인해야 한다.

A.X K2와 K-EXAONE 2.0은 운영까지 맡아야 한다

A.X K2 모델카드는 총 688B, 토큰당 활성 33B인 MoE 모델로 소개한다. 공식 지원 컨텍스트는 262,144토큰, 즉 256K다. 모델카드의 512K NIAH 실험 결과를 지원 컨텍스트로 옮겨 적으면 안 된다.

A.X K2는 Apache 2.0으로 가중치를 공개했다. 영어와 한국어 비중이 높고 중국어·일본어·스페인어도 목표 언어에 포함한다. thinking과 non-thinking 모드를 한 모델에서 지원한다.

가중치를 받을 수 있다고 운영비까지 낮은 것은 아니다. SKT는 네이티브 FP8 체크포인트가 약 647GiB이며 캐시와 activation을 포함해 최소 약 800GiB의 통합 GPU 메모리가 필요하다고 적었다. 모델카드에서는 공개 추론 서비스 제공자도 확인되지 않는다.

K-EXAONE 2.0 모델카드는 총 750B, 활성 37B, 256K 컨텍스트를 명시한다. 라이선스는 Apache 2.0이며 한국어와 영어를 포함한 10개 언어를 지원 대상으로 둔다. 도구 호출과 reasoning도 지원한다.

LG AI Research의 BF16 배포 예시는 H200 8장이 들어간 노드 2개를 쓴다. 이 예시와 A.X K2의 최소 메모리 안내는 조건이 달라 비용표처럼 비교할 수 없다. 그래도 둘 다 소규모 GPU 서버로 가볍게 돌릴 모델은 아니다.

K-EXAONE 2.0은 k.exaone.ai에서 체험할 수 있지만 8월 18일 기준 공식 퍼블릭 관리형 API는 확인하지 못했다. 자체 배포 뒤 OpenAI 호환 엔드포인트를 만드는 일과 제조사가 운영하는 API를 쓰는 일은 다르다.

공개 벤치마크만으로 순위를 못 박지 않았다

코딩하는 상인의 AI 모델 벤치마크는 수집 시점의 공개 리더보드 행을 저장한다. 그 안의 위치를 세계 순위라고 부르지는 않는다. 출처마다 묻는 능력이 다르고 수집한 표의 범위도 한정돼 있다.

Artificial Analysis 방법론은 에이전트, 코딩, 과학 추론과 일반 능력을 묶어 지능 지수를 만든다. 텍스트 전용이며 영어 중심이다. 같은 버전과 같은 날짜의 점수끼리 비교해야 한다. 한국어 보고서 품질을 보여주는 점수는 아니다.

Arena의 랭킹 설명은 두 모델의 익명 답변 중 사용자가 고른 결과로 순위를 계산한다. 가까운 모델의 순위 범위가 겹치면 사실상 동률로 보는 편이 맞다. 선호도 점수는 사실 정확도나 코드 실행 성공률이 아니다.

각 회사의 자체 평가도 제품을 이해하는 자료로는 쓸 수 있다. 다만 SKT의 전작 대비 개선폭, LG의 24개 벤치마크 평균, Upstage의 개별 평가 점수는 같은 시험에서 나온 결과가 아니다. 하나의 순위로 합치지 않은 이유다.

한국어 성능은 별도 시험이 필요하다

세 회사 모두 한국어를 지원하거나 주요 학습 언어로 제시한다. 한국어 지원 여부와 한국어 업무 품질은 다른 질문이다.

계약서 요약, 고객 문의 분류, 사내 용어가 섞인 검색, 표가 포함된 보고서처럼 실제로 맡길 작업을 고정해 비교해야 한다. 같은 원문과 프롬프트를 쓰고 누락, 근거 일치, 형식 준수, 처리 시간과 총비용을 함께 기록해야 도입 판단에 쓸 수 있다.

이번 글에서는 직접 품질 시험을 하지 않았다. 확인한 범위는 공식 제공 방식, 문서에 적힌 사양, 배포 조건과 공개 평가의 해석 한계다. 한국어 원문 테스트는 원문과 채점 기준을 공개할 준비가 되면 별도 비교 글로 다룰 예정이다.

범용 모델용 10개 문항과 중단 기준은 GPT·Claude·Gemini 한국어 업무 테스트 기록에 먼저 공개했다. 국내 모델도 같은 원문과 채점 절차를 쓸 수 있을 때 결과를 연결한다.

첫 선택은 배포 방식에서 갈린다

상황먼저 볼 후보확인할 조건
별도 추론 인프라 없이 API를 붙여야 한다Solar Pro 4실제 청구 단가, 데이터 보존, 리전, 호출 한도
가중치를 내부 환경에 두고 상업적으로 써야 한다A.X K2·K-EXAONE 2.0Apache 2.0 의무, GPU 예산, 운영 인력
256K가 넘는 공식 컨텍스트가 필요하다Solar Pro 4긴 문서에서의 검색·누락 테스트
한국어 결과 품질이 구매 기준이다아직 한 모델로 확정하지 않음내부 문서로 같은 조건의 직접 평가

관리형 API가 필요한 팀은 Solar Pro 4부터 검토하는 편이 빠르다. 자체 호스팅과 가중치 통제가 우선이면 A.X K2와 K-EXAONE 2.0이 후보가 된다. 둘 중 하나를 고를 때는 회사 발표 점수보다 보유 GPU, 지원 언어, 추론 모드와 실제 한국어 작업 결과를 봐야 한다.

공식 문서, 라이선스, 가격 또는 독립 평가가 바뀌면 확인일과 선택표를 고친다. 다음 점검에서는 세 모델을 같은 한국어 작업 세트로 실행할 조건이 마련됐는지부터 본다.

참고한 출처

공식 발표·문서·changelog 기반으로 작성했습니다. 전체 8개 중 공식 출처는 8개입니다.

함께 보면 좋은 글