Grok 4.6 출시…xAI, 장시간 AI 에이전트와 코딩 성능 강화
xAI가 2026년 8월 12일 Grok 4.6을 공개했다. 이번 버전은 단순한 추론 성능 향상보다 여러 단계에 걸친 장시간 작업, 에이전트형 코딩, 지식 업무, 인터랙티브·비주얼 작업에 초점을 맞췄다. xAI 자체 평가에서 Artificial Analysis Intelligence Index 61점을 기록해 GPT-5.6 Sol과 같은 점수를 기록했으며, API 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러부터 시작한다. 다만 일부 코딩 벤치마크에서는 경쟁 모델보다 낮은 점수도 확인돼, 종합 점수 하나만으로 최상위 모델이라고 판단하기에는 한계가 있다.
읽는 시간 약 6분
편집부가 공개 자료와 출처를 확인해 작성했습니다.
xAI가 새로운 AI 모델 Grok 4.6을 공개했다. 2026년 8월 12일 출시된 Grok 4.6은 이전 버전인 Grok 4.5보다 단순히 답변 품질을 높이는 데 그치지 않고, 여러 단계의 작업을 오랫동안 수행하는 AI 에이전트에 초점을 맞춘 모델이다.
xAI는 Grok 4.6이 주제 조사, 정보 분석, 코드베이스 작업, 애플리케이션 제작처럼 여러 단계가 필요한 작업을 지속적으로 수행하도록 개선했다고 설명했다. 특히 코딩과 지식 업무뿐 아니라 인터랙티브 및 시각적 프로젝트에서도 이전 모델보다 강점을 보였다고 밝혔다.
Grok 4.6의 핵심은 '오래 일하는 AI'
Grok 4.6의 개발 방향은 Grok 4.5와 비교하면 분명하다.
xAI는 이번 모델을 더 긴 추가 학습 과정으로 훈련했으며, 추론과 고급 기술 개념을 위한 모델 생성 데이터, 엔지니어링 데이터, 개선된 옵티마이저와 학습 방법을 적용했다고 설명했다. 이후 소프트웨어 엔지니어링, STEM, 지식 업무, 다양한 에이전트 환경을 대상으로 SFT와 강화학습을 진행했다.
특히 커널 최적화, 웹 개발, CAD 같은 전문 환경까지 에이전트형 강화학습의 범위에 포함했다는 점이 눈에 띈다.
이는 챗봇이 질문에 답하는 방식보다 목표를 전달하면 여러 작업을 나눠 실행하고 결과를 확인하는 방식에 가까워지고 있다는 의미다.
xAI는 실제 프로젝트 테스트에서 Grok 4.6이 낯선 분야를 조사하고 애플리케이션 구조를 설계한 뒤 핵심 기능을 구현하고, 여러 차례 수정하는 작업을 수행했다고 밝혔다. 장시간 작업에서는 스스로 결과를 테스트하고 검증하는 행동도 관찰됐다고 설명했다.
벤치마크에서는 GPT-5.6 Sol과 같은 61점
Grok 4.6은 Artificial Analysis Intelligence Index에서 61점을 기록했다.
이 지수는 9개 벤치마크를 종합한 점수다. xAI가 공개한 비교표에서는 Grok 4.6이 GPT-5.6 Sol과 같은 61점을 기록했고, Fable 5 Max는 62점으로 나타났다. Grok 4.5의 점수는 56점이었다.
다만 세부 결과를 보면 모든 분야에서 Grok 4.6이 앞서는 것은 아니다.
| 벤치마크 | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1,753 | 1,526 | 1,728 | 1,741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 Extended | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
예를 들어 GDPVal-AA v2에서는 Grok 4.6이 1,753으로 비교 모델 가운데 가장 높은 수치를 기록했다. 반면 DeepSWE v1.1에서는 65.9%로 GPT-5.6 Sol의 73%보다 낮고, Terminal-Bench v3.0 역시 26%로 경쟁 모델보다 낮다.
따라서 "Grok 4.6이 모든 벤치마크에서 경쟁 모델을 압도했다"고 해석하는 것은 정확하지 않다. xAI가 내세우는 61점은 여러 평가를 합친 종합 지표이고, 실제 개발 환경에서는 사용하는 도구와 작업 유형에 따라 성능 차이가 달라질 수 있다.
코딩과 애플리케이션 제작에 무게
Grok 4.6은 출시와 동시에 Cursor와 Grok Build에서 사용할 수 있도록 제공됐다. xAI는 첫 주 동안 두 서비스에서 포함 사용량을 2배로 제공한다고 밝혔다.
특히 Grok Build는 xAI가 장시간 코딩 작업을 겨냥해 개발하고 있는 도구다. Grok 4.6은 이 환경에서 단순한 코드 생성보다 프로젝트 전체를 이해하고 구현·수정하는 작업에 활용되는 형태다.
비주얼 및 인터랙티브 프로젝트도 강조했다. xAI에 따르면 Grok 4.6은 하나의 제품 아이디어를 기반으로 애플리케이션의 구조와 시각적 언어를 잡고 첫 번째 결과물을 만드는 데 Grok 4.5보다 강한 성능을 보였다.
이 부분은 AI 코딩 도구 시장의 경쟁 방식이 바뀌고 있다는 점과 연결된다. 코드 한두 개를 생성하는 능력보다 프로젝트를 얼마나 오래 유지하면서 수정하고 검증할 수 있는지가 실제 생산성에 더 직접적인 영향을 주기 때문이다.
API 가격은 입력 100만 토큰당 2달러
Grok 4.6의 API 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러부터 시작한다. 더 빠른 Fast 버전은 이 가격의 2배다.
가격만 보면 개발자가 에이전트 시스템에 적용하기에 부담이 상대적으로 낮은 편이다. 다만 실제 비용은 모델 가격표만으로 결정되지 않는다.
장시간 에이전트는 하나의 요청으로 끝나는 일반적인 챗봇보다 많은 토큰과 도구 호출을 사용할 수 있다. 따라서 실제 운영비는 모델의 토큰 단가뿐 아니라 작업당 필요한 추론량, 반복 횟수, 외부 도구 호출 구조까지 함께 봐야 한다.
Grok 4.6은 xAI API뿐 아니라 OpenRouter, Vercel, Cloudflare 등 파트너 서비스를 통해서도 제공된다.
Grok 4.6이 보여주는 방향
Grok 4.6에서 중요한 변화는 모델의 절대적인 벤치마크 점수보다 AI를 사용하는 방식 자체가 에이전트 중심으로 이동하고 있다는 점이다.
Grok 4.5가 코딩과 에이전트 작업을 강화한 모델이었다면, 4.6은 그 방향을 더 긴 작업 과정으로 확장했다. 사용자가 명령을 한 번 내리고 결과를 받는 구조에서 벗어나 조사, 설계, 구현, 테스트, 수정까지 이어지는 작업을 하나의 실행 과정으로 묶으려는 것이다.
다만 장시간 자율 작업이 실제 개발 생산성으로 얼마나 연결되는지는 별도로 검증할 필요가 있다. xAI가 공개한 벤치마크에서도 Grok 4.6은 일부 평가에서 경쟁 모델을 앞섰지만 DeepSWE와 Terminal-Bench처럼 실제 코딩 에이전트 성능과 관련된 평가에서는 뒤처지는 결과가 있다.
따라서 Grok 4.6의 진짜 경쟁력은 단일 벤치마크 순위보다는 실제 코드베이스에서 긴 작업을 얼마나 안정적으로 완료하고, 오류를 스스로 찾아 수정하며, 토큰 비용까지 통제할 수 있는지에서 결정될 가능성이 크다.
xAI가 이번 버전에서 강화한 것은 모델의 답변 한 번이 아니라 그 이후의 작업 과정이다. 이제 확인해야 할 것은 그 과정이 실제 개발자와 기업의 업무 시간을 얼마나 줄여주는가다.
출처 및 참고자료
참고한 출처
공식 출처와 보조 신호를 함께 확인했습니다. 전체 4개 중 공식 출처는 1개입니다.
- xAI — Introducing Grok 4.6(새 창)공식x.ai
- xAI — Grok 4.5(새 창)보조x.ai
- xAI — Grok Build(새 창)보조x.ai
- GitHub — Grok 4.6 in GitHub Copilot(새 창)보조github.blog