알리바바, 2.4조 파라미터 오픈 웨이트 모델 ‘Qwen3.8-2.4T-A95B’ 공개

알리바바의 Qwen 팀이 총 2.4조 개 파라미터를 가진 대규모 MoE 모델 Qwen3.8-2.4T-A95B의 가중치를 공개했다. 토큰당 950억 개 파라미터를 활성화하는 구조로, 최대 100만 토큰 수준의 장문맥 처리를 지원한다. 다만 공개된 모델은 Qwen3.8 Max의 모든 기능을 그대로 제공하는 버전이 아니며, 2.4T 모델에는 별도의 Qwen3.8-Max 라이선스가 적용된다.

읽는 시간 약 7

편집부가 공개 자료와 출처를 확인해 작성했습니다.

알리바바의 Qwen 팀이 Qwen3.8의 핵심 대형 모델인 Qwen3.8-2.4T-A95B의 가중치를 공개했다. 이름 그대로 총 파라미터 규모는 2.4조 개에 달하며, Mixture of Experts(MoE) 구조를 사용해 토큰당 약 950억 개의 파라미터를 활성화한다.

Qwen은 모델 가중치를 Hugging Face에 공개했으며, Transformers와 vLLM, SGLang 등을 이용한 배포 방법도 함께 제공하고 있다.

Qwen3.8-2.4T-A95B 모델 페이지

2.4조 파라미터지만 매번 2.4조 개를 계산하는 것은 아니다

Qwen3.8-2.4T-A95B에서 가장 눈에 띄는 숫자는 2.4조 파라미터다. 하지만 이 숫자를 곧바로 실제 추론에 필요한 연산량으로 해석하면 안 된다.

모델은 세분화된 MoE 구조를 사용한다. 전체 모델에는 2.4조 개의 파라미터가 존재하지만, 하나의 토큰을 처리할 때는 일부 전문가(expert)만 선택적으로 활성화한다. 공개 자료 기준 활성 파라미터는 토큰당 950억 개다.

이 구조 덕분에 거대한 모델 용량을 유지하면서도 모든 파라미터를 매번 계산하는 방식보다 추론 비용을 줄일 수 있다. 다만 950억 활성 파라미터라는 숫자만 보고 일반적인 950억 파라미터 모델과 비슷한 하드웨어에서 실행할 수 있다고 판단해서는 안 된다.

공개된 BF16 가중치 파일은 약 4.89TB이며, FP8 버전도 약 2.50TB에 이른다. 실제 GPU 요구량은 가중치뿐 아니라 KV 캐시와 컨텍스트 길이, 배치 크기, 병렬화 방식 등에 따라 달라진다.

최대 100만 토큰까지 확장되는 장문맥 처리

Qwen3.8-2.4T-A95B는 기본적으로 262,144토큰의 컨텍스트 길이를 제공하며, YaRN을 활용하면 약 101만 토큰까지 확장할 수 있다. NVIDIA는 모델의 구조를 Full Attention과 Linear Attention을 결합한 하이브리드 방식으로 설명하고 있다.

장문맥에서는 단순히 컨텍스트 창의 숫자를 늘리는 것만으로 끝나지 않는다. 문서, 검색 결과, 코드, 도구 실행 결과가 길게 누적되는 에이전트 작업에서는 KV 캐시와 메모리 사용량이 병목이 되기 쉽다.

Qwen3.8-2.4T-A95B는 이 문제를 염두에 두고 Full Attention과 Linear Attention을 교차 사용하는 구조를 적용했다. NVIDIA는 이를 대규모 문서 분석과 코딩, 장시간 이어지는 에이전트 작업을 겨냥한 설계로 설명한다.

다만 ‘100만 토큰 지원’은 모든 환경에서 기본적으로 100만 토큰을 동일한 비용과 품질로 처리한다는 의미는 아니다. 실제 서비스에서는 컨텍스트 길이에 따라 메모리와 처리 시간이 크게 달라질 수 있다.

Qwen3.8 Max와 공개 모델은 같은 모델로 보면 안 된다

이번 공개에서 중요한 부분은 Qwen3.8 Max와 Qwen3.8-2.4T-A95B의 기능 구성이 완전히 동일하지 않다는 점이다.

Qwen3.8 Max는 Qwen3.8-2.4T-A95B를 기반으로 하지만, 클라우드 서비스 버전에는 비전 입력, 비사고(non-thinking) 응답, 100만 토큰의 기본 컨텍스트, 공식 내장 도구 등 추가 기능이 제공된다. 반면 공개된 2.4T 모델은 텍스트 생성 모델로 제공된다.

따라서 이번 공개를 단순히 **“Qwen3.8 Max 전체가 오픈소스로 풀렸다”**고 표현하는 것은 정확하지 않다.

정확한 표현은 Qwen3.8 Max의 기반이 되는 대형 모델의 오픈 웨이트가 공개됐다는 쪽에 가깝다.

실제 배포는 데이터센터급 인프라가 필요하다

Qwen은 Hugging Face 모델 카드에서 Transformers를 이용한 직접 로딩 방법을 제공하고 있으며, vLLM과 SGLang을 통한 서버 배포도 지원한다.

문제는 하드웨어다.

2.4조 파라미터라는 규모 때문에 일반적인 개인용 GPU 한두 장으로 운영하는 모델과는 성격이 다르다. NVIDIA는 Qwen3.8-2.4T-A95B를 자사의 GB300 NVL72 시스템에서 구동하는 방법을 공개했으며, 72개의 Blackwell Ultra GPU가 연결된 랙 스케일 시스템에서 FP8 기준 GPU당 4,000토큰/초 이상의 처리량을 측정했다고 밝혔다. 이 수치는 NVIDIA의 특정 하드웨어와 설정에서 나온 결과이므로 일반적인 Qwen3.8 성능으로 받아들여서는 안 된다.

이 점 때문에 이번 공개의 의미는 ‘누구나 로컬 PC에서 2.4조 파라미터 모델을 돌릴 수 있게 됐다’는 데 있지 않다.

오히려 프론티어급 모델의 가중치를 외부 개발자가 직접 확보하고, 자체 인프라에서 검증하거나 파인튜닝할 수 있는 선택지가 생겼다는 데 의미가 있다.

오픈 웨이트와 오픈소스는 구분해야 한다

또 하나 확인할 부분은 라이선스다.

Hugging Face에서 Qwen3.8-2.4T-A95B의 라이선스는 qwen3.8-max로 표시된다. Apache 2.0처럼 제한이 적은 범용 오픈소스 라이선스와 동일하게 볼 수 없다.

공개된 라이선스 조건에 따르면 일정 규모 이상의 상업 서비스에는 추가 조건이 적용된다. 예를 들어 상업 제품이나 서비스의 월간 활성 사용자가 1억 명을 넘거나 월 매출이 2,000만 달러를 초과하는 경우 모델명을 제품 UI에 표시해야 하며, 특정 AI 서비스 사업에서 연간 기준 5,000만 달러를 초과하는 경우 별도 라이선스가 요구될 수 있다. 실제 적용 여부는 해당 라이선스의 정의와 사업 구조를 기준으로 판단해야 한다.

따라서 이번 사례는 가중치를 공개했다는 의미의 오픈 웨이트오픈소스 AI 모델이라는 개념을 동일시하기 어려운 사례이기도 하다.

Qwen이 노리는 곳은 챗봇보다 에이전트에 가깝다

Qwen3.8-2.4T-A95B의 구조를 보면 단순한 대화형 챗봇보다는 장시간 이어지는 에이전트 작업에 무게를 둔 모델이라는 점이 드러난다.

긴 코드 작업, 대규모 문서 분석, 여러 단계의 도구 호출처럼 작업 과정에서 컨텍스트가 계속 누적되는 환경에서는 모델의 지식량뿐 아니라 긴 컨텍스트를 얼마나 효율적으로 유지하면서 추론할 수 있는지가 중요하다.

MoE와 하이브리드 어텐션을 결합한 Qwen의 설계는 이 문제를 겨냥한다. NVIDIA 역시 Qwen3.8-2.4T-A95B를 코딩과 대규모 문서 분석, 장기적인 멀티스텝 워크플로에 적합한 모델로 소개하고 있다.

다만 벤치마크 수치만으로 이 모델이 실제 서비스에서도 경쟁 모델을 일관되게 앞선다고 결론 내리기는 어렵다. 모델별 평가에는 서로 다른 하네스와 조건이 사용될 수 있고, Qwen이 제시한 결과 역시 독립적인 종합 순위와는 구분해서 봐야 한다.

Qwen3.8의 다음 관전 포인트

Qwen3.8-2.4T-A95B의 가중치 공개는 중국계 AI 모델이 프론티어급 모델을 API로만 제공하는 단계에서 개발자가 직접 검증할 수 있는 오픈 웨이트 단계로 이동하고 있다는 흐름을 보여준다.

하지만 이번 모델은 규모가 너무 크다. 가중치를 내려받을 수 있다는 것과 실제로 경쟁력 있는 비용으로 서비스할 수 있다는 것은 전혀 다른 문제다. 라이선스 역시 기업이 상업적으로 활용하기 전에 확인해야 할 조건이 존재한다.

앞으로 확인해야 할 것은 명확하다. 실제 GPU 클러스터에서의 추론 비용, 장문맥에서의 품질 유지, 에이전트 작업의 성공률, 그리고 Qwen3.8 Max와 공개 가중치 사이의 성능 차이다. 이 결과가 확인돼야 Qwen3.8-2.4T-A95B가 단순히 거대한 오픈 웨이트 모델을 넘어 실제 AI 인프라에서 얼마나 경쟁력을 갖는지 판단할 수 있다.

출처 및 참고자료

참고한 출처

공식 출처와 보조 신호를 함께 확인했습니다. 전체 4개 중 공식 출처는 3개입니다.

함께 보면 좋은 글

AI 소식

모더나, AI로 환자별 암 백신 설계…흑색종 3상서 재발·전이 억제 확인

모더나와 MSD가 공동 개발한 개인맞춤형 mRNA 암 치료제 ‘인티스메란 오토진(Intismeran autogene)’이 고위험 흑색종 대상 3상 임상시험에서 재발 없는 생존기간(RFS)과 원격 전이 없는 생존기간(DMFS)이라는 핵심 평가변수를 모두 충족했다. 이 치료제는 환자 종양의 유전자 변이를 분석해 AI 알고리즘으로 면역반응을 유도할 가능성이 높은 신항원을 선별하고, 최대 34개의 신항원을 mRNA에 담아 환자별로 제작한다. 다만 이번 발표는 중간 분석에 대한 톱라인 결과이며 전체 생존율(OS)과 세부 수치가 아직 공개되지 않아 ‘AI가 암을 치료하는 단계’라고 단정하기에는 이르다.

코딩하는 상인
AI 소식

한국 AI 사업 부정부패 의혹 확산…‘독파모’ 평가 불투명성이 불씨 됐다

국가 차원의 AI 육성 사업인 ‘독자 AI 파운데이션 모델(독파모)’을 둘러싼 논란이 커지고 있다. 2차 평가에서 글로벌 AI 성능지표 AAII 점수가 가장 높았던 모티프테크놀로지스가 탈락하면서 평가의 공정성을 둘러싼 의문이 다시 제기됐다. 정부는 벤치마크·전문가·사용자 평가를 종합한 결과라고 설명했지만 기업별 세부 점수와 최종 산출 과정은 공개하지 않았다. 현재까지 부정부패나 평가 조작이 확인된 것은 아니다. 다만 수조원 규모로 확대되는 국가 AI 투자에서 평가 과정을 외부에서 검증할 수 있는 정보가 부족하다는 점은 실제 정책적 문제로 남는다.

코딩하는 상인