
중국 AI 거인, 100만 토큰 컨텍스트와 오픈웨이트 공개로 판도 흔든다
알리바바가 자사 최대 규모의 AI 모델인 Qwen 3.8-Max를 정식 출시했다. 2조 4천억 개의 파라미터를 탑재한 이 모델은 오픈AI의 GPT-5.6 Sol, 앤스로픽의 Fable 5와 경쟁하는 수준의 성능을 보여주며, 특히 오픈웨이트(공개 가중치)로 제공된다는 점에서 업계에 큰 파장을 일으키고 있다.
Qwen 3.8-Max의 핵심 사양
총 파라미터: 2조 4천억 개 (2.4 trillion)
추론 시 활성 파라미터: 약 950억 개 (95 billion)
컨텍스트 윈도우: 최대 100만 토큰
아키텍처: 혼합 전문가(Mixture-of-Experts, MoE)
지원 모달리티: 텍스트, 이미지, 비디오, 문서
혼합 전문가 구조를 통해 모델 전체는 2.4조 파라미터 규모이지만, 실제 추론 시에는 약 950억 개의 파라미터만 활성화되어 효율적인 연산이 가능하다. 이는 거대 모델의 장점(성능)과 경량 모델의 장점(속도·비용)을 동시에 확보하는 설계다.
벤치마크 성능
알리바바가 공개한 주요 벤치마크 결과는 다음과 같다:
일반 추론
– GPQA Diamond: 92.6 (GPT-5.6 Sol 94.1과 근접)
– PaperBench: 93.0
– WideSearch: 81.9
코딩 및 에이전트 작업
– Terminal-Bench 2.1: 86.6 (Claude Opus 4.8의 84.6 상회)
– SWE-bench Pro: 67.7 (Fable 5의 80.0에는 미치지 못함)
– FrontierSWE: 73.5
멀티모달
– MMMU-Pro: 82.3
– OSWorld-Verified: 86.1
– VideoMME (자막 포함): 90.4
알리바바는 종합적으로 “Fable 5에 이은 2위 수준”이며, 여러 영역에서 Claude Fable 5와 GPT-5.6 Sol을 능가한다고 주장했다. 다만 일부 벤치마크는 알리바바 내부 평가 기준이며, 독립적인 제3자 검증 결과는 아직 공개되지 않았다.
오픈웨이트의 의미: 무료에서 유료로?
이번 모델의 가장 큰 특징은 Qwen-Max 등급 모델 중 처음으로 오픈웨이트가 공개된다는 점이다. 이는 개발자가 모델을 다운로드하여 자체 서버에서 호스팅하고, 파인튜닝까지 가능함을 의미한다.
그러나 로이터 통신은 알리바바가 대형 상업 사용자에 대해서는 수익 공유 계약을 요구할 계획이라고 보도했다. 이미 중국의 또 다른 AI 기업 Moonshot은 Kimi K3 모델에 대해 유사한 정책을 도입했으며, 일부 대형 상업 사용자는 매출의 최대 30%를 공유해야 할 수도 있다.
이는 중국 AI 기업들이 낮은 가격으로 시장 점유율을 확보한 뒤, 대형 고객을 대상으로 수익화하는 전략을 취하고 있음을 보여준다. 기업의 조달 담당자는 모델 라이선스를 SaaS 계약만큼 주의 깊게 검토해야 하는 시대가 되었다.
중국 AI의 약진과 글로벌 경쟁
Qwen 3.8-Max의 출시는 중국 AI 생태계의 빠른 발전을 보여주는 또 하나의 신호다. 알리바바뿐만 아니라 Moonshot의 Kimi K3, 바이두의 ERNIE 시리즈 등 중국 기업들이 잇달아 세계 수준의 모델을 내놓고 있다.
특히 중국 모델들은 가격 경쟁력이 뚜렷하다. 로이터에 따르면 Kimi K3의 토큰당 가격은 앤스로픽의 동급 모델의 약 3분의 1 수준이다. 이는 중국 기업들이 모델 성능을 끌어올리면서도 비용 우위를 유지하며 글로벌 시장을 공략하고 있음을 시사한다.
반면 미국 측에서는 오픈AI, 앤스로픽, 구글이 고성능 모델을 경쟁적으로 출시하고 있으며, 엔비디아의 AI 인프라 투자, 테슬라·스페이스X의 반도체 자체 생산(테라팹) 등 인프라 경쟁도 치열하다. AI 패권 경쟁이 모델 성능을 넘어 반도체, 데이터센터, 전력 인프라로 확대되는 양상이다.
자주 묻는 질문(FAQ)
Q. Qwen 3.8-Max는 한국어도 잘 하나요?
A. 알리바바는 다국어 지원을 강조하고 있으나, 한국어 성능에 대해서는 아직 독립적인 벤치마크가 부족합니다. 중국어와 영어에 최적화되어 있을 가능성이 높으며, 한국어 특화 작업에는 추가 파인튜닝이 필요할 수 있습니다.
Q. 오픈웨이트로 공개된다는 게 무슨 의미인가요?
A. 모델의 가중치(weights) 파일이 공개되어, 누구나 다운로드해 자체 하드웨어에서 실행할 수 있습니다. API에 의존하지 않고 로컬에서 작동하므로 데이터 프라이버시 보장과 비용 절감이 가능합니다. 다만 대형 상업 사용은 수익 공유 계약이 필요할 수 있습니다.
Q. 기존 GPT-5.6이나 Claude보다 나은 건가요?
A. 특정 벤치마크에서는 Qwen이 앞서지만, 다른 영역에서는 뒤집니다. 코딩 작업(Terminal-Bench)에서는 Claude Opus 4.8을 능가하지만, 소프트웨어 엔지니어링(SWE-bench)에서는 Fable 5에 크게 뒤처집니다. 실제 사용 목적에 따라 최적의 모델이 다를 수 있습니다.
Q. 100만 토큰 컨텍스트는 실용적인가요?
A. 이론적으로는 수백 페이지의 문서나 장시간 영상을 한 번에 처리할 수 있습니다. 다만 컨텍스트 길이가 길어질수록 비용과 처리 시간이 증가하며, 중간 내용을 놓칠 가능성도 있습니다. 실제 작업에서는 적절한 컨텍스트 길이를 선택하는 것이 중요합니다.
참고자료: MarkTechPost, The Decoder, Reuters, DataCamp, VentureBeat
