# 24GB 그래픽카드에 들어가는 'Opus급', 알리바바 Qwen3.8-27B
_자체 평가 SWE-bench Pro에서 61.7점으로 Claude Opus 4.6 Max(53.4점)를 앞섰고, 4비트 파일은 17.1GB입니다. 비교 상대 Opus 4.6은 2월 모델이고, 알리바바는 5월 자사 표에서 같은 모델에 57.3점을 적었습니다._
- 매체: 초이의 뉴스레터 · 소식
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-08-15T12:00
- 링크: https://choi-newsletter.com/post/news-qwen38-27b-local-frontier-agent
- 답하는 질문: Qwen3.8-27B 로컬에서 돌릴 수 있나
- 직답: Qwen3.8-27B는 4비트 파일이 17.1GB라 24GB 그래픽카드 한 장에 들어가고, Apache 2.0이라 상업 제품에도 넣을 수 있습니다.
- 출처: Hugging Face, Qwen/Qwen3.8-27B 모델 카드 (https://huggingface.co/Qwen/Qwen3.8-27B), GitHub, QwenLM/Qwen3.8 (https://github.com/QwenLM/Qwen3.8), Qwen 블로그, Qwen3.8-Max (2026년 8월 3일) (https://qwen.ai/blog?id=qwen3.8), Qwen 블로그, Qwen3.7-Max (2026년 5월 20일) (https://qwen.ai/blog?id=qwen3.7), Hugging Face, Qwen/Qwen3.6-27B 모델 카드 (https://huggingface.co/Qwen/Qwen3.6-27B), Qwen3.8-Max License (Qwen3.8-2.4T-A95B) (https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B/blob/main/LICENSE), Unsloth, Qwen3.8 로컬 실행 가이드 (https://unsloth.ai/docs/models/qwen3.8), Unsloth, Qwen3.8-27B GGUF (https://huggingface.co/unsloth/Qwen3.8-27B-GGUF), SGLang 쿡북, Qwen3.8-27B (https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B), vLLM 레시피, Qwen3.8-27B (https://recipes.vllm.ai/Qwen/Qwen3.8-27B), The ATOM Report (arXiv 2604.07190) (https://arxiv.org/abs/2604.07190), Anthropic, Claude Opus 4.6 (2026년 2월 5일) (https://www.anthropic.com/news/claude-opus-4-6), Anthropic, Claude Opus 5 (2026년 7월 24일) (https://www.anthropic.com/news/claude-opus-5), NVIDIA, DGX Spark 사양 (https://www.nvidia.com/en-us/products/workstations/dgx-spark/), AI타임스, GPT-3 찬반 논란 (2020년 7월 27일) (http://www.aitimes.com/news/articleView.html?idxno=131045)
> 알리바바가 8월 14일 Qwen3.8-27B 가중치를 Apache 2.0으로 공개했습니다. 파라미터 수와 구조가 4월 Qwen3.6-27B와 똑같은데 DeepSWE는 13.3에서 42.2로 올랐고, 4비트 판은 24GB 그래픽카드에 들어갑니다.

알리바바가 8월 14일(한국 시각 15일 자정 무렵) 270억 개(27B) 파라미터 모델 Qwen3.8-27B의 가중치를 허깅페이스와 모델스코프에 Apache 2.0 라이선스로 올렸습니다. 자체 평가에서 실제 저장소의 버그를 고치는 SWE-bench Pro 61.7점을 받아 앤트로픽의 Claude Opus 4.6 Max(53.4점)를 앞섰고, 4비트로 줄인 파일은 17.1GB라 24GB 그래픽카드 한 장에 들어갑니다. 누구나 내려받아 고치고 상업 제품에 넣을 수 있는 조건입니다.

모델 카드는 Qwen3.8을 지금까지 나온 Qwen 오픈 모델 가운데 가장 뛰어난 세대라고 소개하고, 27B는 그 성능을 배포하기 쉬운 크기의 Dense 모델(모든 파라미터를 토큰마다 계산에 쓰는 구조)에 담았다고 적었습니다. 이미지와 영상을 함께 읽고, 기본 문맥은 26만 2,144토큰이며 100만 토큰까지 늘릴 수 있습니다. 생각 모드가 기본으로 켜져 있고, 추론 강도는 요청마다 xhigh·medium·low 가운데 고릅니다.

가중치와 함께 돌리는 도구도 같은 날 준비됐습니다. Unsloth가 공개 당일 여러 비트의 GGUF 파일을 올렸고, vLLM과 SGLang, AMD가 실행을 지원했습니다. 개발자는 실행 방법을 따로 찾을 필요 없이 받은 날 바로 자기 장비와 사내 API 서버에 붙일 수 있었습니다.

11일 전인 8월 3일 알리바바는 총 2.4조 파라미터의 [Qwen3.8-Max](/post/news-qwen38-max-open-weight)를 발표하면서 Max급 가중치를 처음 공개하겠다고 밝혔고, 그 가중치는 8월 12일 Qwen3.8-2.4T-A95B라는 이름으로 올라왔습니다. Unsloth 집계로 원본 파일만 4.9TB라 개인이나 대부분의 기업이 돌리기 어려운 크기입니다. 같은 세대에서 소비자 장비에 올라가는 크기로 나온 모델이 27B입니다.

## 2월에 나온 Opus와 견준 점수표

알리바바가 모델 카드에 비교 상대로 올린 모델은 전작 Qwen3.6-27B, 자사 API 모델 Qwen3.7-Plus, 메타의 Muse Glimmer-30B, 앤트로픽의 Opus 4.6 Max입니다. 자주 인용되는 항목을 추리면 아래와 같습니다.

| 평가 | Qwen3.8-27B | Qwen3.6-27B | Opus 4.6 Max |
| --- | --- | --- | --- |
| SWE-bench Pro (저장소 버그 수정) | **61.7** | 53.5 | 53.4 |
| Terminal-Bench 2.1 (터미널 작업) | 73.0 | 63.4 | **78.2** |
| NL2Repo-Bench (저장소 통째로 만들기) | 42.3 | 36.2 | **47.6** |
| OSWorld-Verified (데스크톱 조작) | **84.3** | 63.9 | 72.7 |
| AndroidWorld (모바일 조작) | **81.9** | 70.3 | 62.0 |
| IFBench (지시 따르기) | **79.5** | 69.1 | 62.5 |
| GPQA Diamond (과학 추론) | 89.2 | 87.8 | **91.3** |
| HLE (다분야 난제) | 30.8 | 24.0 | **40.0** |

27B가 앞선 곳은 저장소를 고치는 일과 데스크톱·모바일 화면을 조작하는 일, 지시를 그대로 따르는 일입니다. 터미널 작업(5.2점 차)과 저장소를 통째로 만드는 일(5.3점 차), 과학 추론(2.1점 차), 여러 분야의 난제를 모은 HLE(9.2점 차)에서는 Opus 4.6 Max가 앞섰습니다. 저장소와 화면을 오가며 여러 단계를 끝내는 에이전트 작업에서 격차가 가장 빨리 줄었습니다. 이미지를 읽는 평가에서도 문서 인식 OmniDocBench 1.5가 91.1점으로 Opus 4.6 Max(86.6점)보다 높았습니다.

크기가 비슷한 오픈 모델과는 차이가 더 났습니다. 4일 전인 8월 10일 메타가 Apache 2.0으로 푼 [Muse Glimmer](/post/news-meta-muse-glimmer-open-weights)(296억 개)는 같은 표에 점수가 있는 여덟 항목에서 모두 27B보다 낮았고, SWE-bench Pro는 51.2점, 터미널 작업은 51.7점, 데스크톱 조작은 65.9점이었습니다.

표 아래 각주에는 조건이 붙어 있습니다. SWE-bench Pro는 Opus 4.6 Max만 앤트로픽이 공식 발표한 점수를 가져왔고, 나머지 모델은 알리바바가 문제가 있던 과제를 고친 판에서 Claude Code 하네스(모델에 도구를 쥐여 주고 실행 결과를 되돌려 주는 실행 틀)로 다시 쟀습니다. 61.7점과 53.4점은 같은 시험지에서 나온 숫자가 아닙니다.

알리바바 자신도 5월에는 다른 숫자를 적었습니다. 5월 20일 Qwen3.7-Max를 발표할 때 알리바바는 모든 비교 모델을 고친 판에서 다시 쟀다며 Opus 4.6 Max의 SWE-bench Pro를 57.3점으로 표에 올렸는데, 이번 27B 표에는 그보다 3.9점 낮은 공식 점수 53.4점을 넣었습니다. 5월 숫자를 그대로 쓰면 27B의 우위는 8.3점에서 4.4점으로 줄어듭니다.

비교 상대가 나온 시점도 표에는 없습니다. Opus 4.6은 앤트로픽이 2월 5일 내놓은 모델이고, 그 뒤로 Opus 4.7과 4.8이 나왔으며 7월 24일에는 Opus 5가 공개됐습니다. 알리바바가 11일 전 Qwen3.8-Max 발표문에서 비교 상대로 올린 앤트로픽 모델은 Opus 4.8이었습니다.

자사 모델끼리의 비교는 조건이 같습니다. 27B의 SWE-bench Pro 61.7점은 같은 표의 Qwen3.7-Plus(57.6점)보다 높고, 같은 조건으로 Qwen3.8-Max 모델 카드에 실린 5월의 유료 플래그십 Qwen3.7-Max(60.6점)도 넘습니다. 무료로 푼 27B가 3개월 전 자사 API 최상위 모델보다 저장소 수정 점수에서 앞섰습니다.

## 구조는 4월 모델과 똑같습니다

전작 Qwen3.6-27B는 4월 22일에 나왔습니다. 두 모델 카드의 설정을 대조하면 레이어 64개와 은닉 차원 5,120, 레이어 배치가 같고, 파라미터 수는 27,781,427,952개로 숫자 하나까지 같습니다. 구조와 크기가 같으니 4개월 사이의 차이는 학습에서 나왔고, 알리바바는 그 학습법을 공개하지 않았습니다.

| 평가 | Qwen3.6-27B (4월) | Qwen3.8-27B (8월) |
| --- | --- | --- |
| DeepSWE 1.1 | 13.3 | 42.2 |
| QwenSWEBench (자체) | 49.3 | 79.0 |
| OSWorld-Verified | 63.9 | 84.3 |
| JobBench | 21.8 | 33.4 |
| Terminal-Bench 2.1 | 63.4 | 73.0 |
| SWE-bench Pro | 53.5 | 61.7 |

가장 크게 오른 항목은 코딩 에이전트 평가 DeepSWE로, 13.3에서 42.2로 3.2배가 됐습니다. 모델 카드는 개선점으로 자율 계획과 환경 피드백 처리, 널리 쓰는 하네스·개발 도구와의 호환을 들었고, 코딩 점수 대부분을 Claude Code 하네스에서 쟀다고 적었습니다. 같은 세대 Max 발표문에는 강화학습 환경을 과제(한 개에서 여러 날짜리까지)와 작업 공간, 하네스 세 방향으로 늘렸다는 설명이 있지만, 27B에 무엇을 얼마나 적용했는지는 나와 있지 않습니다.

7월 31일 딥시크 V4-Flash 정식판도 구조와 크기를 그대로 둔 채 코딩 에이전트 점수를 7.3에서 54.4로 올렸습니다.

## 24GB 카드에 들어가는 이유

6년 전 최상위 언어 모델은 사정이 달랐습니다. 2020년 7월 오픈AI의 GPT-3(1,750억 개)는 개인 베타를 신청한 소수만 API로 쓸 수 있었습니다. 지금 27B는 원본 BF16 파일이 55.59GB이고, 공개 당일 Unsloth가 올린 4비트 판(Q4_K_M)은 17.11GB였습니다.

양자화는 가중치 하나에 쓰는 비트 수를 줄여 파일을 작게 만드는 방법입니다. BF16(가중치 하나에 16비트, 원본)을 8비트로 줄이면 절반, 4비트(가중치 하나를 16가지 값 가운데 하나로 저장)로 줄이면 약 4분의 1이 됩니다. Unsloth는 공개 당일 4비트 판이 RAM과 VRAM을 합쳐 17~19GB면 돌아가고, RTX 4090이나 RTX 5080, 메모리 24GB 맥에서 쓸 수 있다고 안내했습니다.

![Unsloth의 Qwen3.8-27B 로컬 실행 안내. 17GB 메모리에서 돌아간다는 소개와 2비트 11~13GB, 3비트 13~16GB, 4비트 17~19GB, 6비트 24GB, 8비트 31GB, BF16 56GB의 필요 메모리 표, 양자화 수준별 원본 일치율 그래프, 모델 카드 점수표가 담겨 있습니다.](/figures/vault/news-qwen38-27b-local-frontier-agent/qwen38-unsloth-local-17gb.png)

긴 문맥을 담는 비용은 구조에서 줄었습니다. 64개 레이어 가운데 48개는 Gated DeltaNet이라는 선형 어텐션으로, 지나간 토큰을 전부 저장하는 대신 크기가 고정된 상태 하나를 계속 고쳐 씁니다. 지나간 토큰을 저장하는 KV 캐시는 나머지 16개 레이어에만 필요한데, SGLang 쿡북 계산으로 토큰 하나에 65.5KB(bf16)이고 8비트로 저장하면 32.8KB입니다. 모든 레이어가 같은 방식의 어텐션이었다면 토큰마다 네 배가 들었습니다.

이 숫자로 계산하면 24GB 카드에 17.1GB 파일을 올리고 남는 6~7GB에 bf16 기준 문맥 10만 토큰 안팎이 들어갑니다. KV 캐시를 8비트로 두면 그 두 배입니다. 모델이 지원하는 26만 토큰을 다 채우면 8비트 KV 캐시로도 가중치와 합쳐 25GB가 넘어, 32GB급 카드가 필요합니다.

32GB 카드의 실측도 나왔습니다. SGLang 쿡북은 NVFP4(엔비디아 블랙웰 칩이 지원하는 4비트 형식) 가중치가 약 16.5GB라 RTX 5090급에 권장하고, 공식 FP8 판(약 28.5GB)은 32GB 카드에서 동시 요청 두 개까지만 받는다고 적었습니다. RTX 5090 한 장에서 NVFP4와 추측 디코딩(작은 헤드가 다음 토큰 여러 개를 미리 짐작하고 본 모델이 검증하는 방식)을 쓰면 사용자 한 명당 초당 144.5~152.9토큰이 나왔습니다.

생성 속도는 메모리 대역폭이 정합니다. Dense 모델은 토큰 하나를 만들 때마다 가중치 전체를 한 번씩 읽어서, 초당 토큰 수의 상한은 메모리 대역폭을 파일 크기로 나눈 값에 가깝습니다. RTX 5090(대역폭 초당 1,792GB)에 16.5GB짜리 NVFP4 판을 올리면 상한이 초당 약 109토큰인데, 추측 디코딩은 가중치를 한 번 읽을 때 토큰 여러 개를 검증해 실측이 그 위로 올라갔습니다. 메모리가 128GB인 엔비디아 DGX Spark는 원본 BF16(55.59GB)까지 통째로 올릴 수 있지만 대역폭이 초당 273GB라, 같은 계산으로 원본의 상한은 초당 5토큰 안팎입니다. RTX 5090의 GDDR7과 DGX Spark의 LPDDR5X는 삼성전자와 SK하이닉스가 모두 만드는 메모리입니다.

한 장으로는 빠듯한 설정도 있습니다. vLLM 레시피에 따르면 RTX 5090 한 장에서 실제로 쓸 수 있는 메모리는 31.4GiB이고, NVFP4 판은 CUDA 그래프(반복 계산을 미리 기록해 두는 가속 기능)를 끄고 문맥을 3만 2,768토큰으로 잡아야 올라갔습니다.

## 회사 서버에 두는 계산

Apache 2.0이라 상업 서비스에 넣거나 사내 데이터로 추가 학습을 시키는 데 제한이 없습니다. 코드와 문서를 회사 밖으로 보낼 수 없는 금융·공공·의료 쪽 팀에는 성능표보다 이 조건이 먼저 걸립니다. 저는 반복이 많은 저장소 검색과 코드 수정, 화면 조작은 사내 27B에 맡기고, 어려운 설계와 최종 검토만 상위 API나 사람이 맡는 구성이 퍼질 것으로 봅니다. 밤새 여러 에이전트가 저장소를 점검해 수정안과 테스트 결과를 쌓아 두면, 아침에 엔지니어가 승인하는 식입니다.

추론 강도를 낮추는 일은 생각보다 계산이 복잡합니다. 모델 카드는 여러 차례 주고받는 에이전트 작업에서 추론 강도를 낮추면 한 차례 응답은 빨라지지만, 분석이 모자라 실패와 재시도가 늘어 전체 완료 시간과 토큰 사용이 오히려 늘 수 있다고 적었습니다. 사내 GPU 한 장으로 돌리는 팀에는 한 차례 응답 속도보다 작업 한 건을 끝내는 데 든 시간과 토큰이 비교 기준이 됩니다.

Dense 구조에는 비용도 따릅니다. 27B는 토큰 하나를 만들 때마다 270억 개를 모두 계산해, 같은 Qwen 계열의 MoE(전문가 혼합) 모델 Qwen3.6-35B-A3B(토큰마다 30억 개만 계산)보다 토큰당 연산이 9배 안팎 큽니다. 한 사람이 쓰는 로컬 장비에서는 단순하고 예측하기 쉬운 구조이지만, 수천 명에게 동시에 서비스할 때는 MoE보다 돈이 많이 듭니다.

국내에서는 업스테이지가 전체 250B에 활성 15B인 Solar Open 2를 H200 두 장에 올리는 구성으로 온프레미스 수요를 겨냥했습니다.

## 새 파생 모델 열 개 중 일곱 개가 Qwen

네이선 램버트와 플로리안 브란트가 4월에 낸 ATOM 보고서에 따르면, 허깅페이스에 새로 올라온 파인튜닝·파생 모델 가운데 Qwen을 바탕으로 한 비중은 2024년 1월 1%에서 2026년 2월 69%로 올랐습니다. 같은 기간 메타 Llama는 2024년 8월 44%로 정점을 찍은 뒤 11%로 내려갔습니다. Qwen 모델의 누적 내려받기는 2026년 3월 9억 4,210만 회로 Llama(4억 7,600만 회)의 두 배 가까이 됐습니다.

![2023년 11월부터 2026년 2월까지 허깅페이스 새 파생 모델의 회사별 월간 비중을 쌓은 막대그래프. 빨간색 Qwen 비중이 점점 커져 2026년 2월 69%에 이릅니다.](/figures/vault/news-qwen38-27b-local-frontier-agent/qwen38-atom-qwen-derivative-share-final.png)

파생 모델이 한 계열에 몰리면 토크나이저와 대화 형식, 도구 호출 규약도 그 계열에 맞춰집니다. 나중에 다른 계열로 옮기면 모델 파일만 바꾸는 데서 끝나지 않고, 그 규약에 맞춰 만든 파인튜닝과 도구 연결을 다시 맞추는 작업이 따라붙습니다.

알리바바는 같은 세대 두 모델에 다른 라이선스를 붙였습니다. 27B는 Apache 2.0인 반면, 8월 12일 올라온 2.4조짜리 Max급 가중치에는 자체 라이선스가 붙었습니다. 월간 사용자 1억 명이나 월매출 2,000만 달러를 넘는 상업 서비스는 화면에 모델 이름을 표시하고, 모델 API 사업이나 코딩·사무용 AI 도구 사업으로 연 매출 5,000만 달러를 넘는 회사는 별도 라이선스를 받는 조건입니다. 27B 모델 카드는 이 모델도 곧 알리바바의 Qwen Cloud에서 100만 토큰 문맥을 기본으로 한 호스팅판으로 내놓겠다고 적었습니다.

## 아직 나오지 않은 숫자

외부 기관이 같은 조건으로 잰 점수는 아직 없습니다. 4비트 판이 원본과 같은 점수를 내는지도 공개된 자료가 없는데, Unsloth가 낸 그래프는 다음 토큰을 원본과 똑같이 고르는 비율이고 SWE-bench Pro 같은 과제 점수는 아닙니다. 알리바바가 5월에 적은 57.3점과 이번에 적은 53.4점 가운데 어느 쪽이 Opus 4.6 Max의 실력에 가까운지도 외부 측정이 나와야 가려집니다.

읽어 주셔서 고맙습니다.

초이 드림
