이 글 어땠어요?
공개 당일 Unsloth의 4비트 판이 17.11GB였고, Unsloth는 RAM과 VRAM을 합쳐 17~19GB면 돌아간다고 안내했습니다. 24GB RTX 4090이나 메모리 24GB 맥에서 쓸 수 있고, 남는 메모리에 담을 수 있는 문맥은 bf16 KV 캐시 기준으로 계산하면 10만 토큰 안팎입니다.
알리바바 표에서 저장소 수정과 화면 조작, 지시 따르기는 Opus 4.6 Max보다 높고 터미널 작업과 과학 추론, HLE는 낮습니다. SWE-bench Pro의 Opus 점수는 조건이 다른 공식 점수이고, Opus 4.6은 2월에 나온 모델입니다.
Apache 2.0이라 상업 이용과 수정, 재배포에 제한이 없습니다. 같은 세대의 2.4조짜리 Max급 가중치는 대형 서비스에 모델 이름 표시와 별도 라이선스 조건이 붙는 자체 라이선스입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
미스트랄이 10월 6일 1조 파라미터 Mistral Large 4 프리뷰를 공개했습니다. 아티피셜애널리시스 지수 38점으로 중국 밖 오픈 모델 1위이고, 사이버 방어를 앞세워 가중치는 레드팀 시험 뒤 10월 말 풉니다.

리플렉션 AI가 10월 5일(미국 시각) 첫 모델 Beam을 공개했습니다. GLM-5.2급 추론 점수를 3~4배 적은 연산으로 냈다고 밝혔지만, 자사 비교표에서도 GLM-5.3과 DeepSeek V4.1-Flash가 더 높습니다.
알리바바가 8월 3일 Qwen3.8-Max를 공개하고 다음 주 가중치를 풀겠다고 밝혔습니다. 사람이 고르는 아레나 프런트엔드 코드 순위에서 1,668점으로 4위에 올랐지만, 자체 비교표에는 그보다 위에 있는 Opus 5와 Kimi K3가 빠져 있습니다.

미스트랄이 10월 6일 1조 파라미터 Mistral Large 4 프리뷰를 공개했습니다. 아티피셜애널리시스 지수 38점으로 중국 밖 오픈 모델 1위이고, 사이버 방어를 앞세워 가중치는 레드팀 시험 뒤 10월 말 풉니다.
리플렉션 AI가 10월 5일(미국 시각) 첫 모델 Beam을 공개했습니다. GLM-5.2급 추론 점수를 3~4배 적은 연산으로 냈다고 밝혔지만, 자사 비교표에서도 GLM-5.3과 DeepSeek V4.1-Flash가 더 높습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
모델 카드는 Qwen3.8을 지금까지 나온 Qwen 오픈 모델 가운데 가장 뛰어난 세대라고 소개하고, 27B는 그 성능을 배포하기 쉬운 크기의 Dense 모델(모든 파라미터를 토큰마다 계산에 쓰는 구조)에 담았다고 적었습니다. 이미지와 영상을 함께 읽고, 기본 문맥은 26만 2,144토큰이며 100만 토큰까지 늘릴 수 있습니다. 생각 모드가 기본으로 켜져 있고, 추론 강도는 요청마다 xhigh·medium·low 가운데 고릅니다.
가중치와 함께 돌리는 도구도 같은 날 준비됐습니다. Unsloth가 공개 당일 여러 비트의 GGUF 파일을 올렸고, vLLM과 SGLang, AMD가 실행을 지원했습니다. 개발자는 실행 방법을 따로 찾을 필요 없이 받은 날 바로 자기 장비와 사내 API 서버에 붙일 수 있었습니다.
11일 전인 8월 3일 알리바바는 총 2.4조 파라미터의 Qwen3.8-Max를 발표하면서 Max급 가중치를 처음 공개하겠다고 밝혔고, 그 가중치는 8월 12일 Qwen3.8-2.4T-A95B라는 이름으로 올라왔습니다. Unsloth 집계로 원본 파일만 4.9TB라 개인이나 대부분의 기업이 돌리기 어려운 크기입니다. 같은 세대에서 소비자 장비에 올라가는 크기로 나온 모델이 27B입니다.
알리바바가 모델 카드에 비교 상대로 올린 모델은 전작 Qwen3.6-27B, 자사 API 모델 Qwen3.7-Plus, 메타의 Muse Glimmer-30B, 앤트로픽의 Opus 4.6 Max입니다. 자주 인용되는 항목을 추리면 아래와 같습니다.
| 평가 | Qwen3.8-27B | Qwen3.6-27B | Opus 4.6 Max |
|---|---|---|---|
| SWE-bench Pro (저장소 버그 수정) | 61.7 | 53.5 | 53.4 |
| Terminal-Bench 2.1 (터미널 작업) | 73.0 | 63.4 | 78.2 |
| NL2Repo-Bench (저장소 통째로 만들기) | 42.3 | 36.2 | 47.6 |
| OSWorld-Verified (데스크톱 조작) | 84.3 | 63.9 | 72.7 |
| AndroidWorld (모바일 조작) | 81.9 | 70.3 | 62.0 |
| IFBench (지시 따르기) | 79.5 | 69.1 | 62.5 |
| GPQA Diamond (과학 추론) | 89.2 | 87.8 | 91.3 |
| HLE (다분야 난제) | 30.8 | 24.0 | 40.0 |
27B가 앞선 곳은 저장소를 고치는 일과 데스크톱·모바일 화면을 조작하는 일, 지시를 그대로 따르는 일입니다. 터미널 작업(5.2점 차)과 저장소를 통째로 만드는 일(5.3점 차), 과학 추론(2.1점 차), 여러 분야의 난제를 모은 HLE(9.2점 차)에서는 Opus 4.6 Max가 앞섰습니다. 저장소와 화면을 오가며 여러 단계를 끝내는 에이전트 작업에서 격차가 가장 빨리 줄었습니다. 이미지를 읽는 평가에서도 문서 인식 OmniDocBench 1.5가 91.1점으로 Opus 4.6 Max(86.6점)보다 높았습니다.
크기가 비슷한 오픈 모델과는 차이가 더 났습니다. 4일 전인 8월 10일 메타가 Apache 2.0으로 푼 Muse Glimmer(296억 개)는 같은 표에 점수가 있는 여덟 항목에서 모두 27B보다 낮았고, SWE-bench Pro는 51.2점, 터미널 작업은 51.7점, 데스크톱 조작은 65.9점이었습니다.
표 아래 각주에는 조건이 붙어 있습니다. SWE-bench Pro는 Opus 4.6 Max만 앤트로픽이 공식 발표한 점수를 가져왔고, 나머지 모델은 알리바바가 문제가 있던 과제를 고친 판에서 Claude Code 하네스(모델에 도구를 쥐여 주고 실행 결과를 되돌려 주는 실행 틀)로 다시 쟀습니다. 61.7점과 53.4점은 같은 시험지에서 나온 숫자가 아닙니다.
알리바바 자신도 5월에는 다른 숫자를 적었습니다. 5월 20일 Qwen3.7-Max를 발표할 때 알리바바는 모든 비교 모델을 고친 판에서 다시 쟀다며 Opus 4.6 Max의 SWE-bench Pro를 57.3점으로 표에 올렸는데, 이번 27B 표에는 그보다 3.9점 낮은 공식 점수 53.4점을 넣었습니다. 5월 숫자를 그대로 쓰면 27B의 우위는 8.3점에서 4.4점으로 줄어듭니다.
비교 상대가 나온 시점도 표에는 없습니다. Opus 4.6은 앤트로픽이 2월 5일 내놓은 모델이고, 그 뒤로 Opus 4.7과 4.8이 나왔으며 7월 24일에는 Opus 5가 공개됐습니다. 알리바바가 11일 전 Qwen3.8-Max 발표문에서 비교 상대로 올린 앤트로픽 모델은 Opus 4.8이었습니다.
자사 모델끼리의 비교는 조건이 같습니다. 27B의 SWE-bench Pro 61.7점은 같은 표의 Qwen3.7-Plus(57.6점)보다 높고, 같은 조건으로 Qwen3.8-Max 모델 카드에 실린 5월의 유료 플래그십 Qwen3.7-Max(60.6점)도 넘습니다. 무료로 푼 27B가 3개월 전 자사 API 최상위 모델보다 저장소 수정 점수에서 앞섰습니다.
전작 Qwen3.6-27B는 4월 22일에 나왔습니다. 두 모델 카드의 설정을 대조하면 레이어 64개와 은닉 차원 5,120, 레이어 배치가 같고, 파라미터 수는 27,781,427,952개로 숫자 하나까지 같습니다. 구조와 크기가 같으니 4개월 사이의 차이는 학습에서 나왔고, 알리바바는 그 학습법을 공개하지 않았습니다.
| 평가 | Qwen3.6-27B (4월) | Qwen3.8-27B (8월) |
|---|---|---|
| DeepSWE 1.1 | 13.3 | 42.2 |
| QwenSWEBench (자체) | 49.3 | 79.0 |
| OSWorld-Verified | 63.9 | 84.3 |
| JobBench | 21.8 | 33.4 |
| Terminal-Bench 2.1 | 63.4 | 73.0 |
| SWE-bench Pro | 53.5 | 61.7 |
가장 크게 오른 항목은 코딩 에이전트 평가 DeepSWE로, 13.3에서 42.2로 3.2배가 됐습니다. 모델 카드는 개선점으로 자율 계획과 환경 피드백 처리, 널리 쓰는 하네스·개발 도구와의 호환을 들었고, 코딩 점수 대부분을 Claude Code 하네스에서 쟀다고 적었습니다. 같은 세대 Max 발표문에는 강화학습 환경을 과제(한 개에서 여러 날짜리까지)와 작업 공간, 하네스 세 방향으로 늘렸다는 설명이 있지만, 27B에 무엇을 얼마나 적용했는지는 나와 있지 않습니다.

6년 전 최상위 언어 모델은 사정이 달랐습니다. 2020년 7월 오픈AI의 GPT-3(1,750억 개)는 개인 베타를 신청한 소수만 API로 쓸 수 있었습니다. 지금 27B는 원본 BF16 파일이 55.59GB이고, 공개 당일 Unsloth가 올린 4비트 판(Q4_K_M)은 17.11GB였습니다.
양자화는 가중치 하나에 쓰는 비트 수를 줄여 파일을 작게 만드는 방법입니다. BF16(가중치 하나에 16비트, 원본)을 8비트로 줄이면 절반, 4비트(가중치 하나를 16가지 값 가운데 하나로 저장)로 줄이면 약 4분의 1이 됩니다. Unsloth는 공개 당일 4비트 판이 RAM과 VRAM을 합쳐 17~19GB면 돌아가고, RTX 4090이나 RTX 5080, 메모리 24GB 맥에서 쓸 수 있다고 안내했습니다.

긴 문맥을 담는 비용은 구조에서 줄었습니다. 64개 레이어 가운데 48개는 Gated DeltaNet이라는 선형 어텐션으로, 지나간 토큰을 전부 저장하는 대신 크기가 고정된 상태 하나를 계속 고쳐 씁니다. 지나간 토큰을 저장하는 KV 캐시는 나머지 16개 레이어에만 필요한데, SGLang 쿡북 계산으로 토큰 하나에 65.5KB(bf16)이고 8비트로 저장하면 32.8KB입니다. 모든 레이어가 같은 방식의 어텐션이었다면 토큰마다 네 배가 들었습니다.
이 숫자로 계산하면 24GB 카드에 17.1GB 파일을 올리고 남는 6~7GB에 bf16 기준 문맥 10만 토큰 안팎이 들어갑니다. KV 캐시를 8비트로 두면 그 두 배입니다. 모델이 지원하는 26만 토큰을 다 채우면 8비트 KV 캐시로도 가중치와 합쳐 25GB가 넘어, 32GB급 카드가 필요합니다.
32GB 카드의 실측도 나왔습니다. SGLang 쿡북은 NVFP4(엔비디아 블랙웰 칩이 지원하는 4비트 형식) 가중치가 약 16.5GB라 RTX 5090급에 권장하고, 공식 FP8 판(약 28.5GB)은 32GB 카드에서 동시 요청 두 개까지만 받는다고 적었습니다. RTX 5090 한 장에서 NVFP4와 추측 디코딩(작은 헤드가 다음 토큰 여러 개를 미리 짐작하고 본 모델이 검증하는 방식)을 쓰면 사용자 한 명당 초당 144.5~152.9토큰이 나왔습니다.
생성 속도는 메모리 대역폭이 정합니다. Dense 모델은 토큰 하나를 만들 때마다 가중치 전체를 한 번씩 읽어서, 초당 토큰 수의 상한은 메모리 대역폭을 파일 크기로 나눈 값에 가깝습니다. RTX 5090(대역폭 초당 1,792GB)에 16.5GB짜리 NVFP4 판을 올리면 상한이 초당 약 109토큰인데, 추측 디코딩은 가중치를 한 번 읽을 때 토큰 여러 개를 검증해 실측이 그 위로 올라갔습니다. 메모리가 128GB인 엔비디아 DGX Spark는 원본 BF16(55.59GB)까지 통째로 올릴 수 있지만 대역폭이 초당 273GB라, 같은 계산으로 원본의 상한은 초당 5토큰 안팎입니다. RTX 5090의 GDDR7과 DGX Spark의 LPDDR5X는 삼성전자와 SK하이닉스가 모두 만드는 메모리입니다.
한 장으로는 빠듯한 설정도 있습니다. vLLM 레시피에 따르면 RTX 5090 한 장에서 실제로 쓸 수 있는 메모리는 31.4GiB이고, NVFP4 판은 CUDA 그래프(반복 계산을 미리 기록해 두는 가속 기능)를 끄고 문맥을 3만 2,768토큰으로 잡아야 올라갔습니다.
Apache 2.0이라 상업 서비스에 넣거나 사내 데이터로 추가 학습을 시키는 데 제한이 없습니다. 코드와 문서를 회사 밖으로 보낼 수 없는 금융·공공·의료 쪽 팀에는 성능표보다 이 조건이 먼저 걸립니다. 저는 반복이 많은 저장소 검색과 코드 수정, 화면 조작은 사내 27B에 맡기고, 어려운 설계와 최종 검토만 상위 API나 사람이 맡는 구성이 퍼질 것으로 봅니다. 밤새 여러 에이전트가 저장소를 점검해 수정안과 테스트 결과를 쌓아 두면, 아침에 엔지니어가 승인하는 식입니다.
추론 강도를 낮추는 일은 생각보다 계산이 복잡합니다. 모델 카드는 여러 차례 주고받는 에이전트 작업에서 추론 강도를 낮추면 한 차례 응답은 빨라지지만, 분석이 모자라 실패와 재시도가 늘어 전체 완료 시간과 토큰 사용이 오히려 늘 수 있다고 적었습니다. 사내 GPU 한 장으로 돌리는 팀에는 한 차례 응답 속도보다 작업 한 건을 끝내는 데 든 시간과 토큰이 비교 기준이 됩니다.
Dense 구조에는 비용도 따릅니다. 27B는 토큰 하나를 만들 때마다 270억 개를 모두 계산해, 같은 Qwen 계열의 MoE(전문가 혼합) 모델 Qwen3.6-35B-A3B(토큰마다 30억 개만 계산)보다 토큰당 연산이 9배 안팎 큽니다. 한 사람이 쓰는 로컬 장비에서는 단순하고 예측하기 쉬운 구조이지만, 수천 명에게 동시에 서비스할 때는 MoE보다 돈이 많이 듭니다.

네이선 램버트와 플로리안 브란트가 4월에 낸 ATOM 보고서에 따르면, 허깅페이스에 새로 올라온 파인튜닝·파생 모델 가운데 Qwen을 바탕으로 한 비중은 2024년 1월 1%에서 2026년 2월 69%로 올랐습니다. 같은 기간 메타 Llama는 2024년 8월 44%로 정점을 찍은 뒤 11%로 내려갔습니다. Qwen 모델의 누적 내려받기는 2026년 3월 9억 4,210만 회로 Llama(4억 7,600만 회)의 두 배 가까이 됐습니다.

파생 모델이 한 계열에 몰리면 토크나이저와 대화 형식, 도구 호출 규약도 그 계열에 맞춰집니다. 나중에 다른 계열로 옮기면 모델 파일만 바꾸는 데서 끝나지 않고, 그 규약에 맞춰 만든 파인튜닝과 도구 연결을 다시 맞추는 작업이 따라붙습니다.
알리바바는 같은 세대 두 모델에 다른 라이선스를 붙였습니다. 27B는 Apache 2.0인 반면, 8월 12일 올라온 2.4조짜리 Max급 가중치에는 자체 라이선스가 붙었습니다. 월간 사용자 1억 명이나 월매출 2,000만 달러를 넘는 상업 서비스는 화면에 모델 이름을 표시하고, 모델 API 사업이나 코딩·사무용 AI 도구 사업으로 연 매출 5,000만 달러를 넘는 회사는 별도 라이선스를 받는 조건입니다. 27B 모델 카드는 이 모델도 곧 알리바바의 Qwen Cloud에서 100만 토큰 문맥을 기본으로 한 호스팅판으로 내놓겠다고 적었습니다.
외부 기관이 같은 조건으로 잰 점수는 아직 없습니다. 4비트 판이 원본과 같은 점수를 내는지도 공개된 자료가 없는데, Unsloth가 낸 그래프는 다음 토큰을 원본과 똑같이 고르는 비율이고 SWE-bench Pro 같은 과제 점수는 아닙니다. 알리바바가 5월에 적은 57.3점과 이번에 적은 53.4점 가운데 어느 쪽이 Opus 4.6 Max의 실력에 가까운지도 외부 측정이 나와야 가려집니다.
읽어 주셔서 고맙습니다.
초이 드림