이 글 어땠어요?
GLM-5.3-Flash는 MIT라 받아서 고치고 팔 수 있습니다. Qwen3.8-Flash-Next는 Qwen Community License 1.0으로, 모델 API 사업이나 코딩·사무용 AI 도구 사업에 쓰려면 매출과 상관없이 알리바바에서 별도 라이선스를 받게 돼 있고 외부에 내보이지 않는 사내 사용은 예외입니다.
Max 라이선스는 같은 사업을 하는 회사 가운데 계열사 합산 연 매출이 5,000만 달러를 넘는 곳에만 별도 계약을 요구했습니다. Flash-Next 라이선스에서는 이 금액 단서가 빠졌고, 월간 사용자 1억 명이나 월매출 2,000만 달러를 넘는 서비스에 모델 이름을 표시하게 하는 조항은 같습니다.
Artificial Analysis가 출시 할인가로 잰 값입니다. 발표 직후 Z.ai 가격표에는 정가(100만 토큰당 입력 0.15달러, 출력 0.50달러)의 절반인 할인가가 붙어 있었고, 정가로 돌리면 과제당 비용은 그 두 배입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
알리바바가 8월 14일 Qwen3.8-27B 가중치를 Apache 2.0으로 공개했습니다. 파라미터 수와 구조가 4월 Qwen3.6-27B와 똑같은데 DeepSWE는 13.3에서 42.2로 올랐고, 4비트 판은 24GB 그래픽카드에 들어갑니다.

알리바바가 8월 3일 Qwen3.8-Max를 공개하고 다음 주 가중치를 풀겠다고 밝혔습니다. 사람이 고르는 아레나 프런트엔드 코드 순위에서 1,668점으로 4위에 올랐지만, 자체 비교표에는 그보다 위에 있는 Opus 5와 Kimi K3가 빠져 있습니다.
Z.ai가 8월 14일 공개한 GLM-5.3은 전작과 같은 743B 기반 모델에 후속 학습만 한 달 더한 모델입니다. 코딩 에이전트 평가 DeepSWE는 46.2에서 66.9로, 취약점 탐지 CyberGym은 77.2%에서 84.5%로 올랐고, 가중치는 2주 뒤 공개하겠다고 했습니다.

알리바바가 8월 14일 Qwen3.8-27B 가중치를 Apache 2.0으로 공개했습니다. 파라미터 수와 구조가 4월 Qwen3.6-27B와 똑같은데 DeepSWE는 13.3에서 42.2로 올랐고, 4비트 판은 24GB 그래픽카드에 들어갑니다.
알리바바가 8월 3일 Qwen3.8-Max를 공개하고 다음 주 가중치를 풀겠다고 밝혔습니다. 사람이 고르는 아레나 프런트엔드 코드 순위에서 1,668점으로 4위에 올랐지만, 자체 비교표에는 그보다 위에 있는 Opus 5와 Kimi K3가 빠져 있습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@Alibaba_QwenX 게시물 · 원문 보기
Qwen3.8-Flash-Next는 완성된 주력 모델로 나오지 않았습니다. Qwen은 공식 X 계정에서 이 모델을 Qwen4 구조의 초기 미리보기라고 소개했고, 모델 카드의 설정 파일에 적힌 구조 이름도 Qwen4Exp입니다. 같은 가중치에 100만 토큰 기본 문맥과 내장 도구를 더한 상용판은 Qwen3.8-Flash라는 이름으로 자사 API 서비스 Qwen Cloud에서 100만 토큰당 입력 0.16달러, 출력 0.47달러에 곧 내놓겠다고 알렸고, 발표 당일 가격표에 그 값이 올라왔습니다.
GLM-5.3-Flash는 GLM-5 계열에서 처음으로 텍스트와 이미지, 영상을 한 모델이 함께 받는 모델입니다. Z.ai는 발표문에서 여러 평가와 실제 작업에서 전작 GLM-5.2를 앞서면서 가격은 10분의 1이고, 코딩과 에이전트 평가에서는 Claude Opus 4.8에 다가섰다고 적었습니다. 두 모델의 기본 사양은 이렇습니다.
| 항목 | Qwen3.8-Flash-Next | GLM-5.3-Flash |
|---|---|---|
| 전체 / 토큰당 활성 파라미터 | 125B / 6B (N-gram 표 51B 별도) | 320B / 18B |
| 레이어 구성 | 48개 (선형 36, 희소 어텐션 12) | 45개 (선형 34, 희소 어텐션 11) |
| 기본 문맥 | 26만 2,144토큰 (100만까지 확장) | 100만 토큰 |
| 입력 | 텍스트·이미지·영상 | 텍스트·이미지·영상 |
| API 가격 (100만 토큰, 입력 / 출력) | 0.16달러 / 0.47달러 (API명 Qwen3.8-Flash) | 0.15달러 / 0.50달러 (정가) |
| 라이선스 | Qwen Community License 1.0 | MIT |
두 회사가 겨냥한 비용은 긴 문맥입니다. 일반 어텐션은 토큰마다 앞선 토큰 전부와 관계를 계산해서, 문맥 전체를 읽는 계산량이 문맥 길이의 제곱으로 늘어납니다. 문맥이 두 배가 되면 읽는 데 드는 어텐션 계산은 네 배가 되고, 에이전트가 코드 저장소와 문서, 도구 실행 기록을 몇십만 토큰씩 들고 다니는 요즘에는 이 비용이 서비스 원가를 정합니다.
선형 어텐션은 지나간 문맥을 크기가 정해진 상태 하나에 계속 눌러 담아 비용을 문맥 길이에 비례하게 만듭니다. 대신 앞에 나온 구절을 글자 그대로 다시 찾는 일에 약해서, 두 회사 모두 레이어 넷 가운데 하나에는 문맥을 직접 살피는 어텐션을 남겼습니다. 이 3 대 1 배치는 새롭지 않고, 8월 14일 Apache 2.0으로 나온 Qwen3.8-27B도 64개 레이어 가운데 48개가 선형 어텐션(Gated DeltaNet)이었습니다.
두 모델이 새로 택한 것은 선형 어텐션과 희소 어텐션의 조합입니다. Qwen은 남겨 둔 일반 어텐션 레이어를 중요한 부분만 골라 보는 희소 어텐션으로 바꿨고, Z.ai는 GLM 시리즈에서 처음으로 선형 어텐션과 희소 어텐션을 섞었습니다. 두 회사의 희소 어텐션은 모두 딥시크가 V3.2에서 선보인 DSA를 출발점으로 삼았는데, Qwen 기술 리포트는 DSA의 방식을 따른다고 적었고 GLM-5.3-Flash 설정 파일은 희소 레이어 이름을 아예 deepseek_sparse_attention으로 붙였습니다.

두 회사가 서로 다르게 푼 문제는 고르는 비용입니다. DSA는 가벼운 인덱서로 토큰마다 점수를 매겨 볼 곳을 고르는데, 문맥이 길어지면 이 인덱서의 계산도 문맥 길이의 제곱으로 불어납니다. Qwen은 토큰을 작은 덩어리로 묶어 덩어리 단위로 점수를 매기는 Qwen Sparse Attention을 만들었고, Z.ai는 인덱서가 쓰는 키 벡터 네 개를 하나로 합치는 IndexPool을 넣었습니다.
Qwen이 잰 절감 폭은 문맥 길이에 따라 크게 달랐습니다. 커널만 재면 100만 토큰에서 일반 어텐션보다 프리필(입력 문맥을 읽는 단계)이 7.6배, 디코드(답을 한 토큰씩 만드는 단계)가 4.9배 빨랐습니다. 캐시 적중률 90%를 가정한 서비스 기준 처리량은 직전 주력 Qwen3.7-Plus 대비 100만 토큰에서 8.6배였지만, 16K와 32K 토큰에서는 2.1배 안팎이었습니다.

Z.ai는 100만 토큰 기준으로 GLM-5.3과 견줘 어텐션 계산이 3.0배, KV 캐시(앞서 읽은 토큰의 계산 결과를 담아 두는 메모리)가 4.4배 줄었다고 밝혔습니다. 비교한 모델 가운데 어텐션 계산은 가장 적었지만, KV 캐시는 아직 Kimi-K3와 DeepSeek-V4-Flash보다 조금 크다는 문장도 발표문에 함께 적었습니다.

학습 비용도 두 회사 모두 줄였습니다. Qwen은 직전 주력(397B, 활성 17B)보다 활성 파라미터 3분의 1, 학습 토큰 3분의 1, 학습 연산 약 9분의 1로 기반 모델을 만들었고, 사전학습 평가 14개 가운데 8개에서 앞서고 나머지는 2.6점 안쪽으로 뒤졌다고 적었습니다. GLM-5.3-Flash는 새로 학습한 기반 모델에 30조 토큰 규모의 멀티모달 사전학습 데이터를 썼고, 비슷한 크기의 GLM-4.5(355B)와 견주면 활성 파라미터는 32B에서 18B로, 레이어는 92개에서 45개로 줄었습니다.
두 회사가 낸 점수는 모두 자체 측정입니다. Qwen이 모델 카드에 올린 표에서는 코딩 에이전트 평가 DeepSWE 1.1이 직전 주력 Qwen3.7-Plus의 16.5에서 58.7로 올랐고, 휴대폰 화면을 조작하는 AndroidWorld는 84.5로 Opus 4.6 Max의 62.0보다 높았습니다.
| 평가 | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | 비교 모델 |
|---|---|---|---|---|
| DeepSWE 1.1 (코딩 에이전트) | 58.7 | 42.2 | 16.5 | DeepSeek-V4-Flash 54.4 |
| SWE-bench Pro (저장소 버그 수정) | 62.5 | 61.7 | 55.8 | Opus 4.6 Max 53.4 |
| NL2Repo-Bench (저장소 통째로 만들기) | 48.1 | 42.3 | 41.1 | DeepSeek-V4-Flash 54.2 |
| HLE (다분야 난제) | 35.9 | 30.8 | 34.7 | Opus 4.6 Max 40.0 |
| AndroidWorld (모바일 조작) | 84.5 | 81.9 | 81.0 | Opus 4.6 Max 62.0 |
Z.ai의 표에는 GLM-5.2와 Opus 4.8, GPT-5.6 Terra, 8월 13일 나온 Gemini 3.7 Flash가 함께 올라 있습니다. GLM-5.3-Flash는 44개 직업의 실무를 재는 GDPval-AA에서 가장 높았지만, 터미널 작업(Terminal Bench 2.1)에서는 세 모델에 모두 뒤졌고 코딩 에이전트(DeepSWE 1.1)에서는 Opus 4.8을 앞선 대신 GPT-5.6 Terra와 Gemini 3.7 Flash에 뒤졌습니다.
| 평가 | GLM-5.3-Flash | GLM-5.2 | Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 84.3 | 81.0 | 85.0 | 87.4 | 85.8 |
| DeepSWE 1.1 | 63.4 | 46.2 | 58.0 | 69.6 | 65.3 |
| AutomationBench | 48.8 | 26.2 | 41.0 | 37.2 | 52.3 |
| GDPval-AA v2 | 1773 | 1504 | 1582 | 1571 | 1527 |
같은 DeepSWE 1.1이라도 두 회사의 측정 조건은 다릅니다. Qwen은 Claude Code와 mini-SWE-agent 두 하네스(모델에 도구를 쥐여 주고 실행 결과를 돌려주는 실행 틀)로 잰 뒤 높은 쪽을 적었고, Z.ai는 mini-swe-agent 하나로 쟀습니다. SWE-bench Pro도 Qwen 표에서 Opus 4.6 Max만 앤트로픽이 공개한 점수이고, 나머지는 알리바바가 문제를 고친 판에서 다시 잰 값입니다.
싼 값의 대가는 토큰 수로 나타났습니다. Z.ai가 Claude Code 위에서 돌린 자체 코딩 평가를 보면, GLM-5.3-Flash는 추론 강도를 최대로 올렸을 때 29.0점으로 Opus 4.8(29.5점)과 비슷했지만 과제 하나에 출력 토큰을 14만 개 가까이 썼습니다. 한 단계 아래 설정에서는 7만 개 안팎으로 28점 언저리를 냈으니, 마지막 1점을 얻는 데 토큰이 두 배로 든 모양입니다.

Artificial Analysis의 8월 26일자 종합 지수(v4.1.1)에서 GLM-5.3-Flash는 57점을 과제당 0.045달러에 냈습니다. Z.ai는 이 수준의 지능이 전에는 약 10배 비용에서만 가능했다고 적었는데, 0.045달러는 출시 할인가로 잰 값입니다. 발표 직후 Z.ai 가격표에는 정가(입력 0.15달러, 출력 0.50달러)의 절반인 할인가가 붙어 있었고, 정가로 돌리면 과제당 비용은 그 두 배가 됩니다. 같은 도표에서 58점 안팎의 Qwen3.8-Max는 과제당 1달러를 넘었고, Qwen3.8-Flash는 아직 올라 있지 않았습니다.
GLM-5.3-Flash는 공개 6일 전부터 이미 쓰이고 있었습니다. 8월 20일 OpenRouter와 OpenCode에 Ox Alpha라는 모델이 제작사 표기 없이 무료로 올라왔고, OpenRouter 집계로 8월 20일부터 25일까지 6일 동안 토큰 23조 2,000억 개를 처리해 2위 DeepSeek-V4-Flash(9조 9,000억 개)의 2.3배를 기록했습니다. 코딩 도구 OpenCode의 7일 집계에서도 43조 개로 1위였습니다.

정체는 사용자들이 먼저 찾아냈습니다. 토크나이저 검사 95개가 모두 GLM-5 어휘와 맞았고, 일부러 잘못된 요청을 넣자 Z.ai의 옛 이름인 즈푸의 API 경로가 응답에 드러났습니다. Z.ai는 8월 26일 발표문에서 사용자 반응을 모으려고 익명으로 시험했으며, 그 트래픽을 모두 중국산 AI 칩으로 처리했다고 밝혔습니다.
중국산 칩은 칩 한 장의 메모리 용량과 대역폭이 모자라서, 100만 토큰 문맥을 받으려면 이 부족을 메워야 합니다. Z.ai는 SGLang 위에 이 구조 전용 추론 엔진을 짓고 가중치와 캐시를 8비트 중심으로 줄였으며, 입력 인코딩과 프리필, 디코드를 서로 다른 작업자 풀로 나눠 돌렸습니다. 같은 하드웨어에서 처음보다 종단 성능을 3배 올려 토큰당 원가가 주류 엔비디아 GPU와 비슷해졌다는 것이 회사 설명이고, 커널 작업에는 GLM-5.3 기반 인프라 에이전트가 엔지니어를 도왔다고 적었습니다.
알리바바의 라이선스는 이번 한 번에 달라진 것이 아닙니다. 8월 들어 두 번에 걸쳐 조건이 붙었고, 같은 기간 작은 모델은 계속 Apache 2.0으로 나왔습니다.
| 공개일 | 모델 | 라이선스 | 별도 계약 조건 |
|---|---|---|---|
| 4월 22일 | Qwen3.6-27B | Apache 2.0 | 없음 |
| 8월 12일 | Qwen3.8-Max 가중치 | Qwen3.8-Max License | 모델 API·AI 업무 도구 사업자 가운데 계열사 합산 연 매출 5,000만 달러 초과 |
| 8월 14일 | Qwen3.8-27B | Apache 2.0 | 없음 |
| 8월 26일 | Qwen3.8-Flash-Next | Qwen Community License 1.0 | 모델 API·AI 업무 도구 사업이면 매출과 상관없이 |
| 8월 26일 | GLM-5.3-Flash | MIT | 없음 |
두 문서를 대조하면 달라진 곳은 두 번째 조항의 금액 단서 하나입니다. 2주 전 Qwen3.8-Max 가중치에 붙은 라이선스는 모델 API나 AI 업무 도구 사업을 하는 회사 가운데 계열사 합산 연 매출이 5,000만 달러를 넘는 곳에만 별도 계약을 요구했는데, 이번 문서에서는 그 단서가 빠졌습니다. 월간 사용자 1억 명이나 월매출 2,000만 달러를 넘는 서비스가 화면에 모델 이름을 밝히라는 첫 번째 조항은 두 문서에 똑같이 들어 있습니다.
계약 대상은 두 가지로 정의돼 있습니다. 모델 API 사업은 제3자가 입력과 설정, 학습 데이터를 직접 다루며 모델 추론이나 미세조정을 쓸 수 있게 여는 사업이고, 다른 회사가 호스팅하는 모델에 요청을 넘겨주기만 하는 경우는 빠집니다. AI 업무 도구는 AI 코딩이나 사무 생산성을 주목적으로 만든 독립 제품으로, 라이선스는 그 예로 알리바바 자사 제품인 Qoder와 QwenWork를 들었습니다. 번역기 같은 단일 목적 도구, 타오바오 쇼핑 도우미처럼 다른 분야의 도우미, 코딩이 주목적이 아닌 제품 안의 AI 기능은 대상에서 빠지고, 외부에 내보이지 않는 사내 사용도 계약 없이 쓸 수 있습니다.
조항에 걸리는 두 사업은 알리바바가 직접 하는 사업과 겹칩니다. 모델 API는 Qwen Cloud가 파는 상품이고, 코딩·사무 도구는 라이선스가 예로 든 Qoder와 QwenWork가 있는 시장입니다. 8월 초 로이터는 Qwen이 대형 기업에 수익 공유를 요구할 계획이라고 보도한 바 있습니다.
오픈소스 진영에서 이런 조항은 처음이 아닙니다. 2021년 1월 14일 검색엔진 회사 엘라스틱은 Elasticsearch와 Kibana의 라이선스를 Apache 2.0에서 SSPL과 자체 라이선스로 바꾸면서, 클라우드 사업자가 기여 없이 자사 제품을 서비스로 파는 것을 막겠다고 밝혔고 아마존의 Elasticsearch 서비스를 직접 거명했습니다. 3개월 뒤인 4월 12일 AWS는 마지막 Apache 2.0 판을 갈라 OpenSearch를 내놓았습니다. 알리바바는 같은 세대의 27B를 Apache 2.0으로 남겨 두어, 조건 없는 대안을 스스로 내놓은 상태입니다.
중국 안에서도 방향은 한쪽으로 모이지 않았습니다. 7월 텐센트는 한국과 EU, 영국을 사용 지역에서 빼던 라이선스를 Hy3에서 Apache 2.0으로 바꿨고, 문샷AI는 7월 27일 Kimi K3 가중치를 올린 날 어텐션 커널과 MoE 통신 라이브러리, 에이전트 환경 도구를 모두 MIT로 풀었습니다. Z.ai는 이번에도 MIT를 유지했고, GLM-5.3-Flash를 GLM Coding Plan 구독에 넣어 GLM-5.3보다 3배 많이 쓸 수 있게 했습니다.
국내 기업이 Qwen3.8-Flash-Next를 사내에서만 돌린다면 계약 없이 쓸 수 있습니다. 이 모델을 올려 다른 회사에 API로 팔거나, 이 모델로 코딩 도우미나 사무용 AI 도구를 독립 제품으로 만들어 팔면 회사 규모와 상관없이 알리바바와 따로 계약을 맺게 돼 있습니다. 조건 없이 쓰려는 팀에는 MIT인 GLM-5.3-Flash와 Apache 2.0인 27B가 남는데, 27B는 같은 표에서 SWE-bench Pro가 61.7로 0.8점 차이였지만 DeepSWE는 42.2로 16.5점 뒤졌습니다.
MIT로 풀린 가중치는 거둬들일 수 없습니다. 영국 AI보안연구소(AISI)는 7월 오픈웨이트와 폐쇄형 모델의 사이버 역량 차이를 잰 분석에서 GLM-5.2를 측정 시점에 사이버 역량이 가장 높은 오픈웨이트 모델로 꼽았고, 좁은 공격 과제에서는 4개월 먼저 나온 Opus 4.6, 32단계 기업망 공격 시나리오에서는 7개월 먼저 나온 Opus 4.5와 비슷하다고 적었습니다. 이 평가는 안전장치에 거의 막히지 않았다고도 밝혔습니다.
마지막으로 남은 변수는 연산으로, Ox Alpha의 무료 제공은 발표일에 끝났고 유료로 넘어간 뒤에도 같은 처리량과 응답 속도가 나오는지는 아직 확인되지 않았습니다. 7월에는 문샷AI가 Kimi K3 공개 48시간 만에 신규 구독을 멈춘 일이 있었습니다. Qwen 기술 리포트가 커널 속도를 엔비디아 GPU에서 잰 것과 달리 Z.ai는 서빙 전체를 중국산 칩에 올렸다고 밝혔으니, GLM-5.3-Flash의 유료 구간 응답 속도가 그 주장을 가장 먼저 시험하게 됩니다.
읽어 주셔서 고맙습니다.
초이 드림