# 복면 벗은 1위 모델 Ox Alpha, 정체는 Z.ai GLM-5.3-Flash
_8월 20일 제작사 표기 없이 무료로 풀려 OpenRouter와 OpenCode에서 사용량 1위를 한 모델입니다. 전체 320B 가운데 18B만 켜는 구조로 Artificial Analysis 종합 지수 57점을 냈고, 가중치는 MIT 라이선스로 풀렸습니다._
- 매체: 초이의 뉴스레터 · 소식
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-08-26T10:00
- 링크: https://choi-newsletter.com/post/news-glm53-flash-57-points-cheap
- 답하는 질문: Ox Alpha 정체는 무엇인가
- 직답: OpenRouter 사용량 1위 익명 모델 Ox Alpha는 Z.ai의 GLM-5.3-Flash로, 320B 중 18B만 켜는 구조로 57점을 냈습니다.
- 출처: Z.ai, GLM-5.3-Flash: Frontier Intelligence, Flash Cost (2026-08-26) (https://z.ai/blog/glm-5.3-flash), Z.ai X 발표 (2026-08-26) (https://x.com/Zai_org/status/2092616204787626030), Hugging Face, zai-org/GLM-5.3-Flash (https://huggingface.co/zai-org/GLM-5.3-Flash), Z.ai 개발자 문서, GLM-5.3-Flash (https://docs.z.ai/guides/llm/glm-5.3-flash), Z.ai 가격표 보관본 (2026-08-28, 출시 할인가 표기) (https://web.archive.org/web/20260828113309/https://docs.z.ai/guides/overview/pricing.md), Z.ai 개발자 문서, GLM Coding Plan 개요 (https://docs.z.ai/devpack/overview), Artificial Analysis X, GLM-5.3-Flash 평가 (2026-08-26) (https://x.com/ArtificialAnlys/status/2092663573021606119), OpenCode X, Ox Alpha 무료 공개 (2026-08-20) (https://x.com/opencode/status/2090544355824038300), OpenRouter X, Ox Alpha 공개 (2026-08-20) (https://x.com/OpenRouter/status/2090544970923184269), 벤 데이비스 X, DeepSWE 10문제 결과 (https://x.com/davis7/status/2090655207831298095), 테오 X, 풀리퀘스트 8건 병합 (https://x.com/theo/status/2090669658483691539), 팀 데트머스 X, 서빙 속도로 본 모델 크기 (https://x.com/Tim_Dettmers/status/2090866380484608066), Cline X, 실제 버그 비교 (2026-08-24) (https://x.com/cline/status/2091995642201842015), 세바스천 라시카 X, GLM-5.3-Flash 구조 해설 (https://x.com/rasbt/status/2092629415813365899), 탕제 X, Thoughts About Scaling Law (2026-08-19) (https://x.com/jietang/status/2089941544581403107)
> Ox Alpha는 OpenRouter에서 6일 동안 토큰 23조 2,000억 개를 처리해 2위의 2.3배를 기록했습니다. 정체를 밝힌 GLM-5.3-Flash는 과제당 0.09달러로 같은 57점 모델보다 4.4~5.7배 싸고, Z.ai는 이를 모두 중국산 칩으로 처리했다고 밝혔습니다.

Z.ai(옛 즈푸)가 8월 26일(미국 시각) GLM-5.3-Flash를 공개했습니다. 8월 20일부터 OpenRouter와 OpenCode에 제작사 표기 없이 무료로 올라와 사용량 1위를 차지한 익명 모델 Ox Alpha가 이 모델이었습니다. 전체 320B 파라미터 가운데 토큰 하나에 18B만 켜는 구조로 Artificial Analysis(AA) 종합 지수 57점을 냈고, 가중치는 MIT 라이선스로 허깅페이스에 올렸습니다.

발표 게시물은 네 줄로 요약됩니다. 경쟁력 있는 값에 선두급 성능을 내고, 100만 토큰 문맥을 받는 네이티브 멀티모달 모델이며, MIT 라이선스로 푼 320B-A18B 모델이고, Ox Alpha라는 이름으로 미리 선보이는 동안 모든 트래픽을 중국산 AI 칩에서 돌렸다는 내용입니다. 320B-A18B는 전체 3,200억 개 파라미터 가운데 토큰 하나를 처리할 때 180억 개만 골라 켜는 전문가 혼합(MoE) 구조라는 뜻으로, 가중치와 API, 코딩 구독, 에이전트 도구 ZCode, 채팅 서비스에 같은 날 모두 올렸습니다.

GLM-5.3-Flash는 GLM-5 계열에서 처음으로 텍스트와 이미지, 영상을 한 모델이 함께 받는 모델입니다. 12일 전 나온 [GLM-5.3](/post/news-glm-53-posttraining-openweight)은 기존 기반 모델에 후속 학습만 더했지만, Flash는 기반 모델부터 새로 학습했고 30조 토큰 규모의 멀티모달 사전학습 데이터를 썼습니다. Z.ai는 GLM-5.2보다 여러 평가에서 앞서면서 값은 10분의 1이고, 코딩과 에이전트 평가에서는 Claude Opus 4.8에 다가섰다고 적었습니다.

## 이름을 가린 6일

시작은 8월 20일(미국 시각) 오후였습니다. 코딩 에이전트 도구 OpenCode가 스텔스 모델 Ox Alpha를 앞으로 일주일 동안 무료로 푼다고 알렸고, 3분 뒤 여러 모델을 한 API로 묶어 파는 OpenRouter도 같은 모델을 올렸습니다. 두 곳 모두 제작사는 적지 않았습니다.

OpenCode가 내건 조건은 100만 토큰 문맥과 멀티모달 입력, 요청 데이터를 남기지 않는 처리였습니다. 사용 한도는 넉넉하게 거의 무제한으로 두고, 하루 100조 토큰을 처리할 용량이 있다고 덧붙였습니다. OpenRouter는 효율적인 코딩과 오래 이어지는 에이전트 작업, 실제 서비스용으로 만든 프런티어 모델이라고만 소개했습니다.

반응은 몇 시간 만에 나왔습니다. 개발자 벤 데이비스는 코딩 에이전트 평가 DeepSWE의 문제 10개를 돌려 [GPT-5.6 Sol 52%, Fable 5 65%, Ox Alpha 80%라는 결과](https://x.com/davis7/status/2090655207831298095)를 올리면서, 일부만 뽑은 표본이라 실제 점수와 차이가 클 수 있다고 적었습니다. 개발자이자 유튜버인 테오(Theo)는 이 모델이 자기 회사 내부 벤치마크를 휩쓸고 있다고 쓴 뒤, 한 시간쯤 지나 이런 글을 올렸습니다.

Ox Alpha가 괜찮다고 해서 코드를 읽지 않고 풀리퀘스트 8건을 병합했다는 내용입니다. 같은 날 에이전트 도구 Hermes Agent가 Ox Alpha를 붙였고, 다음 날에는 Cline이 무료 모델 목록에 넣었습니다.

사용량은 숫자로 남았습니다. OpenRouter 집계로 Ox Alpha는 8월 20일부터 25일까지 6일 동안 토큰 23조 2,000억 개를 처리해 2위 DeepSeek-V4-Flash(9조 9,000억 개)의 2.3배를 기록했습니다. OpenCode의 7일 집계에서도 43조 개로 2위 DeepSeek-V4-Flash(22조 개)의 두 배 가까이 됐고, Cline은 공개 날 이 모델이 자기 도구 역사상 가장 빨리 큰 모델로 일주일도 안 돼 전체 트래픽의 11% 넘게 차지했다고 밝혔습니다.

![OpenCode의 모델별 7일 토큰 사용량 표. ox-alpha 43조, deepseek-v4-flash 22조, mimo-v2.5 11조, muse-spark-1.2-contributor 8.9조, nemotron-3-ultra 3.8조 순이고 10위 gpt-5.6-luna는 8,320억입니다.](https://z-cdn-media.chatglm.cn/prompts-rich-media-resources/5.3-flash-blog/S10CTLhwzg.png)

## 정체를 먼저 맞힌 쪽

이름이 없으니 정체를 맞히는 일이 먼저 벌어졌습니다. 토크나이저 구성과 중국 정치 질문을 거절하는 방식이 GLM 계열과 겹친다는 관측이 공개 직후 나왔고, 다음 날에는 추론 흔적과 생성하는 화면이 샤오미 MiMo와 닮았다며 샤오미 모델이라는 추정도 돌았습니다. 샤오미는 V2-Pro 때도 이름을 가리고 먼저 풀어 반응을 본 적이 있습니다. 8월 23일에는 OpenCode에서 Z.ai 모델과 같은 오류가 나고, 즈푸 내부 API 클래스 이름이 담긴 자바 오류 기록까지 드러나면서 GLM 쪽으로 좁혀졌습니다.

크기를 먼저 맞힌 쪽은 서빙 속도를 본 사람이었습니다. 효율적인 학습 기법을 연구해 온 팀 데트머스는 [출력은 빠르고 긴 입력을 읽는 프리필은 느린 즈푸 특유의 서빙 방식](https://x.com/Tim_Dettmers/status/2090866380484608066)을 근거로, Ox Alpha가 GLM-5.3보다 30%쯤 빠르니 같은 인프라라면 300~500B 이하일 것이라고 적었습니다. 실제 크기는 320B였습니다. 반대로 AI 소식을 추적하는 계정 scaling01은 [GLM-5.3보다 큰 교사 모델일 것](https://x.com/scaling01/status/2090662468833976582)이라고 봤습니다.

점수 쪽에서는 표본 크기가 숫자를 크게 움직였습니다. 10문제에서 80%였던 DeepSWE 점수는 113문제 전체를 돌리자 58.4%가 나왔고, DeepSWE 연구자가 더 큰 표본으로 잰 값은 63% 안팎으로 Z.ai가 공개 날 발표한 63.4와 거의 같았습니다.

| 날짜(미국 시각) | 올린 사람 | 내용 |
| --- | --- | --- |
| 8월 20일 | [OpenCode](https://x.com/opencode/status/2090544355824038300) | 일주일 무료, 하루 100조 토큰 처리 용량 |
| 8월 20일 | [벤 데이비스](https://x.com/davis7/status/2090655207831298095) | DeepSWE 10문제에서 80%, 같은 조건의 Fable 5 65%, GPT-5.6 Sol 52% |
| 8월 20일 | [테오](https://x.com/theo/status/2090669658483691539) | 코드를 읽지 않고 풀리퀘스트 8건 병합 |
| 8월 21일 | [팀 데트머스](https://x.com/Tim_Dettmers/status/2090866380484608066) | 서빙 속도로 300~500B 이하 추정 |
| 8월 24일 | [Cline](https://x.com/cline/status/2091995642201842015) | 실제 버그 하나를 Fable 5와 둘 다 고쳤고, 출력 토큰은 약 3분의 1 |
| 8월 26일 | [Z.ai](https://x.com/Zai_org/status/2092616204787626030) | GLM-5.3-Flash로 정체 공개 |

## 57점을 과제당 얼마에 내나

공개 당일 AA는 GLM-5.3-Flash의 종합 지수를 57점으로 매겼습니다. AA 종합 지수는 추론과 지식, 코딩, 에이전트 작업을 여러 평가로 재서 하나로 묶은 점수로, 같은 회사의 큰 모델 GLM-5.3보다 3점 낮고 GPT-5.6 Terra, 메타 Muse Spark 1.2와 같은 점수입니다.

AA가 정가로 잰 과제당 비용은 0.09달러입니다. 같은 57점인 GPT-5.6 Terra는 0.51달러, Muse Spark 1.2는 0.40달러여서 같은 점수를 4.4~5.7분의 1 값에 냅니다. 한 단계 위인 GLM-5.3은 60점에 과제당 0.68달러이니, 3점을 더 받는 데 비용이 7.5배 듭니다.

Z.ai가 발표문과 도표에 쓴 숫자는 그 절반인 과제당 0.045달러입니다. 발표 직후 Z.ai 가격표에는 정가의 50%를 깎은 할인가가 9월 9일까지로 붙었고, 도표의 값은 이 할인가로 계산했습니다. 정가는 100만 토큰당 입력 0.15달러, 캐시된 입력 0.03달러, 출력 0.50달러로, 입력 1.4달러와 출력 4.4달러인 GLM-5.3의 약 10분의 1입니다. Z.ai는 이 수준의 지능이 전에는 약 10배 비용에서만 가능했다고 적었는데, AA의 정가 기준 계산으로는 4.4~5.7배입니다.

![Artificial Analysis 종합 지수(세로축)와 과제당 비용(가로축, 로그 눈금)에 모델 59개를 찍은 산점도. GLM-5.3-Flash(할인가)는 0.045달러에 57점으로 표시되고, 오른쪽 위로 GLM-5.3, Kimi K3, Grok 4.6, GPT-5.6 Sol, Claude Opus 5, Claude Fable 5가 이어집니다.](https://z-cdn-media.chatglm.cn/prompts-rich-media-resources/5.3-flash-blog/Sy_ehD3wzx.png)

값을 10분의 1로 줄이면서 무엇을 내줬는지는 같은 회사의 큰 모델 GLM-5.3과 견주면 드러납니다. Z.ai가 두 모델을 같은 하네스와 설정으로 잰 점수를 각각 공개해 두었습니다.

| 항목 | GLM-5.3-Flash | GLM-5.3 |
| --- | --- | --- |
| 전체 파라미터 | 320B (활성 18B) | 743B |
| API 정가 (100만 토큰, 입력 / 출력) | 0.15달러 / 0.50달러 | 1.4달러 / 4.4달러 |
| AA 종합 지수 | 57 | 60 |
| AA 과제당 비용 | 0.09달러 | 0.68달러 |
| Terminal-Bench 2.1 | 84.3 | 88.2 |
| DeepSWE 1.1 | 63.4 | 66.9 |
| AutomationBench | 48.8 | 48.2 |
| GDPval-AA v2 | 1773 | 1769 |
| HLE (도구 사용) | 55.3 | 62.5 |

벤치마크는 Z.ai 발표 값이고, 종합 지수와 과제당 비용은 AA 값입니다.

실무형 평가에서는 두 모델이 거의 같았습니다. 44개 직업의 실무를 재는 GDPval-AA는 Z.ai 발표로 1773 대 1769였고, AA 측정으로도 1770으로 GLM-5.3, Grok 4.6과 오차 범위 안에서 같았으며 앞선 모델은 Claude Opus 5뿐이었습니다. 반면 다분야 난제를 푸는 HLE는 7.2점 뒤졌고, 터미널 작업은 Z.ai 발표로 3.9점 뒤졌지만 AA가 직접 잰 Terminal-Bench 2.1에서는 84.3% 대 83.9%로 오히려 조금 앞섰습니다. 지식을 묻는 AA의 평가에서도 정답률이 28%로 GLM-5.3(34%)보다 낮았고, 대신 모르는 것을 지어내는 비율은 28%로 GLM-5.3(30%)보다 조금 낮았습니다.

## 토큰은 오히려 많이 쓴다

값이 싼 대신 토큰은 많이 씁니다. AA가 종합 지수를 한 번 돌리는 동안 GLM-5.3-Flash는 출력 토큰 1억 4,900만 개를 썼고, 이 가운데 90%인 1억 3,400만 개가 추론 토큰이었습니다. 같은 57점인 Kimi K3는 1억 3,300만 개, 알리바바 Qwen3.8-Max는 1억 3,600만 개를 썼습니다. 과제당 비용이 낮은 것은 토큰 단가가 싸서이고, 한 과제에 쓰는 토큰은 오히려 많습니다.

Z.ai의 사내 코딩 평가에서도 같은 모양이 나옵니다. Claude Code 위에서 돌린 Z.ai Code Bench에서 GLM-5.3-Flash는 추론 강도 최대 설정으로 29.0%를 받아 Claude Opus 4.8(29.5%)과 비슷했지만, 과제당 출력 토큰을 14만 개 가까이 썼습니다. 한 단계 아래 High 설정에서는 7만 개 안팎으로 28%대를 냈으니, 마지막 1점을 얻는 데 토큰이 두 배로 들었습니다.

과제 하나만 보면 다른 결과도 나옵니다. 8월 24일 Cline은 자기 저장소의 실제 버그 하나를 Ox Alpha와 Fable 5에 맡겼는데, 둘 다 제대로 고쳤고 Ox Alpha의 출력 토큰은 약 3분의 1이었습니다. Fable 5는 원인을 찾았다는 말을 일곱 번 되풀이한 뒤에야 코드를 고쳤고, Ox Alpha는 한 번 말하고 바로 고쳤다는 관찰입니다. 한 건의 관찰과 수백 과제를 모은 집계가 다른 방향을 가리키는 만큼, 토큰을 얼마나 쓰는지는 맡기는 일의 종류에 따라 크게 달라집니다.

## 한 번에 켜는 양을 줄인 설계

값을 이만큼 낮춘 방법은 구조에 있습니다. 전체 파라미터가 비슷한 GLM-4.5(355B)와 견주면 토큰 하나에 켜는 활성 파라미터는 32B에서 18B로, 레이어는 92개에서 45개로 줄었습니다. 전문가 혼합 모델은 전체 파라미터 가운데 일부 전문가만 골라 켜서, 켜는 양이 줄면 토큰 하나를 만드는 계산도 그만큼 줄어듭니다.

긴 문맥의 비용은 어텐션에서 나옵니다. 일반 어텐션은 새 토큰을 만들 때마다 앞선 토큰 전부를 다시 살피고, 그 계산 결과를 KV 캐시라는 메모리에 쌓아 둡니다. 문맥이 100만 토큰이면 이 캐시가 칩 메모리를 차지해 한 번에 받을 수 있는 요청 수가 줄어듭니다. GLM-5.3-Flash는 레이어 넷 가운데 셋을 지나간 문맥을 고정된 크기의 상태로 눌러 담는 선형 어텐션으로, 나머지 하나를 가벼운 인덱서로 필요한 구간만 골라 보는 희소 어텐션으로 채웠고, 인덱서가 쓰는 키 벡터 네 개를 하나로 합치는 IndexPool도 넣었습니다.

Z.ai는 100만 토큰에서 레이어당 KV 캐시가 GLM-5.3보다 4.44배 작고 어텐션 계산은 3.01배 적다고 밝혔습니다. 비교한 모델 가운데 어텐션 계산은 가장 적었지만, KV 캐시는 아직 Kimi-K3와 DeepSeek-V4-Flash보다 조금 크다는 문장도 발표문에 함께 적었습니다. 공개 한 시간쯤 뒤 LLM 구조 해설로 알려진 세바스천 라시카는 이 구조를 그림으로 정리해 올렸습니다.

문샷AI가 만든 선형 어텐션 KDA(Kimi Delta Attention) 레이어 34개와 딥시크식 희소 어텐션 레이어 11개를 3 대 1로 섞었고, GLM-5.2식 전문가 혼합 구조를 320B-A18B로 줄였으며, 딥시크 V4식 잔차 경로(mHC)를 네 갈래로 뒀다는 설명입니다. 두 효율형 어텐션을 함께 쓴다는 뜻에서 슈퍼 하이브리드라고 불렀습니다. 허깅페이스의 엘리 바쿠슈는 같은 날 [딥시크를 뺀 중국 프런티어 모델은 모두 선형 어텐션을, 키미를 뺀 모두가 희소 어텐션을 쓴다](https://x.com/eliebakouch/status/2092622716046107132)고 적었습니다.

설계 방향은 1주일 전 즈푸 수석과학자 탕제(唐杰)가 [X에 올린 글](https://x.com/jietang/status/2089941544581403107)과도 이어집니다. 그는 전체 파라미터는 세상의 지식을 담을 만큼까지만 중요하고, 그다음 능력은 한 번의 계산에서 얼마나 깊게 추론하느냐와 후속 학습에서 나온다고 적었습니다. GLM-5.3은 후속 학습만 키운 통제 실험이었다고 설명한 뒤, 글을 이렇게 맺었습니다.

> 우리는 스케일링을 끝내지 않았습니다. 다음에는 미드트레이닝과 사전학습, 그 이상을 키울 수도 있습니다.
> — 탕제, 칭화대 교수·즈푸 수석과학자

그로부터 1주일 뒤 나온 Flash는 기반 모델부터 새로 학습한 모델입니다. Z.ai는 발표문 맺음말에서 이 방식을 더 큰 모델로 넓히고 있으며, 여기서 얻은 교훈이 다음 프런티어 모델을 만드는 데 쓰이고 있다고 적었습니다.

## 트래픽을 받아 낸 중국 칩

발표문이 가장 크게 내세운 문장은 Ox Alpha의 트래픽을 모두 중국산 AI 칩에서 처리했다는 대목입니다. 즈푸는 2025년 1월 미국 수출 통제 명단에 올라, 미국 정부 허가 없이는 엔비디아 칩을 살 수 없는 회사입니다. Z.ai는 지난 일주일 동안 고대역폭 연결로 묶은 대규모 중국산 칩 클러스터에서 GLM-5.3-Flash를 서빙했다고 밝혔고, 개발자 문서에는 이 가속기가 수만 개라고 적었습니다.

중국산 칩은 칩 한 장의 메모리 용량과 대역폭이 모자라서, 100만 토큰 문맥을 그대로 받기 어렵습니다. Z.ai는 SGLang 위에 이 구조 전용 추론 엔진을 짓고, 가중치와 활성값을 8비트로 줄이는 W8A8 양자화, 캐시를 INT8·FP8·BF16으로 섞어 줄이는 방식, 레이어를 나눠 싣는 Layer Split 같은 메모리 절약 기법을 겹쳐 썼습니다. 이미지를 읽는 인코딩과 입력 문맥을 한 번에 읽는 프리필, 답을 한 토큰씩 만드는 디코드는 서로 다른 작업자 풀로 떼어 따로 늘리고 줄였습니다.

그 결과 같은 하드웨어에서 처음보다 종단 서빙 성능을 3배 올렸고, 하드웨어 효율과 토큰당 원가가 주류 엔비디아 GPU와 비슷한 수준에 이르렀다고 적었습니다. 이 작업에는 GLM-5.3 기반 인프라 에이전트가 엔지니어를 도와 커널을 짜고 병목을 찾고 서빙 스택을 고쳤다고도 밝혔습니다. 다만 칩 제조사와 모델명은 밝히지 않았고, 원가가 엔비디아와 비슷하다는 주장을 뒷받침할 외부 측정도 함께 내지 않았습니다.

공개 뒤 반응도 이 대목에 몰렸습니다. 반도체 분석 회사 세미애널리시스는 [하루 100조 토큰을 중국 칩으로 서빙했다는 점이 더 충격적](https://x.com/SemiAnalysis_/status/2092623833630998556)이라고 적었고, 테오는 [Ox가 Flash 모델이라는 것도 놀랍지만 모든 트래픽을 중국 칩에서 돌렸다는 것이 더 놀랍다](https://x.com/theo/status/2092708047445795186)고 썼습니다. 엔비디아 밖의 칩이 칩 설계 말고도 넘어야 할 조건이 많다는 점은 [AMD 헬리오스를 두고 세미애널리시스가 단 조건들](/post/review-amd-helios-cuda-moat)에서도 봤고, Z.ai는 칩 위에서 도는 서빙 소프트웨어를 다듬는 일의 일부를 자기 모델에 맡겼습니다.

## 국내에서 쓰려면

가중치는 MIT 라이선스라 저작권 표시만 남기면 고쳐서 상업 서비스에 써도 따로 계약할 필요가 없습니다. 허깅페이스에 올라온 FP8 가중치 파일은 약 328GB, BF16 판은 약 643GB라 GPU 여러 장을 묶은 서버가 있어야 돌릴 수 있습니다. 발표 날 기준 지원 프레임워크는 SGLang과 vLLM, TokenSpeed이고, Z.ai는 공개 몇 시간 뒤 채팅 템플릿을 고쳤으니 그 전에 받은 사람은 다시 받으라고 알렸습니다.

코딩 구독에서는 GLM-5.3-Flash를 GLM-5.3보다 3배 많이 쓸 수 있습니다. 크레딧 배율을 GLM-5.3의 3분의 1 수준으로 잡았고, GLM-5-Turbo나 GLM-4.7을 부르는 요청은 GLM-5.3-Flash로 넘어갑니다. 피크가 한국 시각 평일 오후 3시~7시인 크레딧 규칙은 그대로라, 이 시간에 보내는 요청은 크레딧을 두 배 씁니다. API로 쓰면 9월 9일까지 할인가가 붙고, 추론을 끄는 옵션은 없습니다.

같은 날 알리바바도 선형 어텐션 셋에 희소 어텐션 하나를 섞은 Qwen3.8-Flash-Next를 비슷한 값에 내놓았지만, 모델 API나 코딩 도구 사업에 쓰려면 별도 계약을 받게 했습니다. 두 모델의 설계와 라이선스는 [같은 날 나온 두 모델을 견준 글](/post/news-china-two-releases-qwen-glm)에 따로 정리했습니다.

남은 확인거리는 유료 사용자가 늘어난 뒤의 처리량과 응답 속도입니다. 7월 문샷AI는 [Kimi K3](/post/news-kimi-k3-open-weight-frontier)를 내놓은 지 48시간 만에 연산 한계로 신규 구독을 멈춘 적이 있습니다. 9월 9일 할인이 끝나면 AA가 정가로 잰 0.09달러가 청구서의 값이 되고, 8월 14일 발표한 GLM-5.3의 가중치도 Z.ai가 밝힌 일정대로라면 이번 주 안에 허깅페이스에 올라옵니다.

읽어 주셔서 고맙습니다.

초이 드림
