이 글 어땠어요?
엔지니어와 함께 만들었습니다. 엔지니어는 목표와 시스템의 경계를 정하고 중요한 변경을 검토했고, GLM-5.3 기반 에이전트는 분석과 가설, 코드 수정을 맡았습니다. Z.ai는 아직 재귀적 자기개선에 이르지 않았다고 밝혔습니다.
첫 구동 때의 8비트(W8A8) 기준선 대비 종단 처리량입니다. 블로그 본문은 약 3배로, 그림 1은 출시일(T+13) 3.22배로 적었고, 기준선이 얼마나 다듬어진 상태였는지는 공개하지 않았습니다.
에이전트가 찾은 정밀도 문제의 수정은 Flash Linear Attention 저장소에 풀리퀘스트 #1180으로 8월 27일 병합됐습니다. 처리량과 기간 같은 나머지 수치는 Z.ai가 스스로 잰 값입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
AI 인덱스 2026에서 상위 네 회사의 최고 모델은 아레나 점수 1,481~1,503점에 모였습니다. 엔비디아의 2~4월 분기 데이터센터 매출은 1년 전보다 92% 늘었고, 오픈AI의 추론 지출은 2024년 18억 달러에서 2025년 80억 달러가 됐습니다.

사람이 방향만 주면 Claude가 끝까지 해내는 연구개발 업무가 2월 1% 미만에서 8월 26%로 늘었고, 완전 자율 업무는 아직 없습니다. 사후 감시 단계에서는 METR 공격 탐지율이 94%에서 79%로 내려갔습니다.
문샷AI가 7월 27일 Kimi K3 가중치를 공개하며 FlashKDA·MoonEP·AgentENV를 함께 풀었고, 11분 뒤 서빙 업체 7곳의 검증 점수가 올라왔습니다. 지난해 K2는 vLLM에서 도구 호출 1,200여 건 중 218건만 제대로 처리될 만큼 흔들렸습니다.

AI 인덱스 2026에서 상위 네 회사의 최고 모델은 아레나 점수 1,481~1,503점에 모였습니다. 엔비디아의 2~4월 분기 데이터센터 매출은 1년 전보다 92% 늘었고, 오픈AI의 추론 지출은 2024년 18억 달러에서 2025년 80억 달러가 됐습니다.

사람이 방향만 주면 Claude가 끝까지 해내는 연구개발 업무가 2월 1% 미만에서 8월 26%로 늘었고, 완전 자율 업무는 아직 없습니다. 사후 감시 단계에서는 METR 공격 탐지율이 94%에서 79%로 내려갔습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@Zai_orgX 게시물 · 원문 보기
발표 게시물은 GLM-5.3이 GLM-5.3-Flash를 서빙하는 추론 인프라를 만들고 최적화하는 데 어떻게 쓰였는지 공유한다는 문장으로 시작합니다. 첫 구동에서 실서비스 준비까지 2주가 안 걸렸고 종단 처리량은 처음의 세 배가 됐으며, 열쇠는 조밀한 피드백(dense feedback)이었다고 적었습니다. 전체 성능 숫자 하나에 기대지 않고 부분별 정확도 테스트와 실행 추적, 작은 단위의 속도 측정, 전체 성능 측정을 함께 줘서, 에이전트가 가설을 하나씩 확인해 나가게 했다는 설명입니다.
블로그 글의 제목은 「재귀적 자기개선을 향해」입니다. 재귀적 자기개선(RSI)은 AI가 자신을 고치고, 그렇게 나아진 AI가 다시 다음 개선에 참여하는 구조를 가리킵니다. Z.ai는 글머리에서 GLM이 자기들을 놀라게 하고 때로는 불안하게 만든다고 적고 첫 사례로 사이버 보안을 들었습니다. 2025년 10월 코딩의 연장으로 사이버 역량을 키우기 시작했더니 1년이 안 돼 보안 협력사들이 GLM으로 실제 코드베이스에서 취약점 수천 개를 찾았고, 그래서 믿을 수 있는 이용자에게만 여는 접근 제도를 따로 만들었다는 내용입니다.
두 번째 사례가 이번 인프라 작업입니다. Z.ai는 경험 많은 인프라 엔지니어 팀이 몇 주를 들였을 작업을 모델이 끝내는 것을 지켜봤고, 이 작업이 다음 세대 모델을 학습시키는 방식을 곧바로 바꾸리라는 것을 깨달으면서 확신이 더 커졌다고 적었습니다. GLM-4.7 전까지는 사내에서 GLM을 코딩에 쓰는 데 의무감이 섞여 있었지만, 지금은 GLM-5.3이 팀 모두의 일상 코딩 파트너가 됐고 점점 자신들을 대체하는 쪽으로 가고 있다는 고백도 함께 실었습니다.
우리의 후계자는 우리가 직접 만들고 있는 AI 시스템입니다.— Z.ai, 재귀적 자기개선을 향해
이 작업은 3주 전 발표에 이미 한 줄로 적혀 있었습니다. Z.ai는 8월 26일 GLM-5.3-Flash를 공개하면서 중국산 칩 위에 서빙 엔진을 짓는 일을 GLM-5.3 기반 인프라 에이전트가 도와 속도를 냈다고 적었고, 같은 하드웨어에서 처음보다 종단 서빙 성능을 3배 올렸다는 결과만 밝혔습니다. 이번 글은 그 3배가 어떤 순서로 쌓였는지를 공개했습니다.
GLM-5.3-Flash는 공개 전 Ox Alpha라는 이름으로 OpenCode와 OpenRouter에서 시험 운영됐고, Z.ai는 이번 글에서 이 모델이 6일 동안 토큰 62조 개 넘게 처리했다고 적었습니다. 그 트래픽을 받은 곳이 이번에 공개한 시스템입니다. 8월 발표 무렵 개발자 문서는 이 클러스터를 국산 가속기 수만 개로 적었는데, 이번 글은 10만 개가 넘는다고 적었습니다.
조건은 까다로웠습니다. 즈푸는 2025년 1월부터 미국 수출 통제 명단에 올라 있어 엔비디아 칩 대신 중국산 가속기를 썼고, 이 칩은 한 장의 메모리 용량과 대역폭이 모자랍니다. 새 모델 구조와 100만 토큰 문맥, 이미지·영상 요청까지 받아야 했습니다. Z.ai는 이만한 규모로 중국산 가속기 클러스터를 운영한 곳이 전에 없었고, 생태계가 덜 자라 커널 지원이 빠진 곳이 많았으며, 문서로 있어야 할 내용의 상당 부분을 짐작으로 채웠다고 적었습니다.

처리량 곡선은 네 구간으로 나뉩니다. Z.ai가 공개한 그림 1의 값을 구간별로 옮기면 이렇습니다.
| 구간 | 기간 | 주요 작업 | 처리량(기준선 대비) |
|---|---|---|---|
| 시스템 구동·스케줄링 | T+0~T+1 | 8비트(W8A8) 기준선, 비동기 스케줄링 | 1.00배 → 1.21배 |
| 병렬화·통신 | T+2~T+5 | 정렬 커널, 계층형 캐시, Layer Split, 컨텍스트 병렬 | 1.42배 → 2.49배 |
| 커널 최적화 | T+7~T+11 | KV 전송 중첩, 혼합 정밀도 캐시 양자화, 청크 MQA, 프리필 역양자화, 활성화·양자화 결합 | 2.67배 → 3.01배 |
| 출시 | T+13 | 선형 어텐션 커널 | 3.22배 |
가장 크게 뛴 곳은 병렬화 구간의 뒤쪽 이틀입니다. 레이어를 나눠 싣는 Layer Split(T+4)으로 1.97배, 긴 문맥을 여러 칩이 나눠 계산하는 컨텍스트 병렬(T+5)로 2.49배가 되면서, 처리량이 기준선 대비 1.41배에서 2.49배로 올랐습니다. 커널을 하나씩 다듬은 뒤쪽 구간은 2.49배를 3.22배로 올렸고, 블로그 본문은 이 결과를 약 3배로, 그림은 3.22배로 적었습니다.
Z.ai가 이 과정에서 가장 크게 배운 점으로 꼽은 것은 에이전트의 코딩 실력보다 피드백의 질입니다. 코드베이스는 정지된 맥락만 주는데, 추론 시스템의 수치 오차나 성능 저하는 커널 구현과 병렬화 전략, 통신, 메모리 관리, 서빙 조율이 서로 얽혀서 생깁니다. 변경 뒤에 정확도 테스트 실패, 첫 토큰까지 걸리는 시간 30% 증가, 출력 처리량 20% 하락 같은 결과만 받으면 에이전트는 어느 단계가 문제인지, 가설이 왜 틀렸는지, 다음에 무엇을 시험할지 알기 어렵습니다.
그래서 정확도 테스트와 실행 기록, 실행 추적, 런타임 이벤트, 작은 단위의 속도 측정(마이크로벤치마크), 전체 지표를 에이전트의 반복 작업 안에 넣었습니다. Z.ai는 조밀한 피드백에 조건 세 가지를 달았습니다. 특정 커널이나 코드 경로, 입력 조건에 묶일 만큼 국소적이고, 가설마다 싸고 빠르게 얻을 수 있으며, 관찰 사이의 상관관계만으로 판단하지 않고 기준 구현과 통제 실험으로 판정할 수 있는 피드백이어야 쓸모가 있다는 겁니다.

역할도 나눴습니다. 엔지니어는 목표와 시스템의 경계를 정하고 중요한 변경을 검토하며, 에이전트는 분석과 가설, 코드 수정을 맡고, 실험 환경은 단계별로 제때 검증할 수 있는 피드백을 돌려줍니다. Z.ai는 이 구조가 엔지니어의 경험으로 이어 붙이던 진단 과정을 에이전트가 계속 돌릴 수 있는 작업 흐름으로 옮겼다고 적었습니다.
이 구조는 GLM-5.3을 가르친 과제와 닮았습니다. Z.ai는 8월 14일 GLM-5.3을 공개하면서, 모델에게 엔지니어와 같은 클러스터와 코드베이스를 주고 학습 스택의 병목을 찾아 정확도를 지키며 속도를 끌어올리게 하는 머신러닝 인프라 과제를 후속 학습에 넣었다고 밝혔습니다. 그렇게 학습한 모델이 실제 서빙 인프라 작업에 투입됐습니다.
첫 번째 사례는 계산이 맞는지 확인하는 단계에서 나왔습니다. 병렬화 전략을 바꾸면 커널 입력이 나뉘는 방식과 실행 경로, 결과를 합치는 방식이 달라져서, 나누지 않은 조건에서 커널 출력만 확인해서는 실제 배포 상태를 다 확인하지 못합니다. Z.ai는 병렬화 설정마다 어떤 커널이 어떤 경로로 도는지 연결 지도를 만들고, 에이전트가 나눈 경로와 나누지 않은 경로의 결과를 같은 입력으로 비교하게 했습니다.
이 비교에서 문샷AI가 만든 선형 어텐션 KDA 커널의 컨텍스트 병렬 경로에 수치 오차가 드러났습니다. 긴 문맥을 여러 조각으로 나눠 계산할 때 조각마다의 상태 변환을 합치는 행렬곱이, 입력은 FP32(32비트 부동소수점)인데도 기본값인 TF32로 돌고 있었습니다. TF32는 정밀도를 낮춰 행렬곱을 빠르게 하는 형식이라 오차가 조각을 거칠 때마다 쌓였고, 문맥이 길수록 결과가 더 어긋났습니다.
수정은 두 연산에 TF32 연산 세 번을 묶어 더 높은 정밀도를 내는 tf32x3 설정을 명시한 것이었습니다. 이 수정은 오픈소스 라이브러리 Flash Linear Attention에 풀리퀘스트 #1180으로 올라가 8월 27일 병합됐고, 같은 커널을 쓰는 팀은 누구나 받아 쓸 수 있습니다.
두 번째 사례에서는 엔지니어가 먼저 시험 시나리오와 기준을 정했습니다. 입력 문맥을 읽는 프리필만 돌릴 때, 프리필과 KV 전송을 함께 돌릴 때, 답을 만드는 디코드만 돌릴 때를 나눠 재고, 같은 부하에서 프리필과 KV 전송을 함께 돌린 성능이 프리필만 돌린 기준과 5% 넘게 벌어지지 않게 한다는 수락 기준을 뒀습니다. KV 전송은 프리필 서버가 계산한 KV 캐시를 디코드 서버로 옮기는 작업입니다.
에이전트가 돌려 보니 일부 시나리오에서 차이가 20%를 넘었습니다. 실행 타임라인을 보니 파이썬 쪽 KV 전송이 전문가 병렬 통신 라이브러리 DeepEP의 분배·결합 호출 구간과 한 번도 겹치지 않았고, 호출 경로를 따라가자 DeepEP 1.2.1의 노드 내부 분배·결합 함수가 파이썬 GIL을 풀지 않은 채 C++ 코드로 들어가 있었습니다. GIL(전역 인터프리터 잠금)은 파이썬에서 한 번에 한 스레드만 파이썬 코드를 실행하게 하는 잠금이라, 이 잠금을 쥔 동안 같은 프로세스에서 KV 전송(Mooncake Transfer)을 맡은 파이썬 스레드는 작업을 제출하지 못하고 기다렸습니다.
같은 버전의 노드 간 분배 함수는 이미 GIL을 풀고 있었고, CPU가 기다리는 동안 다른 스레드의 KV 전송을 막지 않으려는 조치라는 주석까지 달려 있었습니다. 관련 C++ 구간에서 GIL을 풀도록 고치자 같은 시험 조건에서 두 경우의 성능 차이는 1% 아래로 줄었습니다.

세 번째 사례에서는 사람이 쓴 커널에 쌓인 요령을 가져왔습니다. Z.ai는 에이전트에게 SGLang과 Flash Linear Attention, DeepGEMM 같은 프로젝트의 커널에서 최적화 기법을 뽑게 하고, 하나씩 넣고 빼 보는 실험으로 걸러 적용 조건과 변환 방법, 자원 제약, 검증 근거를 담은 최적화 골격(skeleton)으로 정리하게 했습니다. 새 커널을 만나면 에이전트는 이 골격에서 출발해 프로파일링과 단계별 시험으로 타일 크기와 메모리 접근, 자원 배분을 다시 따지고, 검증을 통과한 변경은 다시 골격 목록에 들어갑니다.
대표 사례로 든 KDA 디코드 커널은 네 판을 거쳤습니다. 메모리를 아끼려고 계산을 더 하는 ReplaySSM을 넣은 v1에서 실행 시간이 늘어 기준의 0.90배로 떨어졌고, 나눗셈을 다듬은 v2에서 실행 시간을 9.6% 줄여 기준 수준을 되찾았습니다. 계산이 병목이라는 피드백을 받은 에이전트는 원래 구현이 V 차원으로 타일을 나누는 바람에 같은 FP32 정규화와 게이팅 계산을 네 번 되풀이한다는 것을 찾았고, 타일을 한 스레드 블록으로 합쳐 공유하는 중간값을 레지스터에 두고 중복 계산을 워프 단위 합산 한 번으로 바꿨습니다. 병렬성을 일부 내주는 대신 중복을 없앤 v3는 v2보다 1.71배 빨라졌습니다.

Z.ai는 이 사례를 두고, GLM-5.3 기반 에이전트가 기존 구현에서 뽑은 요령을 자기 추론을 돌리는 커널에 적용했고 배포할 때마다 쌓인 경험이 다음 최적화에 드는 품을 줄인다고 적었습니다. 글은 이 구조를 모델이 시스템을 최적화하고, 시스템이 모델을 돌린다는 한 문장으로 요약했습니다.
Z.ai가 엔지니어에게 남긴 일은 최적화 목표와 시스템 제약을 정하는 일, 에이전트가 바로 쓸 수 있는 피드백 환경을 만드는 일, 시스템 구조와 비동기 동시성, 프로덕션 위험이 걸린 중요한 변경을 검토하는 일까지 세 가지입니다. 최종 수락 기준은 정확도와 안정성, 전체 성능을 함께 봤습니다.
목표를 고르고, 경계를 정하고, 위험을 평가하는 일은 여전히 사람의 책임입니다.— Z.ai, 재귀적 자기개선을 향해
Z.ai는 아직 재귀적 자기개선에 이르지 않았다고 먼저 밝혔고, 이 역할을 앞으로도 오래 사람이 맡아야 한다고 봤습니다. 그러면서도 2주, 세 배의 처리량, 10만 개의 가속기라는 숫자는 이 경계에서의 진전이 자기들이 원한다고 느려지지 않는다는 점을 알려 준다는 문장으로 글을 맺었습니다.
공개되지 않은 것도 많습니다. 3.22배의 출발점인 8비트 기준선이 얼마나 다듬어진 상태였는지, 13일 동안 엔지니어와 에이전트가 일을 어떤 비율로 나눴는지, 피드백 환경을 만드는 데 든 시간이 13일 안에 들어가는지는 적혀 있지 않습니다. 가속기 제조사와 모델명, 같은 작업을 엔비디아 GPU에서 했을 때의 비교값도 없습니다. 원인과 수정, 수정 뒤 값이 함께 적힌 세 사례와 외부 저장소에 병합된 수정 하나가 바깥에서 따라가 볼 수 있는 부분입니다.
이번 글이 나오기 5일 전인 9월 12일, 앤트로픽의 다리오 아모데이는 올여름부터 AI가 다음 AI 개발을 돕는 재귀적 자기개선이 예상보다 빨라졌다며 모델 성능이 좋아지는 속도를 1~2년 늦추자는 글을 냈습니다. 그 계획의 마지막 단계는 권위주의 정부와도 가능한 범위에서 속도를 조율하는 일이었습니다. 5일 뒤 중국 회사 Z.ai는 자기 모델이 추론 인프라를 만든 기록에 재귀적 자기개선을 향한다는 제목을 붙였고, 이 경계의 진전은 원한다고 느려지지 않는다는 문장으로 글을 끝냈습니다. 같은 5주 동안 미국 연구소들도 AI가 AI 개발을 맡은 기록을 잇달아 냈습니다.
| 공개일 | 회사 | 기록 | AI가 맡은 일 |
|---|---|---|---|
| 8월 15일 | 앤트로픽 | 위험 보고서의 사내 인프라 평가 | 사내 AI 인프라 문제 449개 진단·수정, 내부 모델 62.8% |
| 8월 30일 | 오픈AI | TIME 인터뷰의 신입 연구자 업무 자동화 | 실험 아이디어를 받아 코드베이스에 구현하고 결과까지 회수 |
| 9월 14일 | 구글 등 | Dream-RSI 논문 | 탐색 정책 코드를 스스로 고쳐 에이전트 호출 42% 감소 |
| 9월 17일 | Z.ai | 재귀적 자기개선을 향해 | 추론 시스템 구축, 13일 동안 처리량 3.22배 |
| 9월 18일 | 앤트로픽 | 사내 AI 개발 속도 측정 | Claude 주도 연구개발 비중 2월 1% 미만에서 8월 26% |
다섯 기록 모두 만든 쪽이 자기 작업을 스스로 잰 값이고, 목표와 최종 승인은 사람이 쥐고 있습니다. 앤트로픽의 사내 인프라 평가도 실제 엔지니어가 푼 AI 인프라 문제를 모델에게 다시 풀게 한 것이어서, Z.ai의 사례와 같은 종류의 일을 잽니다. 9월 10일 공개된 자기개선 연구 491편의 분류는 개선 계획과 평가 기준을 누가 정하느냐로 자율성 단계를 나누는데, Z.ai의 경우 목표와 수락 기준은 엔지니어가 정했고 에이전트는 그 안에서 가설과 수정을 반복했습니다.
엔비디아 밖의 칩에 새 모델을 올리는 일은 한국에도 남의 일이 아닙니다. 리벨리온과 퓨리오사AI 같은 국내 AI 반도체 회사도 자사 칩에서 새 모델을 돌리려면 커널과 서빙 소프트웨어를 칩에 맞추는 일을 거칩니다. Z.ai가 이번에 공개한 것은 그 일을 에이전트에게 맡길 때 무엇이 필요했는지, 곧 커널 단위 정확도 비교와 실행 타임라인, 마이크로벤치마크를 에이전트가 바로 쓸 수 있게 묶은 환경입니다.
그대로 가져다 쓸 수 있는 부분도 있습니다. 정밀도 문제의 수정은 Flash Linear Attention에 병합돼 이 라이브러리를 쓰는 팀이면 누구나 받고, GIL 문제는 DeepEP와 Mooncake를 함께 쓰는 서빙 구성이면 같은 방식으로 점검해 볼 수 있습니다. 에이전트로 쓴 GLM-5.3의 가중치도 8월 28일 허깅페이스에 공개됐는데, 새 라이선스는 계열사 합산 연 매출이 100억 달러가 넘는 모델 API 사업자에게만 상업적으로 쓰기 전에 Z.ai의 보안 심사를 받게 했습니다.
Z.ai는 8월 26일 발표문에서 Flash를 만들며 얻은 교훈이 다음 프런티어 모델을 만드는 데 쓰이고 있다고 적었습니다. 그 모델을 서빙할 시스템도 같은 방식으로 만들지, 그때 엔지니어가 맡는 일이 얼마나 줄어 있을지가 Z.ai의 다음 공개에서 확인할 대목입니다.
읽어 주셔서 고맙습니다.
초이 드림