이 글 어땠어요?
HBM은 모델 가중치와 대화 맥락(KV 캐시)을 담아 동시에 처리할 수 있는 요청 수를 정하고, 마이크론·삼성전자·SK하이닉스 세 곳이 거의 모두 만들어 칩 생산의 주요 병목이기도 합니다. 에포크는 출하된 HBM을 GB300 한 장의 288GB 단위로 바꿔 셌습니다.
에이전트가 주 168시간 일한다고 치면 3,300만~1억 7,100만 개는 주 40시간 정규직 1억 4,000만~7억 2,000만 명의 노동시간과 같습니다. 노동시간만 센 값이고 결과물의 질은 따로 따지지 않았습니다.
에포크는 용량의 20%만 써도 연간 지출이 2조 6,000억~5조 3,000억 달러로, 개발사 매출이 해마다 5배씩 늘어 2027년 말에 닿을 약 1조 700억 달러의 2.4~5배라고 계산했습니다. 수요가 이 증설을 정당화할지를 가장 큰 불확실성으로 꼽았습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
애플 연구진이 10월 1일 공개한 LoopCD는 루프 모델이 버리던 첫 바퀴 예측을 기준점 삼아 마지막 예측을 한 번 더 밉니다. 추가 학습 없이 AIME 2024 정답률이 61.88%에서 73.33%로 올랐고, 연산 22.5~48.2% 절감은 객관식 실험에서 쟀습니다.

구글 리서치가 9월 24일 소개한 A²RD는 신 설명 80줄로 10분짜리 영상을 만들었습니다. 1분 영상 평가에서 인물 일관성을 기존 최고 0.57에서 0.74로 올렸지만, 구간 하나에 최대 7.2분이 더 듭니다.
원소 6개짜리 반군 1만 5,973개 전부에 유한 기저나 기저가 없다는 증명을 붙인 Lean 590만 줄이 10월 7일 논문으로 나왔습니다. 3개월 동안 증명은 AI 에이전트가 썼고, 사람은 지시 1,114번으로 대상을 고르고 승인했습니다.
애플 연구진이 10월 1일 공개한 LoopCD는 루프 모델이 버리던 첫 바퀴 예측을 기준점 삼아 마지막 예측을 한 번 더 밉니다. 추가 학습 없이 AIME 2024 정답률이 61.88%에서 73.33%로 올랐고, 연산 22.5~48.2% 절감은 객관식 실험에서 쟀습니다.

구글 리서치가 9월 24일 소개한 A²RD는 신 설명 80줄로 10분짜리 영상을 만들었습니다. 1분 영상 평가에서 인물 일관성을 기존 최고 0.57에서 0.74로 올렸지만, 구간 하나에 최대 7.2분이 더 듭니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.

보고서를 쓴 제이슨 리(Jason Li)는 에포크에서 AI 추론을 연구하고, 그전에는 엔비디아에서 대규모 언어 모델 서빙과 추론 최적화를 맡았습니다. 보고서는 다리오 아모데이 앤트로픽 CEO가 2024년 에세이에서 그린 「데이터센터 속 천재들의 나라」를 꺼내며 시작합니다. AI 회사들이 해마다 칩과 데이터센터에 수천억 달러를 쓰는 지금, 그 하드웨어가 실제로 몇 명분의 일을 감당할 수 있는지 숫자로 따져 보자는 질문입니다. 계산 코드는 깃허브에 아파치 2.0 라이선스로 공개됐습니다.
에포크가 GPU 개수 대신 HBM을 단위로 고른 데는 두 가지 이유가 있습니다. HBM은 D램 칩 여러 장을 쌓아 GPU 바로 옆에 붙이는 메모리로, 모델의 가중치와 대화 맥락을 붙잡아 두는 KV 캐시를 함께 담습니다. 맥락이 길어질수록 요청 하나가 차지하는 KV 캐시가 커지니, 메모리 용량은 동시에 살려 둘 수 있는 요청 수를 정하고 메모리 대역폭은 토큰이 나오는 속도를 정합니다.
다른 하나는 공급입니다. HBM은 마이크론, 삼성전자, SK하이닉스 세 곳이 거의 모두 만들고, 엔비디아 GPU든 구글 TPU 같은 맞춤형 가속기든 이 메모리 없이는 완성되지 않습니다. 보고서는 마이크론과 SK하이닉스가 모두 수요가 공급을 넘는다고 밝혔고, 엔비디아가 공급난 때문에 다음 세대 Rubin Ultra의 메모리 구성을 줄이는 방안을 검토한다는 보도도 있었다고 적었습니다. 칩 생산의 주요 병목인 부품의 출하량을 세면 회사마다 다른 가속기를 한 단위로 묶을 수 있습니다.
계산은 곱셈 하나입니다. 2025년부터 출하된 HBM3E와 그 뒤 세대를 엔비디아 GB300 한 장에 들어가는 288GB 단위로 나눠 「GB300 환산 대수」를 구하고, 여기에 GB300 한 장이 동시에 돌리는 에이전트 수를 곱합니다. 같은 288GB라도 대역폭이 GB300의 HBM3E는 초당 8TB, 다음 세대 Rubin(VR200)의 HBM4는 초당 22TB라서, 에포크는 HBM4 시스템이 같은 메모리로 에이전트를 2배 돌린다고 보고 1배와 4배도 따로 계산했습니다.
| 출하 연도 | HBM 출하량 | HBM3E 비중 | HBM4·4E 비중 |
|---|---|---|---|
| 2025년 | 22억 1,000만 GB | 80% | 0% |
| 2026년(추정) | 37억 5,000만 GB | 62.5% | 37.5% |
| 2027년(추정) | 58억 1,000만 GB | 20% | 80% |
출하량은 시장조사업체 트렌드포스의 공개 자료에서 거꾸로 맞췄습니다. 트렌드포스가 지난해 5월 내놓은 「2026년 HBM 출하량 300억 기가비트(37억 5,000만 GB) 초과」를 2026년 값으로 쓰고, 「2026년 HBM 사용량 70% 넘게 증가」로 2025년 값을, 올해 8월의 「2027년 출하량 50~60% 증가」의 가운데값으로 2027년 값을 구했습니다. 세대별 비중은 트렌드포스가 연간 비율을 내놓지 않아 에포크가 가정한 값입니다. 이렇게 모은 3년 치를 더하면 288GB 묶음으로 3,933만 개, HBM4 효율을 2배로 쳐서 GB300 6,036만 대분입니다.
오픈 모델은 직접 잰 값이 있습니다. 반도체 분석 회사 세미애널리시스의 AgentX 벤치마크는 실제 Claude Code 작업 기록을 재생하면서 GPU 한 장이 에이전트 세션을 몇 개까지 동시에 감당하는지 잽니다. 느린 쪽 사용자 기준(P90)으로 초당 50토큰을 지키게 하면 GB300 한 장에 딥시크 V4 Pro 세션이 31.4개, GLM-5.2가 9.46개, Kimi K3가 3.97개 들어갔습니다. 보고서에 따르면 오픈AI와 앤트로픽은 프런티어 모델을 대개 초당 50~70토큰으로 서빙합니다. AgentX는 메인 에이전트와 그 아래 하위 에이전트를 한 세션으로 묶어 세고, 도구 실행을 기다리는 시간도 세션에 넣습니다.

닫힌 모델은 구조가 공개되지 않아 이렇게 잴 수 없습니다. 에포크는 Codex와 Claude Code의 실제 작업 기록을 모은 공개 데이터셋 TraceLab에서, 사람의 답을 기다린 시간을 빼고 에이전트가 쉬지 않고 일한 한 시간에 API 정가로 얼마가 드는지 계산했습니다. 기록은 4월 23일부터 7월 24일까지의 작업입니다.
| 모델·하네스 | 에이전트 한 시간 비용 |
|---|---|
| GPT-5.6 Sol · Codex | 15.50달러 |
| GPT-5.5 · Codex | 18.19달러 |
| Claude Opus 4.8 · Claude Code | 24.34달러 |
| Claude Fable 5 · Claude Code | 50.16달러 |
| Claude Fable 5 · Claude Code(맥락 50만 토큰 초과 작업) | 104.75달러 |
같은 Claude Code라도 모델과 맥락 길이에 따라 한 시간 값이 4배 넘게 갈렸고, 하네스(모델을 감싸 도구를 부르게 하는 프로그램)에 따라 같은 모델의 청구서가 2배 차이 나는 일도 있습니다. 에포크는 Codex와 Claude Code 사이에 오는 한 시간 30달러를 기준값으로 잡고, 10~100달러도 따로 계산했습니다.

한 시간 비용을 GPU 대수로 바꾸는 데는 가정이 하나 더 들어갑니다. API 매출이 실제 서빙 원가의 몇 배인지를 5~10배로 잡으면, 30달러짜리 에이전트 한 시간의 원가는 3~6달러입니다. 세미애널리시스가 집계한 GB300 3년 약정 임대료가 한 시간 5달러이니, GB300 한 장이 에이전트 0.83~1.67개를 돌리는 계산이 나옵니다. 에포크가 오픈 모델 벤치마크로 같은 배수를 거꾸로 구해 보니 딥시크 V4 Pro는 4.4~8.8배, GLM-5.2는 10.5배, Kimi K3는 4.1배로 가정한 범위 안팎에 있었습니다.
같은 GB300 한 장에 딥시크 V4 Pro는 31.4개, 닫힌 프런티어 모델은 0.83~1.67개라 19~38배 차이가 나는데, 앞의 것은 실제로 잰 동시 세션 수이고 뒤의 것은 API 값에서 거꾸로 구한 값입니다. 에포크는 두 쪽의 모델 능력과 작업량, 작업 시간을 재는 방식도 다르다고 적었습니다.
GB300 6,036만 대분에 한 장당 0.83~1.67개를 곱하면, HBM4 효율을 2배로 본 중심 가정에서 2027년까지 출하분으로 5,030만~1억 60만 개입니다. HBM4 효율을 1배와 4배로 바꾸면 범위가 3,280만~1억 7,070만 개로 넓어지고, 에포크가 그래프 제목에 쓴 3,300만~1억 7,100만이 이 값입니다. 에포크는 이 범위가 신뢰구간이 아닌 시나리오의 폭이고, 연말에 실제로 켜져 있는 에이전트 수와는 다른, 배치를 마친 뒤의 용량이라고 밝혔습니다.
2026년까지 출하분에서 2027년까지 출하분으로 넘어가며 중심 가정의 숫자가 2.5배가 되는 데는 HBM4가 들어 있습니다. 실제 HBM 용량은 55억 GB에서 113억 GB로 2.1배 늘지만, 2027년 출하분의 80%를 HBM4로 보고 2배로 쳐서 GB300 환산 대수는 2,403만에서 6,036만으로 2.5배가 됩니다. 메모리 용량이 막히는 작업이면 대역폭이 늘어도 동시에 담을 수 있는 요청 수는 그대로라, 에포크는 HBM4 효과를 1배로 두는 경우도 함께 계산했습니다.
| 출하 기간 | HBM4 효율 1배 | 2배(중심 가정) | 4배 |
|---|---|---|---|
| 2025~2026년 | 1,600만~3,190만 개 | 2,000만~4,010만 개 | 2,820만~5,630만 개 |
| 2025~2027년 | 3,280만~6,560만 개 | 5,030만~1억 60만 개 | 8,530만~1억 7,070만 개 |

숫자를 가장 크게 흔드는 것은 한 시간 비용입니다. 매출 대비 원가 배수를 고정하면 에이전트 수는 한 시간 비용에 반비례해서, 2027년까지 출하분으로 한 시간 10달러짜리 에이전트는 9,830만~5억 1,210만 개, 100달러짜리는 980만~5,120만 개를 돌립니다. 메모리의 절반만 에이전트에 쓰면 에이전트 수도 절반이 됩니다. HBM의 50~70%를 엔비디아가 쓰고 나머지 가속기의 효율이 엔비디아의 50~75%라고 치면 전체 용량은 7.5~25% 줄어듭니다.

에이전트는 밤과 주말에도 일하니 한 주에 168시간, 주 40시간 정규직의 4.2배를 일합니다. 그래서 3,300만~1억 7,100만 개는 정규직 1억 4,000만~7억 2,000만 명의 주당 노동시간과 같고, 중심 가정의 5,030만~1억 60만 개를 같은 식으로 바꾸면 제 계산으로 2억 1,000만~4억 2,000만 명분입니다. 미국 인구는 3억 4,200만 명이고, 보고서가 인용한 딜로이트 추정으로 미국 지식노동자는 약 1억 명입니다. 딥시크 V4 Pro로 돌리는 19억 개는 주 40시간 일하는 사람 80억 명분입니다.
이 숫자는 노동시간만 센 값입니다. 보고서는 에이전트가 사람보다 훨씬 빨리 결과를 내지만 그 결과의 질은 들쭉날쭉하다고 덧붙였습니다. 에이전트 하나도 지금의 모델이 하네스 안에서 도구를 부르며 쉬지 않고 도는 세션 하나를 가리킬 뿐이고, 사람 한 명의 일을 온전히 해낸다는 가정은 들어 있지 않습니다.
이 대목은 지난 8월 드와케시 파텔의 계산과 견줘 볼 만합니다. 드와케시는 AI가 사람 한 명의 일을 온전히 해낸다고 가정하고 1GW로 화이트칼라 약 100만 명분을 돌린다고 어림했고, 한 회사의 AI 노동력이 해마다 10배로 는다고 봤습니다. 에포크는 전력 대신 메모리에서, 사람의 일 대신 지금 모델의 작업 시간에서 출발했습니다. 같은 「몇 명분」이라도 세는 단위가 달라서 두 계산을 바로 맞대기는 어렵습니다.

에포크는 이 용량이 돈으로 얼마인지도 셌습니다. 출하된 메모리 가운데 40%를 돈을 받는 추론에 쓰고 그 가동률을 50%로 잡아, 전체 용량의 20%만 쓰는 가정입니다. 이때 API 정가로 매긴 연간 지출은 2026년까지 출하분으로 1조 1,000억~2조 1,000억 달러, 2027년까지 출하분으로 2조 6,000억~5조 3,000억 달러입니다.
비교 대상은 AI 개발사의 매출입니다. 주요 개발사의 연 환산 매출은 7~8월 기준 합계 약 1,105억 달러이고, 최근처럼 해마다 5배씩 늘면 2027년 말 약 1조 700억 달러가 됩니다. 에포크는 이 숫자를 예측이 아닌 예시 시나리오라고 밝혔는데, 그래도 용량의 20%가 만드는 지출이 이 매출의 2.4~5배입니다.
이 증설은 AI가 질문에 답하는 데서 나아가 여러 산업에서 경제적 가치가 있는 일을 해내리라는 데 건 내기입니다.— 제이슨 리, 에포크 AI 보고서 결론
공급 쪽 약정은 이미 커졌습니다. 로이터가 입수한 앤트로픽 투자설명서 초안에는 앞으로 낼 연산 약정 5,180억 달러의 약 80%를 무를 수 없다는 내용이 있었습니다. 수요 쪽에서는 사티아 나델라 마이크로소프트 CEO가 9월 25일 공개된 대담에서 에이전트 시대가 클라우드보다 몇 자릿수 크다면서도 고객이 토큰에 쓴 돈의 몇 배를 벌어야 한다는 조건을 달았습니다. 에포크도 사람 시급과 비슷한 값을 받는 에이전트라면 그만큼의 가치를 내야 이 지출이 정당화된다고 적었습니다.
가장 먼저 걸리는 가정은 출하된 메모리가 모두 데이터센터에 깔린다는 것입니다. 에포크는 HBM이 가속기 포장 공정에 들어가 완성되기까지 약 8주로 보지만, 데이터센터를 짓는 데 걸리는 시간은 그보다 훨씬 길고 예측하기 어렵다고 적었습니다. 보고서가 근거로 든 것은 나델라의 지난해 10월 발언입니다.
지금 가장 큰 문제는 연산 과잉보다 전력, 그리고 전력 가까이에 건물을 제때 지을 수 있느냐입니다. 그게 안 되면 꽂을 데가 없는 칩이 재고로 쌓일 수 있는데, 사실 그게 지금 제 문제입니다. 칩 공급은 문제가 안 되고, 꽂을 건물이 없습니다.— 사티아 나델라, 마이크로소프트 CEO (BG2 팟캐스트, 2025년 10월)
속도 조건도 있습니다. 기준으로 쓴 초당 토큰 수에는 첫 토큰이 나오기까지의 시간이 들어 있지 않습니다. 초당 50토큰을 지키면서 동시 세션을 가장 많이 올린 Kimi K3 설정은 첫 토큰까지 느린 쪽 기준 39.8초가 걸렸고, 같은 방식으로 고른 초당 100토큰 설정은 12.4초, 200토큰 설정은 4.6초였습니다. 에포크는 설정마다 배치가 달라 속도 기준이 첫 토큰 지연에 주는 영향만 따로 떼어 재지는 못했다고 적었습니다.
원가 배수 5~10배도 가정입니다. 에포크는 이 배수가 회사들의 실제 마진을 잰 값과는 다르다고 밝혔고, API 값만 오르면 한 시간 비용과 배수가 함께 올라 물리적 용량은 그대로라고 덧붙였습니다.
효율 향상은 양쪽으로 작용합니다. 에포크의 다른 분석에 따르면 같은 성능을 내는 값은 2023년 이후 분기마다 47%씩 떨어졌고, 같은 실력의 값이 해마다 50분의 1이 된다는 측정도 같은 흐름입니다. 과제 하나에 드는 연산이 절반으로 줄면 과제 수가 두 배를 넘게 늘 때에만 전체 연산 사용량이 늘고, 값이 내려 쓰임이 그보다 빨리 늘면 싸질수록 더 쓰는 제번스의 역설이 됩니다. 에포크는 오픈AI의 dots처럼 사용자 대신 계속 일하는 에이전트를 수요가 늘어날 경로로 꼽았습니다.
이 계산의 출발점은 HBM 출하량이고, 그 물량 대부분을 SK하이닉스와 삼성전자, 마이크론이 만듭니다. 트렌드포스는 지난해 5월 SK하이닉스가 HBM 점유율 50% 넘게를 지킬 것으로 봤고, 올해 8월에는 2027년 HBM 출하량이 50~60% 늘어도 수요를 따라가지 못한다고 내다봤습니다. 6월 분석에서는 세 회사가 D램 웨이퍼 투입량의 22%를 HBM에 쓰는 2026년 말에도 HBM이 D램 비트 공급의 9% 정도라고 했습니다. 에포크의 식에서는 이 출하량이 늘거나 줄면 에이전트 수도 같은 비율로 늘거나 줄어듭니다.

에포크가 공개한 계산 코드에서는 한 시간 비용과 원가 배수, HBM4 효율, 출하량 가운데 하나만 바꿔도 결과가 몇 배씩 움직입니다. 트렌드포스가 출하 전망을 고치거나 10월에 SK하이닉스와 삼성전자의 3분기 실적이 나오면 같은 식에 넣어 다시 셀 수 있고, 새 숫자가 나오면 이 계산을 다시 돌려 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림