# HBM으로 센 AI 에이전트 최대 1억 7,100만, 에포크 계산을 뜯어보니
_에포크 AI가 2025~2027년 출하될 HBM으로 동시에 돌릴 수 있는 프런티어 모델 에이전트를 3,300만~1억 7,100만 개로 추정했습니다. 쉬지 않고 일하면 정규직 1억 4,000만~7억 2,000만 명의 주당 노동시간과 같지만, 수요가 이 증설을 따라올지는 가장 큰 불확실성으로 남겼습니다._
- 매체: 초이의 뉴스레터 · 논문
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-10-03T13:00
- 링크: https://choi-newsletter.com/post/paper-epoch-agent-population-hbm
- 답하는 질문: 2027년까지 AI 에이전트를 동시에 몇 개 돌릴 수 있나
- 직답: 에포크 AI는 2025~2027년 출하될 HBM으로 프런티어 모델 에이전트 3,300만~1억 7,100만 개를 동시에 돌릴 수 있다고 추정했습니다.
- 논문: Jason Li (Epoch AI) · Epoch AI 보고서 · https://epoch.ai/publications/estimating-the-agent-population
- 출처: Epoch AI, How many AI agents could run on the AI chips shipped through 2027? (제이슨 리, 2026년 10월 2일) (https://epoch.ai/publications/estimating-the-agent-population), Epoch AI 뉴스레터 요약, Hundreds of millions of AI agents are coming (2026년 10월 2일) (https://epochai.substack.com/p/hundreds-of-millions-of-ai-agents), Epoch AI 계산 코드(깃허브 compute-to-agents) (https://github.com/epoch-research/compute-to-agents), 트렌드포스, HBM4 제조 난도와 2026년 HBM 출하량 전망 (2025년 5월 22일) (https://www.trendforce.com/presscenter/news/20250522-12589.html), 트렌드포스, 2026년 AI 서버 출하·HBM 사용량 전망 (2025년 10월 30일) (https://www.trendforce.com/presscenter/news/20251030-12762.html), 트렌드포스, HBM 웨이퍼 투입 비중과 2027년 HBM 가격 전망 (2026년 6월 2일) (https://www.trendforce.com/presscenter/news/20260602-13074.html), 트렌드포스, 2027년 D램 공급과 Rubin Ultra HBM 구성 (2026년 8월 4일) (https://www.trendforce.com/presscenter/news/20260804-13166.html), 세미애널리시스 InferenceX AgentX 방법론 (https://inferencex.semianalysis.com/agentx/methodology), TraceLab 코딩 에이전트 작업 기록 데이터셋 (https://github.com/uw-syfi/TraceLab), 엔비디아 개발자 블로그, Rubin GPU 구조 (https://developer.nvidia.com/blog/inside-nvidia-rubin-gpu-architecture-powering-the-era-of-agentic-ai/), BG2 팟캐스트, 사티아 나델라·샘 올트먼 대담 (2025년 10월 31일) (https://www.youtube.com/watch?v=Gnl833wXRz0), 다리오 아모데이, Machines of Loving Grace (2024년 10월) (https://darioamodei.com/essay/machines-of-loving-grace), Epoch AI, The plunging price of thought (2026년 9월 22일) (https://epoch.ai/publications/the-plunging-price-of-thought)
> 에포크 AI가 10월 2일 HBM 출하량으로 AI 에이전트 수를 셌습니다. 2027년까지 나올 메모리로 프런티어 에이전트 3,300만~1억 7,100만 개를 동시에 돌릴 수 있고, 용량의 20%만 써도 연 2조 6,000억~5조 3,000억 달러어치입니다.

AI 연구기관 에포크 AI(Epoch AI)가 10월 2일(미국 시각) 2027년까지 출하될 AI 칩으로 에이전트를 몇 개나 돌릴 수 있는지 계산한 보고서를 냈습니다. 2025~2027년에 나올 HBM(고대역폭 메모리)을 모두 에이전트 작업에 쓰면 Claude Code나 Codex에서 도는 프런티어 모델 에이전트를 동시에 3,300만~1억 7,100만 개 돌릴 수 있고, 주 168시간 쉬지 않고 일하면 정규직 1억 4,000만~7억 2,000만 명의 노동시간과 같습니다. 같은 하드웨어에 딥시크 V4 Pro 같은 오픈 모델을 올리면 약 19억 개가 됩니다.

![2025~2027년 출하 메모리를 모두 한 작업에 쓴다고 할 때 동시에 돌릴 수 있는 에이전트 수를 로그 눈금에 찍은 그래프. 딥시크 V4 Pro 19억, GLM-5.2 5억 7,100만, Kimi K3 2억 4,000만, GPT-5.6 Sol 9,700만~1억 9,500만, Claude Fable 5 3,000만~6,000만](https://epoch.ai/assets/images/posts/2026/estimating-the-agent-population/figure-1.jpg)

보고서를 쓴 제이슨 리(Jason Li)는 에포크에서 AI 추론을 연구하고, 그전에는 엔비디아에서 대규모 언어 모델 서빙과 추론 최적화를 맡았습니다. 보고서는 다리오 아모데이 앤트로픽 CEO가 2024년 에세이에서 그린 「데이터센터 속 천재들의 나라」를 꺼내며 시작합니다. AI 회사들이 해마다 칩과 데이터센터에 수천억 달러를 쓰는 지금, 그 하드웨어가 실제로 몇 명분의 일을 감당할 수 있는지 숫자로 따져 보자는 질문입니다. 계산 코드는 깃허브에 아파치 2.0 라이선스로 공개됐습니다.

## 에이전트를 메모리로 세는 이유

에포크가 GPU 개수 대신 HBM을 단위로 고른 데는 두 가지 이유가 있습니다. HBM은 D램 칩 여러 장을 쌓아 GPU 바로 옆에 붙이는 메모리로, 모델의 가중치와 대화 맥락을 붙잡아 두는 KV 캐시를 함께 담습니다. 맥락이 길어질수록 요청 하나가 차지하는 KV 캐시가 커지니, 메모리 용량은 동시에 살려 둘 수 있는 요청 수를 정하고 메모리 대역폭은 토큰이 나오는 속도를 정합니다.

다른 하나는 공급입니다. HBM은 마이크론, 삼성전자, SK하이닉스 세 곳이 거의 모두 만들고, 엔비디아 GPU든 구글 TPU 같은 맞춤형 가속기든 이 메모리 없이는 완성되지 않습니다. 보고서는 마이크론과 SK하이닉스가 모두 수요가 공급을 넘는다고 밝혔고, 엔비디아가 공급난 때문에 다음 세대 Rubin Ultra의 메모리 구성을 줄이는 방안을 검토한다는 보도도 있었다고 적었습니다. 칩 생산의 주요 병목인 부품의 출하량을 세면 회사마다 다른 가속기를 한 단위로 묶을 수 있습니다.

계산은 곱셈 하나입니다. 2025년부터 출하된 HBM3E와 그 뒤 세대를 엔비디아 GB300 한 장에 들어가는 288GB 단위로 나눠 「GB300 환산 대수」를 구하고, 여기에 GB300 한 장이 동시에 돌리는 에이전트 수를 곱합니다. 같은 288GB라도 대역폭이 GB300의 HBM3E는 초당 8TB, 다음 세대 Rubin(VR200)의 HBM4는 초당 22TB라서, 에포크는 HBM4 시스템이 같은 메모리로 에이전트를 2배 돌린다고 보고 1배와 4배도 따로 계산했습니다.

| 출하 연도 | HBM 출하량 | HBM3E 비중 | HBM4·4E 비중 |
| --- | --- | --- | --- |
| 2025년 | 22억 1,000만 GB | 80% | 0% |
| 2026년(추정) | 37억 5,000만 GB | 62.5% | 37.5% |
| 2027년(추정) | 58억 1,000만 GB | 20% | 80% |

출하량은 시장조사업체 트렌드포스의 공개 자료에서 거꾸로 맞췄습니다. 트렌드포스가 지난해 5월 내놓은 「2026년 HBM 출하량 300억 기가비트(37억 5,000만 GB) 초과」를 2026년 값으로 쓰고, 「2026년 HBM 사용량 70% 넘게 증가」로 2025년 값을, 올해 8월의 「2027년 출하량 50~60% 증가」의 가운데값으로 2027년 값을 구했습니다. 세대별 비중은 트렌드포스가 연간 비율을 내놓지 않아 에포크가 가정한 값입니다. 이렇게 모은 3년 치를 더하면 288GB 묶음으로 3,933만 개, HBM4 효율을 2배로 쳐서 GB300 6,036만 대분입니다.

## GPU 한 장에 에이전트 몇 개

오픈 모델은 직접 잰 값이 있습니다. 반도체 분석 회사 세미애널리시스의 AgentX 벤치마크는 실제 Claude Code 작업 기록을 재생하면서 GPU 한 장이 에이전트 세션을 몇 개까지 동시에 감당하는지 잽니다. 느린 쪽 사용자 기준(P90)으로 초당 50토큰을 지키게 하면 GB300 한 장에 딥시크 V4 Pro 세션이 31.4개, GLM-5.2가 9.46개, Kimi K3가 3.97개 들어갔습니다. 보고서에 따르면 오픈AI와 앤트로픽은 프런티어 모델을 대개 초당 50~70토큰으로 서빙합니다. AgentX는 메인 에이전트와 그 아래 하위 에이전트를 한 세션으로 묶어 세고, 도구 실행을 기다리는 시간도 세션에 넣습니다.

![H100, H200, B200, B300, GB200, GB300, MI355X 일곱 가지 GPU에서 딥시크 V4 Pro, GLM-5.2, Kimi K3, MiniMax M3, Qwen 3.5 397B, Qwen 3.8 Flash Next, 딥시크 V4.1 Flash가 초당 50토큰과 100토큰 기준으로 GPU 한 장에 돌린 에이전트 세션 수를 색으로 칠한 표. GB300에서 딥시크 V4 Pro는 50토큰 기준 31.4개, 100토큰 기준 14.4개입니다](https://epoch.ai/assets/images/posts/2026/estimating-the-agent-population/figure-3.jpg)

닫힌 모델은 구조가 공개되지 않아 이렇게 잴 수 없습니다. 에포크는 Codex와 Claude Code의 실제 작업 기록을 모은 공개 데이터셋 TraceLab에서, 사람의 답을 기다린 시간을 빼고 에이전트가 쉬지 않고 일한 한 시간에 API 정가로 얼마가 드는지 계산했습니다. 기록은 4월 23일부터 7월 24일까지의 작업입니다.

| 모델·하네스 | 에이전트 한 시간 비용 |
| --- | --- |
| GPT-5.6 Sol · Codex | 15.50달러 |
| GPT-5.5 · Codex | 18.19달러 |
| Claude Opus 4.8 · Claude Code | 24.34달러 |
| Claude Fable 5 · Claude Code | 50.16달러 |
| Claude Fable 5 · Claude Code(맥락 50만 토큰 초과 작업) | 104.75달러 |

같은 Claude Code라도 모델과 맥락 길이에 따라 한 시간 값이 4배 넘게 갈렸고, 하네스(모델을 감싸 도구를 부르게 하는 프로그램)에 따라 [같은 모델의 청구서가 2배 차이 나는](/post/review-agent-harness-explainer) 일도 있습니다. 에포크는 Codex와 Claude Code 사이에 오는 한 시간 30달러를 기준값으로 잡고, 10~100달러도 따로 계산했습니다.

![TraceLab 작업 기록에서 에이전트가 쉬지 않고 일한 한 시간의 API 정가 비용을 모델·하네스별 상자 그림으로 그린 그래프. GPT-5.5와 GPT-5.6 Sol은 대체로 10~30달러, Claude Opus 4.8은 20달러 안팎, Claude Fable 5는 30~90달러에 몰려 있고 맥락 50만 토큰 초과 작업은 훨씬 비쌉니다](https://epoch.ai/assets/images/posts/2026/estimating-the-agent-population/figure-4.jpg)

한 시간 비용을 GPU 대수로 바꾸는 데는 가정이 하나 더 들어갑니다. API 매출이 실제 서빙 원가의 몇 배인지를 5~10배로 잡으면, 30달러짜리 에이전트 한 시간의 원가는 3~6달러입니다. 세미애널리시스가 집계한 GB300 3년 약정 임대료가 한 시간 5달러이니, GB300 한 장이 에이전트 0.83~1.67개를 돌리는 계산이 나옵니다. 에포크가 오픈 모델 벤치마크로 같은 배수를 거꾸로 구해 보니 딥시크 V4 Pro는 4.4~8.8배, GLM-5.2는 10.5배, Kimi K3는 4.1배로 가정한 범위 안팎에 있었습니다.

같은 GB300 한 장에 딥시크 V4 Pro는 31.4개, 닫힌 프런티어 모델은 0.83~1.67개라 19~38배 차이가 나는데, 앞의 것은 실제로 잰 동시 세션 수이고 뒤의 것은 API 값에서 거꾸로 구한 값입니다. 에포크는 두 쪽의 모델 능력과 작업량, 작업 시간을 재는 방식도 다르다고 적었습니다.

## 3,300만과 1억 7,100만 사이

GB300 6,036만 대분에 한 장당 0.83~1.67개를 곱하면, HBM4 효율을 2배로 본 중심 가정에서 2027년까지 출하분으로 5,030만~1억 60만 개입니다. HBM4 효율을 1배와 4배로 바꾸면 범위가 3,280만~1억 7,070만 개로 넓어지고, 에포크가 그래프 제목에 쓴 3,300만~1억 7,100만이 이 값입니다. 에포크는 이 범위가 신뢰구간이 아닌 시나리오의 폭이고, 연말에 실제로 켜져 있는 에이전트 수와는 다른, 배치를 마친 뒤의 용량이라고 밝혔습니다.

2026년까지 출하분에서 2027년까지 출하분으로 넘어가며 중심 가정의 숫자가 2.5배가 되는 데는 HBM4가 들어 있습니다. 실제 HBM 용량은 55억 GB에서 113억 GB로 2.1배 늘지만, 2027년 출하분의 80%를 HBM4로 보고 2배로 쳐서 GB300 환산 대수는 2,403만에서 6,036만으로 2.5배가 됩니다. 메모리 용량이 막히는 작업이면 대역폭이 늘어도 동시에 담을 수 있는 요청 수는 그대로라, 에포크는 HBM4 효과를 1배로 두는 경우도 함께 계산했습니다.

| 출하 기간 | HBM4 효율 1배 | 2배(중심 가정) | 4배 |
| --- | --- | --- | --- |
| 2025~2026년 | 1,600만~3,190만 개 | 2,000만~4,010만 개 | 2,820만~5,630만 개 |
| 2025~2027년 | 3,280만~6,560만 개 | 5,030만~1억 60만 개 | 8,530만~1억 7,070만 개 |

![HBM 출하분별 동시 에이전트 수 막대그래프. 2025~2026년 출하분은 중심 가정 2,000만~4,000만, 다른 가정까지 1,600만~5,600만이고 2025~2027년 출하분은 중심 가정 5,000만~1억, 다른 가정까지 3,300만~1억 7,100만입니다](https://epoch.ai/assets/images/posts/2026/estimating-the-agent-population/figure-7.jpg)

숫자를 가장 크게 흔드는 것은 한 시간 비용입니다. 매출 대비 원가 배수를 고정하면 에이전트 수는 한 시간 비용에 반비례해서, 2027년까지 출하분으로 한 시간 10달러짜리 에이전트는 9,830만~5억 1,210만 개, 100달러짜리는 980만~5,120만 개를 돌립니다. 메모리의 절반만 에이전트에 쓰면 에이전트 수도 절반이 됩니다. HBM의 50~70%를 엔비디아가 쓰고 나머지 가속기의 효율이 엔비디아의 50~75%라고 치면 전체 용량은 7.5~25% 줄어듭니다.

![에이전트 한 시간 비용이 10달러에서 100달러로 오를 때 2025~2027년 출하분으로 돌릴 수 있는 동시 에이전트 수가 수억 개에서 수천만 개로 줄어드는 곡선 그래프](https://epoch.ai/assets/images/posts/2026/estimating-the-agent-population/figure-8.jpg)

## 사람으로 치면 몇 명분인가

에이전트는 밤과 주말에도 일하니 한 주에 168시간, 주 40시간 정규직의 4.2배를 일합니다. 그래서 3,300만~1억 7,100만 개는 정규직 1억 4,000만~7억 2,000만 명의 주당 노동시간과 같고, 중심 가정의 5,030만~1억 60만 개를 같은 식으로 바꾸면 제 계산으로 2억 1,000만~4억 2,000만 명분입니다. 미국 인구는 3억 4,200만 명이고, 보고서가 인용한 딜로이트 추정으로 미국 지식노동자는 약 1억 명입니다. 딥시크 V4 Pro로 돌리는 19억 개는 주 40시간 일하는 사람 80억 명분입니다.

이 숫자는 노동시간만 센 값입니다. 보고서는 에이전트가 사람보다 훨씬 빨리 결과를 내지만 그 결과의 질은 들쭉날쭉하다고 덧붙였습니다. 에이전트 하나도 지금의 모델이 하네스 안에서 도구를 부르며 쉬지 않고 도는 세션 하나를 가리킬 뿐이고, 사람 한 명의 일을 온전히 해낸다는 가정은 들어 있지 않습니다.

이 대목은 지난 8월 드와케시 파텔의 계산과 견줘 볼 만합니다. 드와케시는 AI가 사람 한 명의 일을 온전히 해낸다고 가정하고 1GW로 화이트칼라 약 100만 명분을 돌린다고 어림했고, 한 회사의 AI 노동력이 해마다 10배로 는다고 봤습니다. 에포크는 전력 대신 메모리에서, 사람의 일 대신 지금 모델의 작업 시간에서 출발했습니다. 같은 「몇 명분」이라도 세는 단위가 달라서 두 계산을 바로 맞대기는 어렵습니다.

드와케시 파텔이 꺼낸 「AI 노동력 해마다 10배」 곱셈을 공개 자료로 다시 재 본 글입니다.

## 20%만 써도 연 2조 6,000억 달러

에포크는 이 용량이 돈으로 얼마인지도 셌습니다. 출하된 메모리 가운데 40%를 돈을 받는 추론에 쓰고 그 가동률을 50%로 잡아, 전체 용량의 20%만 쓰는 가정입니다. 이때 API 정가로 매긴 연간 지출은 2026년까지 출하분으로 1조 1,000억~2조 1,000억 달러, 2027년까지 출하분으로 2조 6,000억~5조 3,000억 달러입니다.

비교 대상은 AI 개발사의 매출입니다. 주요 개발사의 연 환산 매출은 7~8월 기준 합계 약 1,105억 달러이고, 최근처럼 해마다 5배씩 늘면 2027년 말 약 1조 700억 달러가 됩니다. 에포크는 이 숫자를 예측이 아닌 예시 시나리오라고 밝혔는데, 그래도 용량의 20%가 만드는 지출이 이 매출의 2.4~5배입니다.

> 이 증설은 AI가 질문에 답하는 데서 나아가 여러 산업에서 경제적 가치가 있는 일을 해내리라는 데 건 내기입니다.
> — 제이슨 리, 에포크 AI 보고서 결론

공급 쪽 약정은 이미 커졌습니다. 로이터가 입수한 앤트로픽 투자설명서 초안에는 [앞으로 낼 연산 약정 5,180억 달러의 약 80%를 무를 수 없다](/post/review-anthropic-s1-prospectus-compute)는 내용이 있었습니다. 수요 쪽에서는 사티아 나델라 마이크로소프트 CEO가 9월 25일 공개된 대담에서 [에이전트 시대가 클라우드보다 몇 자릿수 크다면서도 고객이 토큰에 쓴 돈의 몇 배를 벌어야 한다는 조건](/post/interview-nadella-agents-customer-surplus)을 달았습니다. 에포크도 사람 시급과 비슷한 값을 받는 에이전트라면 그만큼의 가치를 내야 이 지출이 정당화된다고 적었습니다.

## 계산에 들어가지 않은 것

가장 먼저 걸리는 가정은 출하된 메모리가 모두 데이터센터에 깔린다는 것입니다. 에포크는 HBM이 가속기 포장 공정에 들어가 완성되기까지 약 8주로 보지만, 데이터센터를 짓는 데 걸리는 시간은 그보다 훨씬 길고 예측하기 어렵다고 적었습니다. 보고서가 근거로 든 것은 나델라의 지난해 10월 발언입니다.

나델라의 해당 발언은 18분 27초부터 나옵니다.

> 지금 가장 큰 문제는 연산 과잉보다 전력, 그리고 전력 가까이에 건물을 제때 지을 수 있느냐입니다. 그게 안 되면 꽂을 데가 없는 칩이 재고로 쌓일 수 있는데, 사실 그게 지금 제 문제입니다. 칩 공급은 문제가 안 되고, 꽂을 건물이 없습니다.
> — 사티아 나델라, 마이크로소프트 CEO (BG2 팟캐스트, 2025년 10월)

속도 조건도 있습니다. 기준으로 쓴 초당 토큰 수에는 첫 토큰이 나오기까지의 시간이 들어 있지 않습니다. 초당 50토큰을 지키면서 동시 세션을 가장 많이 올린 Kimi K3 설정은 첫 토큰까지 느린 쪽 기준 39.8초가 걸렸고, 같은 방식으로 고른 초당 100토큰 설정은 12.4초, 200토큰 설정은 4.6초였습니다. 에포크는 설정마다 배치가 달라 속도 기준이 첫 토큰 지연에 주는 영향만 따로 떼어 재지는 못했다고 적었습니다.

원가 배수 5~10배도 가정입니다. 에포크는 이 배수가 회사들의 실제 마진을 잰 값과는 다르다고 밝혔고, API 값만 오르면 한 시간 비용과 배수가 함께 올라 물리적 용량은 그대로라고 덧붙였습니다.

효율 향상은 양쪽으로 작용합니다. 에포크의 다른 분석에 따르면 같은 성능을 내는 값은 2023년 이후 분기마다 47%씩 떨어졌고, [같은 실력의 값이 해마다 50분의 1이 된다는 측정](/post/review-frontier-gap-unknown-value)도 같은 흐름입니다. 과제 하나에 드는 연산이 절반으로 줄면 과제 수가 두 배를 넘게 늘 때에만 전체 연산 사용량이 늘고, 값이 내려 쓰임이 그보다 빨리 늘면 [싸질수록 더 쓰는](/post/review-price-per-intelligence-memory-rally) 제번스의 역설이 됩니다. 에포크는 [오픈AI의 dots](/post/news-openai-devday-dots-always-on-agents)처럼 사용자 대신 계속 일하는 에이전트를 수요가 늘어날 경로로 꼽았습니다.

## 한국 메모리 회사에 걸린 숫자

이 계산의 출발점은 HBM 출하량이고, 그 물량 대부분을 SK하이닉스와 삼성전자, 마이크론이 만듭니다. 트렌드포스는 지난해 5월 SK하이닉스가 HBM 점유율 50% 넘게를 지킬 것으로 봤고, 올해 8월에는 2027년 HBM 출하량이 50~60% 늘어도 수요를 따라가지 못한다고 내다봤습니다. 6월 분석에서는 세 회사가 D램 웨이퍼 투입량의 22%를 HBM에 쓰는 2026년 말에도 HBM이 D램 비트 공급의 9% 정도라고 했습니다. 에포크의 식에서는 이 출하량이 늘거나 줄면 에이전트 수도 같은 비율로 늘거나 줄어듭니다.

마이크론이 9월 30일 실적에서 2027년 HBM 물량 대부분을 이미 계약했다고 밝힌 내용과 삼성전자·SK하이닉스 숫자를 함께 정리한 글입니다.

에포크가 공개한 계산 코드에서는 한 시간 비용과 원가 배수, HBM4 효율, 출하량 가운데 하나만 바꿔도 결과가 몇 배씩 움직입니다. 트렌드포스가 출하 전망을 고치거나 10월에 SK하이닉스와 삼성전자의 3분기 실적이 나오면 같은 식에 넣어 다시 셀 수 있고, 새 숫자가 나오면 이 계산을 다시 돌려 전하겠습니다.

읽어 주셔서 고맙습니다.

초이 드림
