# 엔비디아 GPU로 초당 1,107토큰, 에르몬 "더 병렬적인 해법이 이긴다"
_No Priors · 스테파노 에르몬 · 2026년 9월 18일_
- 매체: 초이의 뉴스레터 · 팟캐스트
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-09-19T10:00
- 링크: https://choi-newsletter.com/post/podcast-no-priors-stefano-ermon-inception-diffusion
- 답하는 질문: 확산 언어 모델은 왜 빠른가
- 직답: 확산 언어 모델은 토큰 여러 개를 한꺼번에 다듬어 GPU를 더 잘 쓰고, Inception은 Mercury 2.5가 초당 1,107토큰을 낸다고 밝혔습니다.
- 에피소드: No Priors · https://traffic.megaphone.fm/PDP7720707490.mp3
- 출처: YouTube, No Priors 채널 에피소드 영상 (2026-09-18) (https://www.youtube.com/watch?v=N1rjtDs8blY), Apple Podcasts, No Priors 에피소드 페이지 (https://podcasts.apple.com/us/podcast/why-diffusion-will-win-ai-inference-with-inception-co/id1668002688?i=1000790491295), 스테파노 에르몬 X, Mercury 2.5 공지 (2026-09-08) (https://x.com/StefanoErmon/status/2097363229681099062), Inception X, OpenCall 사례 (2026-09-09) (https://x.com/_inception_ai/status/2097732346019709239), Inception, Introducing Mercury 2.5 (2026-09-08) (https://www.inceptionlabs.ai/blog/introducing-mercury-2-5), Inception, Mercury 2: the first reasoning model fast enough to pick up the phone (2026-07-14) (https://www.inceptionlabs.ai/blog/mercury-2-the-first-reasoning-model-fast-enough-to-pick-up-the-phone), Inception, The Next Step for dLLMs: Scaling up Mercury (5,000만 달러 투자 발표) (https://www.inceptionlabs.ai/blog/mercury-refreshed), TechCrunch, Inception raises $50 million to build diffusion models for code and text (2025-11-06) (https://techcrunch.com/2025/11/06/inception-raises-50-million-to-build-diffusion-models-for-code-and-text/), Yang Song, Stefano Ermon, Generative Modeling by Estimating Gradients of the Data Distribution (arXiv 1907.05600) (https://arxiv.org/abs/1907.05600), Aaron Lou, Chenlin Meng, Stefano Ermon, Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution (arXiv 2310.16834) (https://arxiv.org/abs/2310.16834), Tri Dao 외, FlashAttention (arXiv 2205.14135) (https://arxiv.org/abs/2205.14135), Rafael Rafailov 외, Direct Preference Optimization (arXiv 2305.18290) (https://arxiv.org/abs/2305.18290)
> 확산 모델 연구자 스테파노 에르몬이 9월 18일 No Priors에서 한 번에 여러 토큰을 만드는 확산 언어 모델이 추론에서 유리하다고 말했습니다. 그가 이끄는 Inception의 Mercury 2.5는 엔비디아 GPU에서 초당 1,107토큰을 낸다고 회사가 밝혔습니다.

확산 모델의 기초를 놓은 연구자 가운데 한 명인 스탠퍼드대 교수 스테파노 에르몬(Stefano Ermon)이 9월 18일(미국 시각) 공개된 No Priors에 나와, 앞으로 AI 경쟁은 속도와 효율에서 갈리고 추론에서는 토큰을 한꺼번에 여러 개 만드는 확산 언어 모델이 유리하다고 말했습니다. 그가 공동창업해 CEO를 맡은 Inception은 10일 전 Mercury 2.5를 내놓으며 널리 쓰이는 엔비디아 GPU에서 초당 1,107토큰을 낸다고 밝혔습니다. 진행자 사라 궈와 나눈 38분 대화에는 확산 방식이 아직 최전선 지능에 이르지 못했다는 그의 인정도 들어 있습니다.

에르몬은 Mercury 2.5를 공개한 9월 8일 X에 이 모델이 시장에서 가장 뛰어난 확산 언어 모델이고, Mercury 2보다 지능 지표가 40% 높으며 초당 1,100토큰 넘게 돈다고 적었습니다. 이어진 글에서는 AI 전화 상담원을 만드는 OpenCall이 AI 추론 칩 업체에서 Mercury로 옮긴 뒤 응답 지연의 중앙값이 200밀리초 아래로, 가장 느린 1%는 몇 분에서 1초로 줄었다고 소개했습니다. Inception API와 OpenRouter, Baseten에서 쓸 수 있고, 정가는 100만 토큰당 입력 0.20달러, 출력 0.75달러이지만 출시 기념으로 80% 깎아 입력 0.04달러, 출력 0.15달러에 판다는 안내도 붙였습니다. 저는 9월 9일 스레드에서 검색과 음성, 코딩 에이전트처럼 모델을 여러 번 부르는 작업일수록 이 속도 차이가 크게 느껴질 거라고 적었습니다.

## 속도를 칩으로 사던 해

올해 AI 업계는 속도를 주로 칩으로 샀습니다. 오픈AI는 2월 세레브라스 칩에서 GPT-5.3-Codex-Spark를 초당 1,000토큰 넘게 돌렸고, 8월 13일에는 [같은 칩으로 GPT-5.6 Sol을 최대 14배 빠르게 돌리는 Ultrafast 모드](/post/interview-tibo-codex-personal-agent)를 예고했습니다. Inception은 7월 블로그에서 특수 칩은 용량이 모자라 12개월 넘게 기다려야 하는 경우가 많고, 세레브라스는 오픈AI와 맺은 대형 다년 계약에 자원 대부분이 묶였다고 주장했습니다. 진행자 사라 궈는 연산과 공급이 모자란 환경에서는 효율에 쏠리는 관심이 크게 늘 거라며 대화를 이 주제로 끌고 갔습니다.

에르몬은 이 물음에 답할 이력을 가진 사람입니다. 2014년 스탠퍼드 조교수가 된 뒤 생성 모델만 연구했고, 2019년 제자 양쑹과 함께 쓴 논문에서 잡음을 걷어 내는 신경망으로 그림을 만드는 점수 기반 생성 모델을 내놓았습니다. 이 방식이 지금의 확산 모델로 이어져 이미지와 영상, 음악, 단백질 생성의 바탕이 됐고, 연구실 규모의 모델로 GAN을 앞선 결과가 Stable Diffusion과 Midjourney로 이어졌다는 것이 그의 설명입니다.

그는 긴 문맥 처리를 빠르게 만든 FlashAttention의 공동 저자이자 공동 지도교수였고, 선호 데이터로 모델을 정렬하는 DPO도 그의 연구실 순환 연구 과제에서 시작했다고 했습니다. Inception은 2025년 11월 멘로 벤처스가 이끌고 엔비디아의 NVentures와 마이크로소프트의 M12가 참여한 5,000만 달러 시드 투자를 받았고, 앤드루 응과 안드레이 카파시도 개인 자격으로 돈을 댔습니다.

## 10번째 토큰은 앞의 9개를 기다린다

에르몬의 논리는 2017년에서 출발합니다. 그해 순환 신경망(RNN) 대신 트랜스포머가 쓰이기 시작한 것은 토큰을 하나씩 처리해 느리던 학습을 여러 토큰을 한꺼번에 처리하게 만들었기 때문이었습니다. 한데 답을 만드는 추론 단계에서 지금의 자기회귀 모델은 여전히 한 번에 한 토큰씩 왼쪽에서 오른쪽으로 씁니다. 10번째 토큰은 앞의 9개가 나와야 만들 수 있고, 토큰마다 모델 가중치를 메모리에서 옮겨 오느라 시간을 쓰면서 계산은 조금밖에 하지 않으니 GPU가 제 능력을 쓰지 못한다는 겁니다.

확산 모델은 잡음에서 출발해 답 전체를 여러 번 다듬습니다. 한 번 다듬을 때마다 여러 토큰을 동시에 처리하니 추론의 계산 모양이 학습과 비슷해지고, GPU가 잘하는 행렬 곱셈에 잘 맞는다는 설명입니다. 그는 이 차이가 갈수록 커진다고 봤습니다. 추론 모델은 답을 내기 전에 생각하는 데 연산을 더 쓰는 방향으로 발전했고, 강화학습으로 모델을 다듬을 때도 모델이 과제를 풀어 보는 시도를 뽑아내는 추론이 병목이기 때문입니다.

> 쓰라린 교훈은 더 병렬적인 해법이 끝내 이긴다는 것입니다.
> — 스테파노 에르몬, Inception 공동창업자 겸 CEO (No Priors)

글자 같은 이산 데이터에서는 이 방식이 쉽지 않았습니다. 두 픽셀의 색 사이에는 중간값이 있지만 두 단어 사이에는 중간이 없어서 새로운 이론이 필요했다는 겁니다. 그가 2024년의 돌파구로 꼽은 연구실 논문은 2023년 10월 arXiv에 처음 올라왔습니다. 논문은 비슷한 크기라면 확산 언어 모델이 GPT-2를 앞선다고 보고했고, 샘플링 단계를 줄여 신경망 평가 횟수를 32분의 1로 낮춰도 비슷한 품질을 낸다고 적었습니다. 에르몬은 방송에서 10억 파라미터 아래 규모에서 자기회귀 모델과 같은 퍼플렉시티(모델이 데이터를 얼마나 잘 예측하는지 재는 값)를 내면서 글을 10배쯤 빨리 만들었고, 이 결과를 키워 보려고 회사를 세웠다고 했습니다.

## 하이쿠급 품질에 3~11배 속도

에르몬의 말로는 Inception은 창업 2년쯤 된 약 50명 규모의 회사입니다. 에르몬은 Mercury 모델이 벤치마크로 보면 앤트로픽의 Haiku, 구글의 Flash, 오픈AI의 mini·nano 같은 속도 최적화 모델과 비슷한 품질을 내면서 훨씬 빠르다고 했습니다. Inception이 Mercury 2.5 발표에 실은 속도 비교에서 Mercury 2.5는 초당 1,107토큰으로 Gemini 3.5 Flash-Lite(321)의 약 3.4배, Claude Haiku 4.5(127)의 약 8.7배, GPT-5.6 Luna 저강도(99)의 약 11배였습니다.

![초당 토큰 수 막대그래프. Mercury 2.5 1,107, Gemini 3.5 Flash Lite 321, Claude Haiku 4.5 127, GPT-5.6 Luna (Low) 99.](https://framerusercontent.com/images/BARaMxWJeRwFMQM349geFUJA5c8.png)

이 속도를 내려고 서빙 엔진부터 새로 짰습니다. 자기회귀 모델을 돌리는 vLLM이나 SGLang으로는 확산 언어 모델을 돌릴 수 없어서, 실제 서비스의 복잡한 부하를 감당하는 엔진을 직접 만들었다는 겁니다. 에르몬은 이 엔진과 고객에게서 모은 데이터, 그 데이터로 만든 평가가 대형 연구소가 쉽게 베끼지 못하는 해자라고 했습니다. 모델 크기와 학습 연산은 영업 비밀이라며 밝히지 않았습니다.

Mercury 2.5는 Mercury 2보다 대부분 항목에서 올랐습니다. 회사 표에서 여러 턴에 걸쳐 도구를 쓰는 고객 상담 평가 Tau3Bench Telecom은 65%에서 96%로, 긴 문맥 추론 평가 AA-LCR은 41%에서 68%로, TerminalBench는 25%에서 37%로 올랐습니다. 한데 지식 정확도를 재는 Omniscience Accuracy는 24%에서 22%로 내려갔고, 품질 비교 대상도 GPT-5.6 Luna 저강도와 Gemini 3.5 Flash-Lite, Claude Haiku 4.5 같은 비용 최적화 모델이었습니다.

## 음성 상담원이 칩을 바꾼 이유

에르몬이 속도가 이기는 곳으로 든 첫 사례는 음성 에이전트입니다. 전화 상담은 말을 받아 적는 음성 인식, 도구를 부르고 할 말을 정하는 추론 LLM, 답을 읽는 음성 합성으로 이어지는데, 품질을 높이려면 가운데 LLM이 추론 모델이어야 합니다. OpenCall은 그 LLM을 세레브라스 칩에서 돌리다가 Mercury로 옮겼고, 특수 칩에서 자기회귀 모델을 돌릴 때와 같은 속도를 흔히 구할 수 있는 엔비디아 GPU에서 더 싸게 얻었다는 것이 에르몬의 설명입니다. Inception은 OpenCall이 칩 업체를 떠난 뒤 하루 처리량을 3억 토큰에서 10억 토큰 넘게 늘렸다고도 밝혔습니다.

Inception의 7월 블로그는 이 시장의 제약을 숫자로 적었습니다. 음성 대화가 사람처럼 느껴지려면 LLM의 전체 응답 지연이 약 500밀리초 안에 들어와야 하는데, 생각 토큰 500개를 초당 60~100토큰으로 만들면 이 예산을 5~8초 넘긴다는 겁니다. 그래서 2025년 4월에 나온 GPT-4.1이 아직도 음성 에이전트 대부분의 두뇌로 쓰인다고 적었습니다.

![OpenCall의 실제 고객 상담 프롬프트 99개를 10번씩 돌려 첫 답변 토큰까지 걸린 시간을 모델별로 비교한 막대그래프. Mercury 2 instant 171ms, low 257ms, 세레브라스의 GPT OSS 120B low 296ms, medium 326ms, Mercury 2 medium 450ms, GPT 4.1 634ms, Claude 4.5 Haiku reasoning 4.38초.](https://framerusercontent.com/images/IfefP9tbG14ioYKFPxTs4RzHPs.png)

에르몬은 칩과 소프트웨어가 서로 대체하는 관계는 아니라고 했습니다. 소프트웨어에서 얻은 속도 이득은 하드웨어에서 얻은 이득과 곱해진다는 설명입니다. 사람들이 같은 품질이면 늘 더 빠른 쪽을 고르고 빠른 버전에 돈을 더 내는 것을 보면, 한번 빠른 모델에 익숙해지면 광대역 인터넷처럼 되돌아가기 어렵다고도 했습니다. 그는 오픈라우터의 작업 분류를 보고 계산해 보니 지연이 아주 중요한 작업이 전체의 20~30%였다며, 이것을 확산 모델이 가져갈 수 있는 최소한의 시장으로 봤습니다.

## 빨라져도 남는 병목

속도가 전부를 풀지는 않는다는 사실도 있습니다. 오픈AI의 티보 소티오는 8월 인터뷰에서 Ultrafast 모드가 최대 14배 빠르지만, 도구 호출이 많은 에이전트 작업에서는 3~4배 빨라진 정도로만 느껴진다고 했습니다. 모델이 글자를 만드는 시간은 줄어도 도구가 답을 돌려주기를 기다리는 시간은 그대로 남기 때문입니다. 확산 모델로 생성이 빨라져도 에이전트의 한 바퀴를 채우는 네트워크와 도구 대기 시간은 같은 방식으로 남습니다.

지능의 격차는 에르몬도 인정했습니다. 그는 확산 모델이 아직 최전선 수준의 지능에 이르지 못했고, 많은 작업에는 그 수준이 필요하다고 했습니다. 생태계도 얇습니다. 서빙 엔진부터 커널까지 거의 모든 것을 직접 만들어야 했고, 공개된 확산 모델은 품질이 좋지 않으며, Inception도 기술을 지키려고 모든 것을 공개하지는 않기로 해 외부 참여와 사내 설치형 배포가 어려워졌다고 했습니다. 연구 쪽에서도 확산 언어 모델은 [온도를 올려 답을 여러 개 뽑으면 정답률이 떨어지는 약점](/post/paper-sakana-unmaskfork)이 보고됐고, 구글 딥마인드는 실험용 텍스트 확산 모델 Gemini Diffusion을 초당 1,479토큰짜리 데모로 열어 두고 있습니다.

진행자는 새 구조의 성과가 연산을 가진 대형 연구소에 흡수될 수 있지 않으냐고 물었습니다. 에르몬은 처음에는 연구진의 아이디어와 영업 비밀이 해자이고, 제품을 일찍 내놓아 실제 고객과 부딪히며 만든 서빙 소프트웨어와 평가가 시간이 갈수록 해자가 된다고 답했습니다.

## 확산이 더 잘할 수 있는 일

에르몬은 속도 말고도 확산 모델이 더 잘할 수 있는 일을 두 가지 들었습니다. 자기회귀 모델은 답을 끝까지 만들어야 조건을 만족하는지 알 수 있지만, 확산 모델은 거친 윤곽에서 세부로 다듬어 가서 처음부터 보상 함수나 제약 조건 쪽으로 생성을 이끌 수 있다는 겁니다. 그는 용해도 같은 조건을 맞춰야 하는 분자 생성을 예로 들며, 확산 모델이 더 다루기 쉽다는 증거가 학계에 많다고 했습니다. 잡음을 넣었다 빼며 배우는 방식이 같은 데이터를 여러 번 변형해 보는 효과를 내서 데이터 효율도 높을 수 있고, 이것이 큰 규모에서도 통하면 데이터가 부족한 과제에서 쓸모가 커진다고 했습니다.

AI가 연구를 스스로 앞당기는 재귀적 자기개선은 아직이라고 봤습니다. 프런티어 연구소의 모델을 많이 써서 아이디어를 시험하는 속도는 크게 빨라졌지만, 다른 곳이 가진 모델에는 자기들이 접근하지 못할 수도 있다고 단서를 달았고, 올바른 아이디어를 내고 가능성이 큰 방향을 고르는 사람의 창의성이 여전히 중요하다고 했습니다. 50명 규모인 회사의 병목도 사람보다 연산이라고 했습니다. Inception은 Mercury 2.5를 내놓으며 이미 가장 큰 다음 모델의 학습을 시작했고, 몇 달 안에 공개하는 것이 목표라고 밝혔습니다.

읽어 주셔서 고맙습니다.

초이 드림
