# 모델 하나만 돌지만 초당 1만 7,000토큰, AMD가 Taalas를 인수했습니다
_AMD가 8월 6일 모델 가중치를 회로에 새기는 토론토 스타트업 Taalas를 인수한다고 발표했습니다. Llama 3.1 8B를 사용자당 초당 1만 7,000토큰 가까이 돌리지만, 칩 한 장이 모델 하나만 돌리고 고객이 그 모델을 1년은 쓴다는 전제가 붙습니다._
- 매체: 초이의 뉴스레터 · 아티클
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-08-07
- 링크: https://choi-newsletter.com/post/review-amd-taalas-model-in-silicon
- 답하는 질문: AMD가 인수한 Taalas는 어떤 회사인가
- 직답: Taalas는 모델 가중치를 칩 회로에 새겨 Llama 3.1 8B를 초당 1만 7,000토큰 가까이 돌리는 토론토의 추론 칩 스타트업입니다.
- 출처: AMD, AMD Acquires Taalas (2026-08-06) (https://ir.amd.com/news-events/press-releases/detail/1296/amd-acquires-taalas-to-advance-compute-solutions-for-rapidly-growing-ai-inference-market), AMD Newsroom, Taalas 인수 발표 (https://newsroom.amd.com/news/amd-acquires-taalas-ai-inference/), Taalas X, AMD 합류 발표 (2026-08-06) (https://x.com/taalas_inc/status/2085458427757937097), Taalas, The path to ubiquitous AI (2026-02-19) (https://taalas.com/the-path-to-ubiquitous-ai/), Taalas, HC1 제품 페이지 (https://taalas.com/products/), EE Times, Taalas Specializes to Extremes for Extraordinary Token Speed (2026-02-19) (https://www.eetimes.com/taalas-specializes-to-extremes-for-extraordinary-token-speed/), AMD, AMD and Cerebras Inference Solution (2026-07-23) (https://newsroom.amd.com/news/aai-2026-cerebras-inference/), AMD, 2026년 2분기 실적 (2026-08-04) (https://ir.amd.com/news-events/press-releases/detail/1295/amd-reports-second-quarter-2026-financial-results), Groq, Groq and Nvidia Licensing Agreement (2025-12-24) (https://groq.com/newsroom/groq-and-nvidia-enter-non-exclusive-inference-technology-licensing-agreement-to-accelerate-ai-inference-at-global-scale), NVIDIA, Vera Rubin Opens Agentic AI Frontier (Groq 3 LPX, 2026-03-16) (https://nvidianews.nvidia.com/news/nvidia-vera-rubin-platform), CNBC, 구글 Frozen v2 보도 (2026-07-20) (https://www.cnbc.com/2026/07/20/alphabet-googl-stock-ai-chip-report.html), The Information, Google Plans New Frozen Chip (2026-07-20) (https://www.theinformation.com/articles/google-plans-new-frozen-chip-run-ai-models-efficiently), Radical Ventures, Geoff Hinton & Jeff Dean in Conversation (https://www.youtube.com/watch?v=ue9MWfvMylE)
> AMD가 8월 6일 모델 가중치를 칩 회로에 새기는 Taalas를 인수한다고 발표했습니다. HC1은 Llama 3.1 8B를 초당 1만 6,960토큰으로 돌리고 100만 토큰당 0.75센트라고 회사는 밝혔지만, 칩 한 장이 모델 하나만 돌립니다.

AMD가 8월 6일(미국 시각) 캐나다 토론토의 AI 추론 칩 스타트업 Taalas를 인수한다고 발표했습니다. Taalas는 모델 가중치를 칩 회로에 직접 새겨 Llama 3.1 8B를 사용자 한 명당 초당 1만 7,000토큰 가까이 돌리는 칩을 만든 회사입니다. 인수 금액은 공개하지 않았고, 거래는 통상적인 종결 조건과 규제 승인을 거쳐 마무리됩니다.

Taalas는 발표 직후 X에 AMD 합류 소식을 올렸습니다. 모델에 맞춰 하드웨어를 설계하는 방식으로 AI 추론을 처음부터 다시 생각하려고 회사를 세웠고, AMD의 규모와 엔지니어링 자원으로 그 작업을 넓히겠다는 내용입니다. 글 끝에는 팀원 상당수가 AMD 캐나다에서 커 왔고 이제 집으로 돌아간다는 문장이 붙었습니다.

AMD는 Taalas의 기술을 가속기 로드맵에 넣고 Instinct GPU와 묶은 시스템 단위 제품으로 내놓겠다고 밝혔습니다. 2023년에 세워진 Taalas는 2월 기준 직원이 25명 안팎이었고, 2억 달러 넘게 투자를 받았지만 첫 제품은 24명이 3,000만 달러를 들여 만들었다고 밝혔습니다. 회사는 스스로를 20년 넘게 함께 일해 온 사람들이 주축인 작은 팀이라고 소개합니다.

## 칩 한 장에 모델 하나를 새깁니다

지금의 GPU는 모델 가중치를 메모리에 올려 두고 계산할 때마다 불러옵니다. 어떤 모델이든 올릴 수 있는 대신 가중치를 옮기는 데 시간과 전력이 듭니다. Taalas의 첫 칩 HC1은 Llama 3.1 8B의 가중치를 제조 단계에서 회로에 고정하는 마스크 ROM 방식으로 새겨 넣었고, 미세조정한 가중치와 대화 기록(KV 캐시)을 담을 작은 SRAM만 따로 붙였습니다. 배선과 트랜지스터 배치 자체가 모델이 되는 구조라, 다른 모델을 돌리려면 칩을 새로 찍습니다.

회사 홈페이지에는 「모델이 곧 컴퓨터」라는 문구가 걸려 있고, Taalas는 HC1이 현재 최고 수준보다 10배 가까이 빠르면서 만드는 비용은 20분의 1, 전력은 10분의 1이라고 주장합니다. 가중치는 고정돼 있지만 저랭크 어댑터(LoRA)로 미세조정한 가중치를 얹거나 문맥 길이를 조절할 수는 있습니다.

![중앙에 TAALAS 로고가 찍힌 칩을 얹은 파란색 PCIe 카드](https://taalas.com/h-content/uploads/2026/02/Taalas-HC1.png)

HC1은 TSMC 6나노 공정으로 만든 815제곱밀리미터 크기의 칩이고 트랜지스터는 530억 개입니다. 8B 모델 전체가 칩 한 장에 들어갑니다. 새기는 방식은 2000년대 초 쓰이던 구조화 ASIC에서 빌려 왔습니다. 반제품 웨이퍼를 미리 만들어 두고 배선 몇 겹만 바꿔 용도를 맞추던 방식인데, HC1은 회로를 웨이퍼에 찍는 형틀인 마스크 가운데 2장만 바꿔 가중치와 데이터가 흐르는 경로를 함께 바꿉니다.

밀도를 올린 방법은 일부만 밝혔습니다. 류비샤 바이치 CEO는 EE Times에 4비트 파라미터 하나를 트랜지스터 하나에 저장하고 곱셈까지 처리한다고 말했습니다. 자세한 원리는 공개하지 않았고, 연산은 모두 디지털 방식이라고 했습니다.

## 디코드는 메모리에서 가중치를 읽는 속도에 묶입니다

추론은 두 단계로 나뉩니다. 프리필은 사용자가 넣은 프롬프트 전체를 한꺼번에 읽는 단계라 연산이 많고, GPU가 잘하는 일입니다. 디코드는 토큰을 하나 만들 때마다 모델 가중치 전체를 메모리에서 다시 읽는 단계라, 계산 능력보다 메모리에서 데이터를 끌어오는 속도가 빠르기를 가릅니다. GPU를 더 붙여도 사용자 한 명이 느끼는 속도가 크게 오르지 않는 이유입니다.

바이치 CEO는 2월 회사 블로그에서 이 문제를 메모리와 연산 사이의 인위적인 경계라고 불렀습니다. 칩 밖 D램에 접근하는 속도는 칩 안 메모리보다 수천 배 느리고, 이 간극을 메우려고 HBM 적층과 첨단 패키징, 거대한 입출력 대역폭, 수랭이 붙는다는 설명입니다. 가중치를 칩 안에 새기면 메모리에서 읽어 올 일이 사라지고, HC1에는 HBM도 첨단 패키징도 수랭도 들어가지 않습니다.

같은 글에서 바이치는 코딩 도우미가 몇 분씩 생각하는 동안 개발자의 흐름이 끊기고, 사람 없이 도는 에이전트 앱은 밀리초 단위 응답을 요구한다고 적었습니다. 사람이 읽는 속도에 맞추던 시절에는 초당 몇십 토큰이면 충분했지만, 에이전트가 다른 에이전트의 답을 기다리는 구조에서는 기다린 시간만큼 작업 전체가 늦어집니다.

## 초당 1만 7,000토큰에 붙은 조건

Taalas가 2월 19일 공개한 그래프에서 HC1은 Llama 3.1 8B를 사용자 한 명당 초당 1만 6,960토큰으로 돌렸습니다. 같은 모델에서 세레브라스는 1,981토큰, 삼바노바는 932토큰, 그록은 594토큰이었고, Taalas가 직접 잰 엔비디아 B200은 353토큰, H200은 230토큰이었습니다. 세레브라스와 삼바노바, 그록 수치는 외부 측정 기관 Artificial Analysis의 값입니다.

![Llama 3.1 8B의 사용자당 초당 토큰 막대그래프. 엔비디아 H200 230, B200 353, 그록 594, 삼바노바 932, 세레브라스 1,981, Taalas HC1 16,960](https://taalas.com/h-content/uploads/2026/02/graph.png)

외부에서도 속도는 확인됐습니다. EE Times가 공개 데모 챗봇 chatjimmy.ai를 직접 써 봤을 때 초당 1만 5,000토큰을 넘었고, 질문을 넣으면 답이 한 글자씩 흘러나오는 대신 거의 한꺼번에 뜹니다. 다만 Taalas가 새긴 Llama는 3비트와 6비트 파라미터를 섞어 공격적으로 양자화한 버전이라, GPU에서 잰 벤치마크보다 답의 품질이 떨어진다고 회사가 직접 밝혔습니다. 양자화는 가중치를 적은 비트로 줄여 담는 방식이고, Taalas는 2세대 칩부터 표준 4비트 부동소수점 형식을 쓰겠다고 했습니다.

## 서버 한 대 2.5킬로와트, 소프트웨어 엔지니어 한 명

칩이 단순해지면 시스템도 단순해집니다. HC1 한 장은 약 250와트를 쓰고, 카드 10장을 꽂은 서버가 2.5킬로와트 수준이라 수랭 없이 일반 공랭 랙에 들어갑니다. HBM이 없으니 칩 사이를 잇는 고속 연결이나 메모리를 나눠 관리하는 복잡한 스케줄링도 필요 없습니다.

바이치 CEO는 EE Times에 소프트웨어가 사실상 사라졌다고 말했습니다. 칩 위에서 모델을 돌리고 대규모로 서비스하는 소프트웨어 스택을 엔지니어 한 명이 맡고 있고, 그 사람도 다른 일을 함께 한다고 했습니다. 국내 데이터센터처럼 전력 배정이 빠듯한 곳에서는 랙당 전력과 냉각 방식이 설치 여부를 가릅니다. 10MW 넘는 전기를 새로 쓰려면 거쳐야 하는 국가 심사는 [국내 데이터센터 전력 병목을 짚은 글](/post/review-electricity-is-the-new-currency)에 있습니다.

## 100만 토큰 0.75센트는 1년 약속을 전제로 합니다

Taalas가 계산한 Llama 3.1 8B의 처리 비용은 100만 토큰당 0.75센트입니다. GPU는 4년에 한 번 바꾼다고 보고 Taalas 칩은 해마다 새로 찍는 비용까지 넣은 계산이고, 고객이 같은 모델을 적어도 1년은 쓰겠다고 약속한다는 전제가 붙습니다. 바이치 CEO도 이 전제를 숨기지 않았습니다.

> 이 아이디어의 뿌리에는 고객이 1년 동안 이 칩과 모델을 쓰기로 약속할 것이라는 가정이 있습니다. 그러지 않을 사람도 분명 많겠지만, 그러는 사람도 있을 겁니다.
> — 류비샤 바이치, Taalas CEO (EE Times 인터뷰)

Taalas의 제품 담당 부사장 파레시 카르야는 같은 인터뷰에서, 지금까지 이야기를 나눈 고객들이라면 중요한 업무에 쓰는 모델을 1년이나 그 이상 유지할 것으로 충분히 예상할 수 있다고 말했습니다. 모델에 맞춘 칩이 GPU로 가득한 데이터센터를 대신하지는 못해도, 모델이 쓸 만큼 무르익을수록 한번 새긴 모델을 오래 쓰게 만든다는 설명도 덧붙였습니다.

큰 모델로 가면 계산이 복잡해집니다. SRAM을 별도 칩으로 떼어 내면 칩 한 장에 파라미터를 약 200억 개까지 담을 수 있는데, 6,710억 파라미터짜리 딥시크 R1을 통째로 올리면 서로 다른 칩 30종가량을 따로 찍게 됩니다. Taalas의 시뮬레이션으로는 칩 30개가 사용자당 초당 약 1만 2,000토큰을 내고 100만 토큰당 7.6센트가 드는데, 처리량에 맞춘 GPU 구성의 절반이 안 되는 값입니다. 같은 조건의 GPU는 사용자당 초당 200토큰 안팎이라고 회사는 봤습니다.

| 구성 | 사용자당 초당 토큰 | 100만 토큰당 비용 |
| --- | --- | --- |
| Llama 3.1 8B, HC1 한 장 | 약 1만 7,000 | 0.75센트 |
| 딥시크 R1 671B, 칩 30개(시뮬레이션) | 약 1만 2,000 | 7.6센트 |

칩을 찍은 뒤에는 고칠 방법이 사실상 없어서, 30개 칩이 함께 도는 모습을 전부 시뮬레이션으로 검증합니다. 모델을 받아 회로 설계로 바꾸는 데 일주일, 실제 칩이 나오기까지 두 달이 목표입니다. Taalas는 2월 블로그에서 1세대 칩에 새긴 중간 크기 추론 모델을 봄에 연구실에서 돌린 뒤 서비스에 붙이고, 밀도를 높인 2세대 HC2에 새긴 프런티어급 모델은 겨울에 배치하겠다고 했습니다.

## AMD는 이 칩을 디코드에 붙일 수 있습니다

AMD가 이 기술을 어디에 쓸지는 2주 전 발표에 단서가 있습니다. AMD는 7월 23일 세레브라스와 손잡고 프리필은 Helios 랙이, 디코드는 세레브라스의 웨이퍼 크기 칩이 맡는 분리형 추론을 내놓았고, 세레브라스 단독 구성보다 와트당 토큰이 최대 5배 높다고 밝혔습니다. 세레브라스는 나스닥에 상장한 회사이고, 오픈AI와도 750메가와트 규모, 200억 달러가 넘는 여러 해 계약을 맺었습니다. Helios가 어떤 랙인지와 AMD가 넘어야 할 조건은 [AMD와 CUDA 해자를 다룬 글](/post/review-amd-helios-cuda-moat)에 정리했습니다.

Taalas는 그 디코드 단계에 넣을 수 있는 두 번째 카드입니다. 세레브라스 구성은 모델을 바꿔 돌릴 수 있지만, Taalas를 붙이면 그 랙은 특정 모델에 묶입니다. 트래픽이 많고 모델을 거의 바꾸지 않는 작업만 골라 칩으로 찍어 내면, 제휴사에 맡기던 디코드 가속을 AMD가 자기 부품으로 처리할 수 있습니다.

AMD 전체로 보면 작은 베팅입니다. AMD의 2분기 매출은 1년 전보다 50% 늘어난 115억 달러였고, 그 가운데 데이터센터가 67억 달러로 107% 늘었습니다. 인수 금액을 공개하지 않은 만큼 실적에 영향을 줄 규모는 아닌 것으로 보입니다. 리사 수 CEO는 인수를 발표하며 AI 추론의 최전선에서 일하는 팀이라고 소개했습니다.

## 창업자는 AMD로 돌아갑니다

바이치 CEO는 AI 칩 회사 텐스토렌트의 공동창업자로 CEO와 CTO를 지냈고, 그전에는 AMD에서 CPU·GPU 통합 칩과 집적회로 설계를 이끌었습니다. Taalas 공동창업자 세 명 모두 AMD 출신입니다.

바이치가 떠난 텐스토렌트에는 짐 켈러가 2023년 초 CEO로 왔습니다. 텐스토렌트는 지난해 12월 인력의 7.5%를 줄여 1,000명 규모가 됐고, 판매 대상을 기업에서 개인 개발자로 돌렸습니다. 텐스토렌트가 범용 칩을 개발자에게 파는 동안, 바이치가 새로 세운 Taalas는 유연성을 버리고 모델 하나에 모든 것을 맞춘 칩으로 설립 3년 만에 AMD에 팔렸습니다.

## 엔비디아는 디코드 전용 칩을 들여왔습니다

엔비디아는 이보다 반년 넘게 먼저 움직였습니다. 그록은 지난해 12월 24일 엔비디아에 자사 추론 기술을 비독점으로 라이선스하고, 창업자 조너선 로스와 서니 마드라 사장 등이 엔비디아로 옮긴다고 발표했습니다. EE Times는 이 거래를 200억 달러 규모로 전했습니다.

결과는 3월 GTC에서 나왔습니다. 엔비디아는 그록 기술로 만든 LPU(언어 처리 장치) 256개를 한 랙에 담은 Groq 3 LPX를 공개했는데, 랙 전체의 온칩 SRAM이 128GB이고 Vera Rubin 랙 옆에 붙어 GPU와 함께 디코드를 맡습니다. 출시는 올해 하반기로 잡았습니다. LPU 칩 LP30은 삼성 파운드리에서 만들고, 지난해 9월 프리필용으로 예고했던 Rubin CPX는 당장의 로드맵에서 빠졌습니다.

![검은 배경에 서 있는 엔비디아 Groq 3 LPX 랙. 금색 트레이가 위아래로 빼곡히 꽂혀 있다](https://iprsoftwaremedia.com/219/files/202603/69b83c0e3d6332288a74de14_nvidia-groq3-lpx-rack/nvidia-groq3-lpx-rack_mid.jpg?v=e7ae19fb-d32c-4929-8087-8802cdc3ee67)

젠슨 황 CEO는 GTC 기조연설에서 지연이 짧은 고급 토큰 생성이 앞으로 AI 클러스터 연산의 25% 정도를 차지할 것으로 내다봤습니다. 같은 정밀도에서 R200 GPU의 연산 성능이 LP30보다 21배 높은데도 LPU를 따로 붙이는 이유는 응답 속도입니다. GPU는 많은 요청을 한꺼번에 처리하는 데 강하고, LPU는 사용자 한 명에게 토큰을 빨리 내보내는 데 강합니다. 에이전트끼리 작업을 주고받는 비중이 커질수록 응답 지연이 곧 비용이 되고, 엔비디아는 그 수요를 놓치지 않으려고 외부 기술을 사 왔습니다.

## 구글은 모델 구조까지만 굳힙니다

칩을 10년 넘게 직접 만들어 온 구글도 연산이 모자랍니다. CNBC가 전한 디 인포메이션 보도에 따르면 구글 클라우드는 사내 연산 부족 때문에 외부 고객의 일감까지 돌려보냈고, 구글은 제미나이 아키텍처 일부를 실리콘에 영구히 새기는 서버 칩 Frozen v2를 준비하고 있습니다. 최신 TPU보다 전력당 토큰을 6~10배 뽑는 것이 목표이고 배치 시점은 2028년입니다. 구글 인프라를 이끄는 아민 바흐닷은 5월 스탠퍼드 강연에서 경쟁의 기준을 확보한 기가와트보다 기가와트당 만들어 내는 가치로 잡아야 한다고 말했습니다.

Frozen v2는 앞으로 나올 제미나이 모델이 같은 구조를 유지할 때만 쓸 수 있어 그만큼 유연성을 내줍니다. 구글은 이 칩을 시험 성격으로 보고 TPU만큼 찍을 계획이 없다고 전해졌습니다. 구글은 모든 프로젝트가 양산으로 가지는 않는다며 확인도 부인도 하지 않았습니다.

가중치까지 칩에 새기는 첫 설계안은 모델 한 버전에 하드웨어가 묶이면 쓸 수 있는 기간이 너무 짧다는 이유로 접었다고 알려졌습니다. 구글 수석과학자 제프 딘은 지난해 12월 제프리 힌턴과 나눈 대담에서 하드웨어 설계가 왜 어려운지 이렇게 설명한 적이 있습니다.

> 하드웨어 설계자는 이 빠른 분야가 2년에서 6년 뒤 어디에 가 있을지 내다보려 합니다. 오늘 구상한 하드웨어는 대략 2년 반에서 6년 뒤에 쓰이게 되고, 그건 정말 어려운 일입니다.
> — 제프 딘, 구글 수석과학자 (Radical Ventures 대담)

제프 딘이 하드웨어 설계 시점을 말하는 대목은 45분 20초 무렵입니다

| 회사 | 전용 하드웨어 | 굳히는 범위 |
| --- | --- | --- |
| 엔비디아 | Groq 3 LPX(하반기) | 디코드 단계를 전용 장비에 맡김 |
| 구글 | Frozen v2(2028년 목표) | 모델 구조까지 굳히고 가중치는 바꿀 수 있음 |
| AMD | Taalas HC1 | 가중치까지 칩에 새김 |

모델을 만드는 회사도 같은 계산을 하고 있습니다. 앤트로픽은 8월 5일 자체 칩을 설계하는 사내 팀을 꾸리고 있다고 확인했고, 목표를 토큰당 추론 비용 절반으로 잡았습니다. 트랜스포머 구조를 실리콘에 고정하겠다며 출발한 Etched는 시리즈 C 투자에서 기업가치 103억 달러를 인정받았는데, 지금 공개한 설계는 HBM과 SRAM을 함께 쓰는 하이브리드입니다. SRAM만 쓸 때 생기는 비용과 수율, 발열 문제를 피하려는 선택이라고 회사가 밝혔습니다.

## HBM 없는 칩이 메모리 수요에 주는 신호

Taalas 칩은 HBM을 전혀 쓰지 않고 D램 인터페이스도 없습니다. HBM과 D램 값이 1년 내내 높았고 물량 확보도 어려웠던 시기라, 메모리를 쓰지 않는 설계는 그만큼 매력이 있습니다. 다만 8B 모델 하나를 새긴 칩이 줄이는 메모리 물량과 수천억 파라미터 모델을 서비스하는 랙이 쓰는 물량은 자릿수가 다릅니다.

Taalas가 노리는 시장은 대형 HBM 랙에 맡기기에는 아까운 대규모 반복 트래픽입니다. 같은 모델로 1년 넘게 돌아가는 상담이나 문서 처리 같은 서비스가 그런 예입니다. 효율이 높아진다고 전체 메모리 수요가 줄어드는 것도 아니어서, 이 인수만으로 한국 메모리 회사가 파는 HBM 물량이 줄어든다고 볼 근거는 아직 약합니다.

## 모델 교체 주기에 달린 베팅

AMD는 이번 인수로 작업에 따라 칩을 나눠 붙일 수 있게 됐습니다. 프리필은 Instinct GPU가 맡고, 디코드는 세레브라스나 Taalas로 넘기고, 그중 트래픽이 많고 모델을 거의 바꾸지 않는 작업만 칩으로 찍어 낼 수 있습니다. 모든 AI 작업에 맞는 연산을 골라 쓰게 하겠다는 AMD의 전략을 끝까지 밀면 이런 구성이 나옵니다.

이 베팅이 맞는지는 모델 교체 주기에 달려 있습니다. 같은 모델을 1년 넘게 쓰는 서비스가 늘면 가중치까지 새긴 칩이 유리하고, 상위 모델이 몇 달마다 바뀌는 지금 흐름이 이어지면 가중치를 새기는 안을 접은 구글의 판단에 힘이 실립니다. 인수 뒤에도 2세대 HC2와 프런티어급 모델 일정이 그대로 갈지는 아직 알 수 없습니다.

읽어 주셔서 고맙습니다.

초이 드림
