처리량
throughput · 스루풋 · 와트당 처리량
일정 시간에 처리하거나 전달한 작업·데이터의 양입니다. 초당 요청 수, 토큰 수, 비트 수처럼 대상과 단위를 함께 표시합니다. 와트당 처리량은 전력까지 나눈 별도의 효율 지표입니다. 많이 처리했다는 사실만으로 결과의 품질이나 장애 뒤에도 남는 유효한 진척이 보장되지는 않습니다.
‘처리량’ 이 나오는 글5
막은 사기 금액이 한 달 새 10배, OpenRouter가 Stripe로 간 이유
OpenRouter CEO 알렉스 아탈라와 AMP의 안즈니 미다가 9월 25일 Latent Space에서 하루 10조 토큰을 넘긴 과정과 Stripe 합류 배경을 풀었습니다. 아탈라는 지난달 막은 사기 금액이 전달의 10배였다고 밝혔습니다.

GLM이 자기를 돌릴 시스템을 짰다, 13일 만에 처리량 3.22배
첫 구동 13일 뒤 처리량은 처음의 3.22배가 됐습니다. 파이썬 GIL 하나 때문에 20% 넘게 벌어지던 성능 차이를 1% 아래로 줄였고, 에이전트가 찾은 정밀도 문제의 수정은 오픈소스 라이브러리 Flash Linear Attention에 병합됐습니다.

100만 토큰을 0.9GB에, 딥시크 V4.1 논문이 KV 캐시를 줄인 방법
딥시크 V4.1-Flash 보고서가 9월 17일 arXiv에 올라왔습니다. 전역 KV 캐시는 토큰당 890바이트로 V4-Flash의 4분의 1, SSD에 두는 캐시는 8분의 1이고, 문맥을 4K에서 1M으로 늘려도 토큰 하나 생성 계산은 4분의 1만 늘었습니다.

전력당 최대 1.9배, 오픈AI 첫 자체 칩 할라피뇨가 블랙웰을 앞섰습니다
오픈AI가 8월 25일 첫 자체 추론 칩 할라피뇨의 실측을 공개했습니다. 정격 700W로 GB200·GB300보다 전력당 처리량이 1.5~1.9배 많았고 HBM4 6개를 둘렀습니다. 멀티턴 벤치마크는 아직 돌리지 않았습니다.

80일 새 몸값 5배, Stripe가 모델 중개 회사 OpenRouter를 삽니다
5월 28일 시리즈 B에서 13억 달러 가치를 인정받은 OpenRouter를 Stripe가 70억 달러 넘게 주고 사기로 했다는 블룸버그 보도가 나왔습니다. 인수가 성사되면 에이전트가 모델을 고르고 토큰을 쓰고 값을 치르는 과정이 한 회사 안에 묶입니다.

함께 나오는 용어5
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 오픈라우터여러 회사의 모델을 하나의 API로 중계하고 사용량 순위를 공개하는 서비스입니다. 제작사 표기 없이 익명 모델을 먼저 올려 반응을 보는 통로로도 쓰여서, GLM-5.3-Flash는 공개 전 Ox Alpha라는 이름으로 이곳에 올라와 있었습니다.
- 추론 칩학습보다 서비스 단계의 연산에 맞춰 설계한 전용 칩입니다. 범용 GPU보다 전력당 처리량을 높이는 쪽에 초점이 있고, 모델 가중치를 회로에 새기는 극단적 설계까지 나왔습니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
