확산 모델
diffusion · dLLM
노이즈에서 조금씩 걷어내며 결과를 만드는 생성 방식입니다. 이미지에서 유명해졌고, 최근엔 토큰을 순서 없이 채우는 확산 언어모델(dLLM)도 연구됩니다.
‘확산 모델’ 이 나오는 글2
팟캐스트AI
엔비디아 GPU로 초당 1,107토큰, 에르몬 "더 병렬적인 해법이 이긴다"
확산 모델 연구자 스테파노 에르몬이 9월 18일 No Priors에서 한 번에 여러 토큰을 만드는 확산 언어 모델이 추론에서 유리하다고 말했습니다. 그가 이끄는 Inception의 Mercury 2.5는 엔비디아 GPU에서 초당 1,107토큰을 낸다고 회사가 밝혔습니다.

38분Stefano Ermon
논문AI
온도를 올리면 망가지는 확산 모델, 사카나는 두 모델에게 한 답을 나눠 맡겼습니다
사카나 AI가 7월 21일 확산 언어 모델 둘이 한 답을 번갈아 채우는 UnMaskFork를 소개했습니다. 같은 예산에서 LiveCodeBench 100문제 가운데 28문제를 풀어 기존 방법(19~21문제)을 앞섰고, 문제 하나에 H100 한 장으로 약 12분이 걸렸습니다.

12분
함께 나오는 용어5
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 오픈라우터여러 회사의 모델을 하나의 API로 중계하고 사용량 순위를 공개하는 서비스입니다. 제작사 표기 없이 익명 모델을 먼저 올려 반응을 보는 통로로도 쓰여서, GLM-5.3-Flash는 공개 전 Ox Alpha라는 이름으로 이곳에 올라와 있었습니다.
- 추론 칩학습보다 서비스 단계의 연산에 맞춰 설계한 전용 칩입니다. 범용 GPU보다 전력당 처리량을 높이는 쪽에 초점이 있고, 모델 가중치를 회로에 새기는 극단적 설계까지 나왔습니다.
- 지연어떤 시작점부터 정한 결과가 나타날 때까지의 지연 시간입니다. 네트워크의 편도·왕복 시간, 모델의 첫 토큰 시간, 답변 전체 완료 시간은 서로 다릅니다. 비교할 때는 시작과 끝의 기준, 캐시와 부하 조건을 맞추고 평균뿐 아니라 오래 걸린 요청의 분포도 확인해야 합니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
