이 글 어땠어요?
일반 트랜스포머는 서로 다른 층을 한 번씩 지나지만, 루프 트랜스포머는 가중치가 같은 층 묶음을 여러 번 되풀이합니다. Ouro-1.4B는 24층 묶음을 4번 돌려 96층 분량을 계산하고, 매개변수는 그대로인 채 반복 횟수만큼 계산이 늘어납니다.
반복을 절반으로 줄이고 LoopCD를 붙인 여섯 실험에서 순전파 연산이 22.5~48.2% 줄었고, 객관식 7종 평균은 원래 깊이와 같거나 높았습니다. 이 수치는 512토큰 기준 이론 연산량이고, 수학·코드 생성 과제에서는 반복을 줄이는 실험을 하지 않았습니다.
논문은 루프 구조 모델 네 계열에서만 실험했습니다. 반복하지 않는 모델에는 중간 층과 마지막 층을 비교하는 DoLa 같은 방법이 따로 있고, 루프 모델의 반복 도중 층을 기준점으로 쓰면 ARC-Challenge 정확도가 최대 24.9%포인트 떨어졌습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
구글 리서치가 9월 24일 소개한 A²RD는 신 설명 80줄로 10분짜리 영상을 만들었습니다. 1분 영상 평가에서 인물 일관성을 기존 최고 0.57에서 0.74로 올렸지만, 구간 하나에 최대 7.2분이 더 듭니다.

구글 리서치가 9월 24일 소개한 VQQA는 영상 평가를 질문 목록으로 바꿔 프롬프트를 고칩니다. CogVideoX-5B에서 T2V-CompBench 점수를 41.89%에서 53.46%로 올렸고, 평균 1.245번 수정에 VLM을 약 7.23번 불렀습니다.
에포크 AI가 10월 2일 HBM 출하량으로 AI 에이전트 수를 셌습니다. 2027년까지 나올 메모리로 프런티어 에이전트 3,300만~1억 7,100만 개를 동시에 돌릴 수 있고, 용량의 20%만 써도 연 2조 6,000억~5조 3,000억 달러어치입니다.

구글 리서치가 9월 24일 소개한 A²RD는 신 설명 80줄로 10분짜리 영상을 만들었습니다. 1분 영상 평가에서 인물 일관성을 기존 최고 0.57에서 0.74로 올렸지만, 구간 하나에 최대 7.2분이 더 듭니다.

구글 리서치가 9월 24일 소개한 VQQA는 영상 평가를 질문 목록으로 바꿔 프롬프트를 고칩니다. CogVideoX-5B에서 T2V-CompBench 점수를 41.89%에서 53.46%로 올렸고, 평균 1.245번 수정에 VLM을 약 7.23번 불렀습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
논문 제목은 「Decoding Looped Transformers Better for (Almost) Free」, 우리말로 옮기면 「루프 트랜스포머를 (거의) 공짜로 더 잘 디코딩하기」입니다. 저자 소속은 모두 애플로 적혀 있고, 제1저자 웨이하오 류(Weihao Liu)는 미국 일리노이대 시카고 캠퍼스 소속으로 애플 인턴십 중에 이 연구를 했습니다. 교신저자는 애플의 루이샹 장(Ruixiang Zhang)이고, 논문은 32쪽에 그림 19개 분량입니다. 한국 시각으로는 10월 2일 오전 9시 arXiv 목록에 올라왔습니다.
보통의 트랜스포머는 서로 다른 층(레이어)을 아래에서 위로 한 번씩 지나며 다음 토큰을 고릅니다. 알리바바의 Qwen3-4B는 가중치가 저마다 다른 층 36개를 토큰 하나마다 한 번씩 거칩니다. 루프 트랜스포머는 가중치가 같은 층 묶음 하나를 여러 번 되풀이합니다. 바이트댄스의 Ouro-1.4B는 24층 묶음을 4번 돌려 96층 분량을 계산하고, 미국 메릴랜드대 연구진 등이 만든 Huginn-0125는 앞뒤에 2층씩을 두고 가운데 4층 묶음을 32번 돌려 132층 분량을 계산합니다.
매개변수가 늘지 않으니 모델을 담는 메모리는 그대로이고, 반복 횟수만큼 계산만 늘어납니다. Huginn 논문(2025년 2월)은 35억 매개변수 모델이 반복을 늘리면 500억 매개변수 모델에 맞먹는 계산량까지 추론 점수가 오른다고 보고했습니다. Ouro 논문(2025년 10월)은 7조 7,000억 토큰으로 사전학습한 14억·26억 매개변수 모델이 최대 120억 매개변수 모델과 비슷한 점수를 낸다고 밝혔고, 두 모델 모두 아파치 2.0 라이선스로 허깅페이스에 올라 있습니다.
요즘 추론 모델은 계산을 늘릴 때 생각을 토큰으로 길게 씁니다. Claude Code에서 노력 설정을 올리면 같은 과제에 토큰을 몇 배 더 쓰는 것도 그 방식입니다. 루프 모델은 토큰을 더 쓰는 대신 모델 안의 숫자 벡터를 같은 층 묶음에 더 여러 번 통과시킵니다. 같은 층을 되풀이해 쓰자는 생각은 2019년 국제학회 ICLR에 실린 유니버설 트랜스포머(Universal Transformers)까지 거슬러 올라가고, 같은 해 구글의 ALBERT는 층끼리 매개변수를 나눠 써 BERT-large보다 작은 모델로 GLUE 등에서 최고 기록을 냈습니다.

네 계열은 반복을 배우는 방식이 서로 다릅니다. Ouro는 바퀴마다 예측을 내도록 훈련했고, Huginn과 Parcae는 사전학습 때 반복 횟수를 무작위로 바꿔 가며 학습했습니다. Looped-Qwen3는 5월 arXiv에 나온 「학습 없는 루프 트랜스포머」 방식으로, 이미 학습을 마친 Qwen3-4B의 가운데 4층 구간을 추가 학습 없이 작은 걸음으로 8번 되풀이하게 만든 모델입니다. 연구진은 훈련 방식이 다른 네 계열 모두에서 객관식 평균이 오른 결과를 LoopCD가 특정 훈련법에 기대지 않는 근거로 들었습니다.
루프 모델은 바퀴를 하나 돌 때마다 그때까지의 계산 결과를 상태로 남깁니다. 이 중간 상태도 출력층에 넣으면 다음 토큰의 확률 분포가 나오지만, 지금까지의 디코딩은 마지막 바퀴의 상태만 쓰고 앞의 것은 버렸습니다. LoopCD는 첫 바퀴 상태로 만든 예측을 약한 기준점으로 두고, 마지막 예측이 그 기준점에서 멀어진 방향으로 한 걸음 더 나갑니다. 식으로는 「마지막 예측 + ω × (마지막 예측 − 첫 바퀴 예측)」이고, ω가 0이면 원래 디코딩과 같습니다.
이 발상의 뿌리는 2022년 나온 대조 디코딩(contrastive decoding)입니다. 스탠퍼드대와 메타 등의 연구진은 130억 매개변수 OPT 모델의 예측에서 1억 2,500만 매개변수 OPT의 예측을 빼서 더 나은 글을 얻었는데, 작은 모델이 자주 하는 실수일수록 큰 모델도 피해야 할 실수라는 논리였습니다. 이미지 생성 모델이 쓰는 분류기 없는 가이던스(classifier-free guidance)와 엔비디아 연구진이 2024년 낸 「나쁜 버전의 자기 자신으로 확산 모델을 이끌기」도 같은 계열입니다. 일반 언어 모델에서는 약한 쪽을 얻으려고 작은 모델을 따로 두거나 문맥을 일부러 흐리거나 중간 층을 꺼내야 했는데, 루프 모델에서는 같은 모델이 첫 바퀴만 돈 결과가 공짜로 생깁니다.
LoopCD는 두 가지로 나뉩니다. LoopCD-Logits는 첫 바퀴 상태와 마지막 상태를 각각 출력층에 통과시켜 나온 점수(로짓)끼리 비교해서 출력층을 한 번 더 지나고, 늘어나는 연산은 모델에 따라 1.0~30.6%입니다. LoopCD-Hidden은 출력층에 넣기 전에 두 상태를 섞어서 출력층을 한 번만 지나고, 추가 연산은 사실상 없습니다. 강도 ω를 토큰마다 바꾸는 적응형 규칙도 있는데, 1등 후보와 2등 후보의 확률 차가 작을수록 ω를 키우고 한 후보가 확실할수록 줄입니다.

논문 부록에는 초중등 과학 문제 모음 ARC-Challenge의 한 문제를 Ouro-1.4B가 어떻게 푸는지가 실려 있습니다. 숲을 가로질러 좁은 파괴의 흔적을 남기는 자연재해를 고르는 문제이고, 정답은 토네이도입니다. 아래 표의 숫자는 보기마다 글자당 로그 가능도로, 0에 가까울수록 모델이 그 보기를 그럴듯하게 본다는 의미입니다.
| 보기 | 첫 바퀴만 돌았을 때 | 마지막 바퀴(기존 디코딩) | LoopCD(ω=0.5) |
|---|---|---|---|
| 홍수 | -1.500 | -0.770 | -0.934 |
| 토네이도(정답) | -1.113 | -0.209 | -0.170 |
| 허리케인 | -0.969 | -0.258 | -0.247 |
| 지진 | -0.525 | -0.201 | -0.199 |
첫 바퀴에서는 지진이 앞섰고, 마지막 바퀴에서도 지진이 0.01이 안 되는 차이로 1등이라 기존 디코딩은 오답을 냅니다. 그런데 바퀴를 도는 동안 토네이도의 점수는 0.90 오르고 지진은 0.32 올랐습니다. LoopCD는 이 움직임을 조금 더 이어 가서 토네이도를 1등으로 올렸고, 연구진은 이 과정에 바깥 지식이 들어가지 않는다고 적었습니다.
가장 크게 오른 곳은 수학 추론과 코드 생성입니다. AIME 2024는 미국 수학 경시대회 AIME(American Invitational Mathematics Examination)의 2024년 1·2차 시험 30문제이고, 정답률(pass@1)은 문제마다 16번씩 풀게 해서 한 번 풀 때 맞힐 확률을 추정한 값입니다. Ouro-2.6B-Thinking의 11.45%포인트 상승은 한 번 풀 때마다 30문제 가운데 평균 3.4문제쯤을 더 맞힌다는 것과 같습니다.
| 모델 | 벤치마크 | 기존 | LoopCD |
|---|---|---|---|
| Ouro-2.6B-Thinking | AIME 2024 | 61.88% | 73.33% |
| Ouro-2.6B-Thinking | AIME 2025 | 49.58% | 56.88% |
| Ouro-2.6B-Thinking | OlympiadBench | 64.05% | 67.29% |
| Ouro-1.4B-Thinking | AIME 2024 | 50.83% | 59.17% |
| Huginn-0125(32번 반복) | HumanEval | 22.56% | 31.71% |
| Huginn-0125(16번 반복) | HumanEval | 21.95% | 28.05% |
| Ouro-2.6B | HumanEval | 75.61% | 79.88% |
수학 행은 적응형 LoopCD-Logits, Huginn 행은 LoopCD-Hidden의 결과입니다. 같은 Huginn이라도 LoopCD-Logits 표에서는 기존 점수가 23.17%로 조금 다른데, 연구진은 안내한 실행마다 같은 체크포인트·프롬프트·반복 횟수의 기준 실행을 따로 짝지었다고 밝혔습니다. 객관식 7종 평균은 상승 폭이 0.29~1.59%포인트로 훨씬 작았습니다. 연구진은 객관식이 보기의 가능도를 한 번 비교하고 끝나는 반면 수학 풀이는 토큰 수백 개를 차례로 고르는 과정이라, 고를 때마다 안내가 쌓인다고 설명했습니다.
연구진은 정확도가 오른 만큼 반복을 덜 돌려도 되는지 따로 쟀습니다. 안내 없이 반복만 절반으로 줄이면 객관식 7종 평균이 0.17~1.29%포인트 떨어지는데, 같은 절반 깊이에서 LoopCD를 붙이자 여섯 설정 모두 원래 깊이의 점수와 같거나 높아졌습니다.
| 설정 | 반복 | 순전파 연산(원래=1) | 줄어든 연산 | 객관식 평균(원래 깊이 대비) |
|---|---|---|---|---|
| Huginn-0125, Logits | 32→16 | 0.54 | 46.0% | +1.02 |
| Huginn-0125, Hidden | 32→16 | 0.52 | 48.2% | +0.51 |
| Parcae-370M, Logits | 8→4 | 0.78 | 22.5% | +0.77 |
| Parcae-1.3B, Logits | 8→4 | 0.73 | 27.3% | +0.57 |
| Parcae-1.3B, Hidden | 8→4 | 0.61 | 39.2% | +0.11 |
| Looped-Qwen3, Hidden | 8→4 | 0.76 | 23.6% | +0.00 |
줄어든 연산이 22.5%에서 48.2%까지 벌어진 이유는 루프가 전체 계산에서 차지하는 비중입니다. Huginn은 132층 분량 가운데 128층 분량이 루프라 반복을 절반으로 줄이면 계산도 절반 가까이 줄어듭니다. Looped-Qwen3는 Qwen3-4B의 가운데 4층만 되풀이하고 앞 15층과 뒤 17층은 한 번씩 지나니, 반복을 줄여 아끼는 계산이 4분의 1 정도입니다. 이 모델은 LoopCD-Logits로 출력층 쪽 17층을 한 번 더 돌리면 연산이 30.6% 늘어 아낀 계산보다 커지기 때문에, 연구진은 LoopCD-Hidden만 썼습니다.
반복을 절반으로 줄여도 버틴 이유는 Huginn에서 보입니다. 답을 고르는 위치에서 다음 토큰의 불확실성(엔트로피) 중앙값은 첫 바퀴 뒤 4.1nats에서 16번째 바퀴에 2.7nats로 내려온 뒤 32번째 바퀴까지 거의 그대로였습니다. 예측이 반복의 절반쯤에서 대부분 정해진다는 것이고, 그래도 답을 고르는 위치의 67%는 엔트로피가 2nats(후보 일곱 개 가운데 고르는 정도)를 넘어 안내가 손댈 망설임이 남아 있었습니다.

첫 바퀴만 돈 예측은 객관식 7종 평균에서 마지막 예측보다 4.0~23.7%포인트 낮았고, 안내 효과는 두 예측이 얼마나 다르게 고르는지에 따라 커졌습니다. Huginn의 첫 바퀴는 ARC-Challenge 문제의 51%에서 마지막 예측과 다른 보기를 골랐고 ω=0.5에서 3.07%포인트를 더했지만, 16번째 바퀴는 7%에서만 달랐고 0.17%포인트를 더했습니다.

효과는 모델이 망설이는 문제에 몰렸습니다. 연구진이 ARC-Challenge 문제를 1·2등 후보의 차이로 다섯 무리로 나누자, 가장 망설인 무리에서는 정확도가 6.4~13.3%포인트 올랐고 가장 확신한 무리에서는 많아야 0.4%포인트였습니다. 답이 바뀐 문제는 전체의 5.8~14.9%였고, 고친 답이 망친 답보다 많아 순증 2.1~3.5%포인트가 남았습니다.
반복 도중의 층을 기준점으로 쓰는 방법은 통하지 않았습니다. 반복하지 않는 모델에서는 중간 층과 마지막 층을 비교하는 DoLa가 쓰이지만, Ouro의 마지막 바퀴 안에 있는 층을 기준점으로 쓰자 ARC-Challenge 정확도가 Ouro-1.4B에서 최대 20.6%포인트, Ouro-2.6B에서 최대 24.9%포인트 떨어졌습니다. 바퀴 하나를 다 돌기 전의 상태는 출력으로 읽도록 훈련된 적이 없다는 것이 연구진의 설명입니다.
제가 이 논문에서 가장 먼저 확인한 것은 연산 절감 실험의 범위였습니다. 반복을 절반으로 줄인 여섯 실험은 객관식 7종에서만 돌렸고, AIME나 HumanEval 같은 생성 과제에서 반복을 줄여도 점수가 지켜지는지는 재지 않았습니다. 22.5~48.2%도 512토큰 입력을 기준으로 계산한 이론 연산량이고, 연구진은 이 숫자가 실제 응답 시간의 단축과는 다르다고 따로 적었습니다. Ouro는 절반 깊이 실험에 들어가지 않았습니다.
점수가 내려간 표도 있습니다. Qwen3-4B를 루프로 바꾼 Looped-Qwen3는 수학 추론에서 AIME 2024 정답률이 64.79%에서 61.88%(적응형은 61.04%)로 떨어졌고, 10번 풀어 한 번이라도 맞히는 pass@10은 82.91%에서 86.17%로 올랐습니다. GSM8K 초등 수학은 10개 설정 가운데 6개에서만 올랐고, Huginn-0125(32번 반복)는 1.29%포인트, Looped-Qwen3는 1.14%포인트 내려갔습니다. Ouro 두 모델은 객관식 가운데 WinoGrande에서 네 설정 모두 점수가 떨어졌습니다.

강도 ω를 고르는 폭도 좁습니다. 객관식은 ω 0.5 안팎에서 고르게 좋았지만, 글을 이어 쓰는 생성 과제는 0.2~0.3에서 가장 좋았고 0.6을 넘으면 앞에서 바뀐 토큰이 뒤로 번지며 무너졌습니다. Ouro-1.4B는 ω=0.8에서 GSM8K 8%포인트와 HumanEval 10%포인트를, ω=1.0에서 각각 20%포인트와 22%포인트를 잃었습니다. 강도는 본 실험 전에 같은 벤치마크 묶음에서 값을 바꿔 가며 훑은 결과로 골랐고(논문 그림 9·10), 따로 떼어 둔 검증용 문제는 논문에 나오지 않습니다. 적응형 규칙은 ω 상한을 0.5에서 1.0 사이 어디로 잡아도 평균이 기준보다 높게 유지돼, 고정 강도보다 고르는 폭이 넓었습니다.
실험한 모델은 가장 작은 Parcae-370M이 3억 7,000만, 가장 큰 Looped-Qwen3가 40억 매개변수입니다. 애플이 2025년 6월 공개한 기기 안 기반 모델은 약 30억 매개변수로, 애플 실리콘에서 효율적으로 돌도록 맞춘 모델입니다. 루프 구조는 매개변수를 늘리지 않고 계산만 늘리니 메모리가 정해진 기기와 조건이 맞고, LoopCD-Hidden은 출력층 연산도 더하지 않습니다. 논문은 애플 제품에 쓰겠다는 계획을 적지 않았고, 연구진이 든 동기는 이미 계산해 놓고 버리던 상태를 쓰자는 것입니다.
반복은 예측을 일찍 정해 두면서도 몇몇 결정을 아슬아슬하게 남기고, 첫 바퀴의 예측은 그 움직임의 방향을 기록합니다. 그 방향을 이어 가면 아슬아슬한 결정이 반복이 끌어올리던 보기 쪽으로 다시 정렬됩니다.— LoopCD 논문 결론, 애플 연구진
오픈AI에서 추론 모델 팀을 이끈 제리 트워렉은 7월 대담에서 트랜스포머를 대신할 구조를 찾는다며, 지금 구조 연구 대부분이 트랜스포머를 더 싸고 효율적으로 만드는 데 쏠려 있다고 말했습니다. LoopCD도 효율을 겨냥한 연구이고, 모델을 다시 훈련하지 않고 디코딩만 바꿔 정확도와 연산을 함께 움직였습니다. 그 효과가 확인된 것은 40억 매개변수 이하 모델까지입니다.
Ouro와 Huginn은 가중치가 공개돼 있어 LoopCD를 그대로 얹어 볼 수 있는 구조입니다. 다만 논문에는 코드 공개 언급이 없고, 연구진도 모델마다 기준점과 강도를 따로 골랐습니다. Huginn은 상태를 무작위 잡음에서 출발시키기 때문에 LoopCD-Hidden에서 첫 바퀴를 기준점으로 쓰면 오히려 0.58%포인트 떨어졌고, 연구진은 잡음이 걷힌 6~7번째 바퀴를 기준점으로 썼습니다.
논문은 10월 1일 올라온 첫 판입니다. 코드가 공개되거나 더 큰 루프 모델에서 같은 실험이 나오면 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림