# "합성 데이터는 큰 실수" 튜링상 서튼, 1조 파라미터 20와트에 도전
_Training Data · 리처드 서튼, 쿠람 자베드 · 2026년 8월 18일_
- 매체: 초이의 뉴스레터 · 팟캐스트
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-08-19T10:00
- 링크: https://choi-newsletter.com/post/podcast-training-data-sutton-javed-continual-learning
- 답하는 질문: 리처드 서튼의 오크 랩은 무엇을 만드나
- 직답: 자기 경험으로 배포 뒤에도 계속 배우는 에이전트를 만들고, 1조 파라미터를 20와트로 돌리는 것을 5~10년 목표로 잡았습니다.
- 에피소드: Training Data · https://pscrb.fm/rss/p/traffic.megaphone.fm/CPUAI4645036827.mp3
- 출처: Sequoia Capital, Rich Sutton and Khurram Javed: Why AI Models Stop Learning, and How to Start It Again (Training Data 에피소드 페이지·전사본, 2026-08-18) (https://sequoiacap.com/podcast/rich-sutton-and-khurram-javed-why-ai-models-stop-learning-and-how-to-start-it-again), YouTube, Sequoia Capital 에피소드 영상 (https://www.youtube.com/watch?v=xH7U7w9Qzlo), Apple Podcasts 에피소드 페이지 (https://podcasts.apple.com/us/podcast/rich-sutton-and-khurram-javed-why-ai-models-stop/id1750736528?i=1000784018357), Rich Sutton, The Bitter Lesson (2019-03-13) (http://www.incompleteideas.net/IncIdeas/BitterLesson.html), Sutton·Bowling·Pilarski, The Alberta Plan for AI Research (arXiv 2208.11173) (https://arxiv.org/abs/2208.11173), Dohare 외, Loss of plasticity in deep continual learning (Nature 632, 2024-08-21) (https://www.nature.com/articles/s41586-024-07711-7), Silver·Sutton, Welcome to the Era of Experience (2025-04) (https://storage.googleapis.com/deepmind-media/Era-of-Experience%20/The%20Era%20of%20Experience%20Paper.pdf), Lewandowski 외, The World Is Bigger! A Computationally-Embedded Perspective on the Big World Hypothesis (arXiv 2512.23419, 자베드·서튼 2024 논문 인용) (https://arxiv.org/abs/2512.23419), ACM, Andrew Barto and Richard Sutton Receive 2024 ACM A.M. Turing Award (보관본) (https://web.archive.org/web/20260103133622/https://awards.acm.org/about/2024-turing), Cursor, Improving Cursor Tab with online RL (2025-09-12) (https://cursor.com/blog/tab-rl), Keen Technologies, Physical Atari (https://keenagi.com/research/physical-atari/), 리처드 서튼 X, 오크 랩 창업 공지 (2026-07-13) (https://x.com/RichardSSutton/status/2076663628301058329), 쿠람 자베드 X, 오크 랩 창업과 OaK 구조 (2026-07-13) (https://x.com/kjaved_/status/2076663868160459214), 쿠람 자베드 X, Physical Atari의 몸 사이 전이와 지속 학습 (2025-12-19) (https://x.com/kjaved_/status/2002080785311125915), 쿠람 자베드 X, Physical Atari 공개와 시뮬레이션 전이 결과 (2026-06-22) (https://x.com/kjaved_/status/2069113291834527939)
> 튜링상 수상자 리처드 서튼과 제자 쿠람 자베드가 8월 18일 세쿼이아 팟캐스트에 나왔습니다. 7월 세운 오크 랩에서 계속 배우는 에이전트를 만들겠다며, 합성 데이터는 큰 실수이고 대형 언어 모델은 지능의 4분의 1쯤이라고 했습니다.

강화학습의 개념과 알고리즘 기초를 세워 앤드루 바토와 함께 2024년 튜링상을 받은 리처드 서튼(Rich Sutton)과 그의 제자 쿠람 자베드(Khurram Javed)가 8월 18일(미국 시각) 공개된 세쿼이아캐피털 팟캐스트 「Training Data」에 나왔습니다. 두 사람은 7월 세운 오크 랩(Oak Lab)에서 사람이 만든 데이터 대신 자기 경험으로 계속 배우는 에이전트를 만들겠다며, 합성 데이터를 큰 실수로, 대형 언어 모델을 지능의 4분의 1쯤으로 불렀습니다. 목표로는 계속 배우면서도 일관성을 지키는 1조 파라미터 규모의 마음을 5~10년 안에 20와트로 돌리는 것을 들었습니다.

서튼이 방송 한 달여 전인 7월 13일(미국 시각) X에 올린 창업 공지입니다. 존 카맥의 AI 회사 Keen Technologies에서 함께 일하던 자베드와 독립해, 지능이 실행 중의 경험에서 만들어지고 유지된다는 믿음은 Keen과 같지만 지금의 딥러닝 방법은 약하고 비효율적이어서 자잘한 손질로는 모자라고 근본적으로 새 아이디어가 필요하다고 적었습니다. 자베드는 같은 날 두 사람이 6월 Keen을 나왔고, 자기 경험만으로 배우는 동물 같은 지능의 로드맵인 OaK 구조를 작은 팀으로 밀고 나가 몇 년 안에 시제품을 만들겠다고 밝혔습니다. 성공한 시제품은 지금의 어떤 AI보다 태어나 첫해를 배우는 아기에 가까울 거라고 했습니다.

## 모든 학습은 원래 계속된다

서튼은 자신이 급진적이라는 평가를 받아들이지 않았습니다. AI 열풍 이전에는 지속 학습이라는 말을 따로 쓸 이유가 없었고, 모든 학습은 원래 계속되는 것이며 우리는 늘 행동하면서 배운다는 겁니다.

> 저는 이상하지 않습니다. 이상한 건 이 분야입니다. 굳이 지속 학습이라고 불러야 한다고 느끼는데, 그냥 학습입니다.
> — 리처드 서튼, 오크 랩 공동창업자 (Training Data)

그가 이상하다고 본 것은 대형 언어 모델의 방식입니다. 사람들과 대화하며 쓰이는 동안 가중치가 전혀 바뀌지 않는 시스템으로 박사 수준의 전문성을 만들 수 있다고 주장하는 쪽이 이상하다는 겁니다. 자베드는 사전학습과 사후학습을 얼마든지 해도 좋지만, 쓰는 동안 배우지 못하게 막는 지점이 가장 큰 이견이라고 정리했습니다.

진행자 소냐 황은 서튼이 이 길을 고집해 온 이력도 물었습니다. 서튼은 AI 겨울이던 2003년 암으로 죽어 가다 병이 잠시 물러나자 앨버타대로 옮겨 강의를 시작했고, 그 뒤로 살아남았다고 했습니다. 몇 달밖에 남지 않았다고 여기면서도 연구를 계속한 이유는 아마 습관이었을 거라고 웃으며 말했습니다.

## 쓴 교훈의 긍정 사례이자 부정 사례

서튼이 2019년 3월 13일 쓴 에세이 「쓴 교훈(The Bitter Lesson)」은 70년 AI 연구의 가장 큰 교훈으로 계산을 활용하는 일반적 방법이 큰 차이로 가장 효과적이었다는 점을 들었습니다. 근거는 계산 단가가 기하급수로 떨어진다는 무어의 법칙이었고, 계산과 함께 끝없이 커지는 방법으로 탐색과 학습을 꼽았습니다. 소냐 황은 요즘 회의에서 가장 많이 듣는 말이 쓴 교훈을 따랐느냐는 물음이라며, 무엇이 잘못 읽히고 있느냐고 물었습니다.

서튼의 요약은 사람의 지식에 한눈팔지 말고 탐색과 학습처럼 계산과 함께 커지는 방법에 집중하라는 것이었습니다. 정교한 알고리즘도 필요하며, 사람의 입력보다 계산과 함께 커지는 알고리즘이어야 한다고 덧붙였습니다. 에세이도 사전 지식과 학습이 원리상 부딪힐 필요는 없지만 실제로는 부딪혀 왔다고 적었고, 서튼은 방송에서 둘이 친구여야 한다고 다시 말했습니다.

대형 언어 모델은 쓴 교훈의 긍정 사례이자 부정 사례라고 답했습니다. 인터넷을 통째로 들이마시며 계산으로 크게 키울 수 있었던 점은 긍정 사례이고, 유한한 인터넷에 묶여 한계에 닿는 점은 사람의 지식에 너무 기댄 부정 사례라는 겁니다. 세계는 인터넷에 저장된 모든 것보다 훨씬 크다는 말도 붙였습니다.

## 합성 데이터는 큰 실수라는 주장

소냐 황은 연구소들이 인터넷이라는 화석연료를 넘어서려고 만드는 합성 데이터도 계산을 활용하는 일반적 방법이 아니냐고 물었습니다. 서튼의 답은 짧았습니다.

> 그건 그냥 큰 실수입니다. 어쩌면 그게 다음 큰 교훈일지도 모릅니다.
> — 리처드 서튼, 오크 랩 공동창업자 (Training Data)

근거로 든 것은 앨버타에서 5~10년 동안 오간 큰 세계 가설입니다. 자베드가 2024년 서튼과 함께 강화학습 학회(RLC) 워크숍 논문으로 정리한 가설로, 세계는 어떤 에이전트보다 엄청나게 복잡하고 세계 안에는 다른 에이전트들도 들어 있으니 이는 자명하다는 겁니다. 그래서 완벽한 해는 없고 근사는 거칠 수밖에 없으니, 에이전트는 자기가 놓인 세계의 한 부분에 맞춰 계속 배울 수밖에 없다는 것이 서튼의 설명입니다.

합성 데이터를 만드는 작은 프로그램은 작은 세계밖에 만들지 못한다고 서튼은 말했습니다. 지금 상대의 머릿속에서 일어나는 일이나 로봇 모터의 마찰과 마모를 합성 데이터로 얻을 길은 없다는 겁니다. 자베드는 누가 좋은 합성 데이터를 고르느냐고 되물었습니다. 연구소 엔지니어들이 모두 휴가를 가면 합성 데이터를 누가 만들겠느냐며, 박쥐처럼 반향정위로 나는 드론을 만들려면 먼저 그 분야 전문가가 있어야 한다는 예를 들었습니다.

소냐 황이 주로 시뮬레이션에서 훈련한 자율주행 회사들을 반례로 들자, 자베드는 그 시뮬레이터를 만든 엔지니어가 몇 명이었는지 물었습니다. 사람이 현실과의 차이를 보고 시뮬레이터를 고치는 순환이 들어 있으니, 에이전트가 자기 경험에서 모델을 배우고 그 모델로 계획하게 하자는 것이 그의 답입니다.

자베드가 Keen에서 한 실험이 이 주장의 근거입니다. 실제 로봇이 조이스틱으로 아타리 게임을 하는 Physical Atari에서 시뮬레이션으로 배운 정책을 옮긴 성능은 형편없었고, 똑같이 만든 다른 로봇 몸으로 옮겨도 성능이 눈에 띄게 떨어졌습니다. 옮긴 뒤에도 계속 배우게 하자 그 차이를 넘어섰는데, 옮긴 뒤의 향상 속도는 처음부터 배울 때와 비슷했다고 그는 2025년 12월 X에 적었습니다.

합성 데이터에 대한 비판 자체는 처음 나온 것이 아닙니다. 서튼이 데이비드 실버와 2025년 4월 공개한 「경험의 시대」에는 정적인 절차로 합성 데이터를 만드는 방식은 에이전트가 강해지면 금세 뒤처진다는 문장이 있습니다. 이번 대화에서는 그 판단이 큰 실수라는 말로 세졌습니다.

## 커서는 이미 배우고 있지 않나

소냐 황은 요즘 AI 비서도 사용자에 대한 기억을 쌓고 문맥 안에서 배운다고 반박했습니다. 서튼은 진지하게 묻는 거냐며, 가중치가 전혀 바뀌지 않는다고 받았습니다. 대형 언어 모델을 만들며 새 개념을 만들고 구조를 짠 일은 모두 가중치 학습이었는데, 그 일을 한 번만 하고 멈춘다는 겁니다.

가중치가 바뀌는 예로 소냐 황이 꺼낸 것은 커서의 Tab 자동완성입니다. 커서는 2025년 9월 블로그에서 하루 4억 건이 넘는 Tab 요청의 수락·거절 기록으로 모델을 온라인 강화학습시킨다고 밝혔습니다. 새 체크포인트를 배포하고 다음 학습 단계용 데이터를 모으는 데 1.5~2시간이 걸리고, 그렇게 만든 모델은 제안을 21% 덜 하면서 수락률은 28% 높았습니다.

자베드는 커서를 지속 학습의 사례로 인정하면서도, 수많은 사용자의 데이터를 모아 한 번에 정책을 고치는 방식이라 비효율적이라고 봤습니다. 내 모델에 나만의 무언가를 가르치고 싶은데 10만 명과 다툴 이유는 없다는 겁니다. 그는 사람의 뇌를 예로 들어, 몸의 위치를 느끼는 고유 감각을 잃은 사람은 걷지 못하게 되지만 2~3년에 걸쳐 발을 보며 다시 걷는 법을 배운다고 했습니다.

## 망각은 고칠 수 있다는 처방

사용자와의 상호작용으로 가중치를 고치는 일은 지금도 할 수 있지 않느냐는 물음에 자베드는 알고리즘의 문제라고 답했습니다. 예시 하나로 모델 전체를 고치면 이전 지식이 크게 망가지는데, 이를 파국적 망각이라고 부릅니다. 커서가 한 사람의 예시 대신 많은 사용자의 큰 묶음으로 학습하는 이유도 여기에 있고, 대부분의 쓰임새에는 데이터가 한 줄기로만 들어온다는 겁니다.

> 하지만 완전히 고칠 수 있습니다. 올바른 알고리즘이 있어야 합니다.
> — 리처드 서튼, 오크 랩 공동창업자 (Training Data)

서튼은 두 가지 처방을 내놓았습니다. 신경망의 가중치마다 따로 스텝 크기(한 번에 고치는 폭)를 두고 그것을 메타 학습해 대부분의 가중치는 아주 조금씩만 움직이게 하는 방법, 그리고 기울기를 따르는 느린 길 대신 새 특징을 만들어 보고 시험하는 방법입니다. 뒤의 것이 그와 동료들이 2024년 8월 Nature에 실은 연속 역전파입니다.

![연속 이미지넷 과제 구성과, 과제 수가 늘수록 역전파의 테스트 정확도는 선형 기준선 아래로 내려가고 연속 역전파는 계속 오르는 그래프](https://media.springernature.com/lw1200/springer-static/image/art%3A10.1038%2Fs41586-024-07711-7/MediaObjects/41586_2024_7711_Fig1_HTML.png)

논문은 표준 딥러닝이 새 데이터로 계속 배우다 보면 가소성(새로 배우는 능력)을 잃어 얕은 신경망보다 나을 게 없어진다는 것을 이미지넷과 강화학습 문제로 보였습니다. 그림에서 역전파의 정확도는 과제가 2,000개에 이를 무렵 선형 기준선 언저리나 그 아래로 내려갔습니다. 연속 역전파는 역전파와 같되 덜 쓰이는 유닛의 일부를 계속 무작위로 다시 초기화해, 학습 초기에만 있던 다양성을 꾸준히 불어넣습니다.

다만 지금 있는 모델에 이 알고리즘을 덧붙일 수는 없다고 자베드는 말했습니다. 이 알고리즘은 지식과 함께 배우는 법 자체를 배우기 때문에, 새 파운데이션 모델을 처음부터 이 방식으로 훈련해야 한다는 겁니다. 서튼은 두 처방을 잘 합치면 훨씬 뛰어난 새 세대의 지속 딥러닝이 나올 것이고, 앞으로 몇 년 안에 해내고 싶다고 했습니다.

## 이미 쓴 글과 이번에 새로 한 말

방송에서 나온 처방의 상당 부분은 서튼이 이미 글로 적어 둔 것입니다. 쓴 교훈도 발표 1년 전부터 여러 판으로 쓰고 강연했다고 그는 말했습니다.

| 공개 | 글 | 이미 적은 것 |
| --- | --- | --- |
| 2019년 3월 | 쓴 교훈 | 탐색과 학습의 규모 확장, 끝없이 복잡한 세계는 근사를 찾는 메타 방법으로 다룬다 |
| 2022년 8월 | 앨버타 계획(서튼·볼링·필라스키) | 특징마다 다른 스텝 크기(1단계), 특징을 만들고 시험해 바꾸기(2단계), Oak 구조(11단계) |
| 2024년 | 큰 세계 가설(자베드·서튼) | 세계는 어떤 에이전트보다 크다 |
| 2024년 8월 | 가소성 상실(Nature) | 연속 역전파 |
| 2025년 4월 | 경험의 시대(실버·서튼) | 정적인 합성 데이터 생성은 금세 뒤처진다 |

이번에 새로 나온 것은 판단의 세기와 시간표입니다. 파국적 망각을 완전히 고칠 수 있다는 단언, 합성 데이터가 큰 실수라는 말, 대형 언어 모델이 지능의 20~25%라는 어림, 1조 파라미터를 5~10년 안에 20와트로 돌리겠다는 목표가 그렇습니다. 오크 랩이 따르겠다는 OaK 구조는 앨버타 계획 11단계에 적힌 설계로, 특징과 하위 과제, 옵션(시간 단위로 묶은 행동)과 옵션 모델의 쓸모를 계속 평가해 쓸모없는 것을 새것으로 바꿔 끼웁니다.

## 1조 파라미터를 20와트로

가장 큰 야망을 묻자 서튼은 작은 일부터 비행기를 타고 도시를 옮겨 가는 큰 일까지 모든 범위의 지식을 한 방식으로 다루면서 스스로 유지되는 마음을 꼽았습니다. 대형 언어 모델의 지식은 사람들이 사후학습으로 바로잡은 뒤 얼려 두는 방식으로 맞게 유지되지만, 사람의 마음은 늘 바뀌면서도 엉뚱한 곳으로 흘러가지 않고 일관성을 지킨다는 겁니다.

진행자 앨프리드 린이 1조 파라미터를 20와트로 돌리겠다는 목표가 지나치게 야심 찬 것 아니냐고 묻자, 자베드는 지금 기술로는 불가능하다고 인정했습니다. 1조 개의 파라미터를 메모리에 올려 두는 것만으로 20와트를 넘기 때문입니다. 그는 올바른 알고리즘이 있으면 5~10년 뒤에는 가능할 수 있다고 봤고, 서튼은 무어의 법칙으로 계산을 보탰습니다. 18개월마다 두 배가 되면 10년에 약 100배이니, 지금 2,000와트로 할 수 있다면 10년 뒤 20와트가 된다는 겁니다.

쓴 교훈이 기댄 근거도 계산 단가가 기하급수로 떨어진다는 무어의 법칙이었습니다. 업계가 같은 계산 단가 하락을 더 큰 모델과 더 큰 데이터센터에 쓰는 동안, 서튼은 같은 능력을 더 적은 전력에 담는 쪽에 걸었습니다. 국내에서도 AI 데이터센터의 [전력 확보가 병목으로 꼽힙니다](/post/review-electricity-is-the-new-currency).

## 큰 연구소는 왜 이 길로 못 가나

그렇게 효율적일 수 있다면 왜 아무도 그렇게 하지 않느냐는 물음이 이어졌습니다. 자베드는 연구 그룹들을 둘러봐도 그게 가능하다고 믿는 사람조차 보이지 않는다며 국소 최솟값을 들었습니다.

> 우리는 국소 최솟값에 갇혀 있습니다. 새 알고리즘 쪽으로 가려면 나아지기 전에 먼저 나빠지는 것을 피하기가 거의 불가능합니다.
> — 쿠람 자베드, 오크 랩 공동창업자 (Training Data)

새 패러다임은 첫날부터 최고 성능을 내지 못하는데, 큰 연구소들은 제품에 너무 묶여 있어 먼저 나빠지는 길을 갈 수 없다는 설명입니다. 서튼은 에너지를 많이 쓰는 것이 진짜 사나이임을 보여 주는 방법인 모양이라고 농담했습니다. 7월 같은 방송에 나온 [트워렉과 아닐](/post/podcast-training-data-tworek-anil-automated-lab)도 큰 연구소가 코딩 에이전트 경쟁에 묶여 트랜스포머의 대안을 찾지 못한다고 봤고, 트랜스포머로는 배포 뒤에 배우는 모델을 만들 수 없다고 했습니다.

같은 믿음을 내건 회사도 늘었습니다. 서튼은 창업 공지에서 오크 랩이 Keen, 그리고 옛 제자 데이비드 실버가 딥마인드를 나와 세운 [이니퍼블 인텔리전스](/post/review-google-talent-exodus-structure)와 강화학습에 대한 믿음을 함께한다고 적었습니다.

## 대형 언어 모델은 지능의 4분의 1

모든 게 잘되면 어떻게 되느냐는 물음에 서튼은 진짜 지속 학습과 추상화, 계획과 추론을 갖춘 지능을 꼽으며 그때가 되면 대형 언어 모델이 위험해질 수 있다고 했습니다. 그러면서 대형 언어 모델에 대한 평가를 분명히 해 두었습니다.

> 대형 언어 모델은 놀라운 과학적 돌파이고, 전혀 예상하지 못한 일이었습니다. 중요한 부분이지만 지능의 20%나 4분의 1쯤입니다. 더 있습니다. 우리는 아직 끝나지 않았습니다.
> — 리처드 서튼, 오크 랩 공동창업자 (Training Data)

하나의 마음이 모든 걸 하느냐는 물음에는 하나의 설계가 여러 마음으로 돈다고 답했습니다. 자베드는 세상에서 가장 큰 시스템 둘이 있다면 서로를 모델링할 수 없으니 하나의 시스템이 모든 것을 배울 수는 없다고 큰 세계 가설로 설명했습니다. 채용은 작게 시작해 같은 것을 보는 사람들로 천천히 키우겠다고 했습니다.

오크 랩은 아직 모델이나 실험 결과를 공개하지 않았습니다. 자베드는 창업 공지에서 진행 상황을 자주 공유하겠다고 했고, 먼저 간단한 환경에서 지금 방법의 한계를 보인 뒤 기본 알고리즘에 충분한 진전이 있을 때에만 큰 규모의 결과물을 만들겠다고 밝혔습니다.

읽어 주셔서 고맙습니다.

초이 드림
