이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
12개월 안에 도구 20~40개를 채운 시스템 프롬프트가 사라진다
지식 노동에 쓰는 모델 크기의 정점은 1조~10조 파라미터 사이에 있다
강화학습이 사전학습의 더 이른 단계로 옮겨 간다
데이터 수집과 정제, 사전학습, 평가, 강화학습을 하나의 자동화된 공정으로 묶은 Poolside의 사내 체계입니다. 칸트는 연구자 70명 미만이 이 체계로 한 달 1만~2만 번 실험을 돌린다고 했습니다.
전체 118B 가운데 토큰마다 8B만 쓰는 MoE 모델이고, 컨텍스트는 최대 100만 토큰입니다. 5월 22일 H200 4,096장으로 사전학습을 시작해 60일 만인 7월 21일 공개됐습니다.
지금 능력 수준에서 오픈 모델을 제한하면 혁신이 다친다고 봤습니다. 다만 영원히 모두 열어 둘 수는 없으니 위험이 드러나면 국제적으로 합의한 능력 단위로 다시 판단하자고 했습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
용 모델을 만드는 미국 스타트업 Poolside의 공동창업자이자 CEO 에이소 칸트(Eiso Kant)가 7월 23일(미국 시각) 공개된 Latent Space에 나와 두 시간 가까이 모델 만드는 법을 풀었습니다. 그는 연구자 70명이 안 되는 팀이 한 달에 실험을 1만~2만 번 돌리고, 새 모델을 학습 시작부터 공개까지 5~8주 만에 내놓는 사내 체계 「모델 공장(Model Factory)」을 설명했습니다. 녹음은 씽킹머신즈가 첫 모델 Inkling을 공개한 7월 15일에 했고, Poolside는 6일 뒤 118B 오픈웨이트 모델 Laguna S 2.1을 내놓았습니다.
@latentspacepodX 게시물 · 원문 보기
Latent Space는 공개 당일 X에 이 대화를 코딩이 AGI로 가는 길이라는 주장과 실험 1만~2만 번, 8주라는 숫자로 소개했습니다. Poolside 공식 계정이 따로 뽑아 올린 문장은 파운데이션 모델 회사가 5곳인 세상보다 100곳인 세상에서 살고 싶다는 칸트의 말이었습니다. 에피소드가 나오기 이틀 전 Poolside는 Laguna S 2.1을 공개하며, 자사 비교표에서 전체 파라미터가 8배 넘는 Inkling(975B)을 터미널 작업 시험 Terminal-Bench 2.1에서 70.2% 대 63.8%로 앞섰다고 밝혔습니다.
칸트가 코드를 쓰는 언어 모델에 뛰어든 것은 2015년입니다. 안드레이 카파시의 글 「순환 신경망의 비합리적인 효과」를 읽고 하룻밤 사이에 당시 스타트업을 코드용 신경망 연구로 틀었고, Sourced라는 오픈소스 회사에서 40명과 함께 2019년 말까지 4~5년을 매달렸습니다. 그는 규모를 계속 키우기만 하면 된다는 것을 그때는 몰랐다며, 투자자 돈 1,200만 달러를 날린 일을 경력에서 가장 큰 실패로 꼽았습니다. 2년 동안 언어 모델에서 손을 뗐다가 챗GPT가 나오자 사람들이 그의 옛 발표 자료를 보내오며 연락해 왔다고 했습니다.
2023년 제이슨 워너와 Poolside를 세울 때 두 사람이 건 전제는 두 가지였습니다. 이 기술의 능력은 멈추지 않고 복리로 늘어나고, 대형 언어 모델의 능력을 가장 크게 끌어올릴 동력은 강화학습이라는 것입니다. 칸트는 당시 오픈AI도 구글도 앤트로픽도 강화학습을 그렇게 보지 않았다고 했습니다. Poolside는 2024년 10월 5억 달러를 모으며 코드 실행 결과를 보상으로 쓰는 강화학습을 13만 개 코드베이스에서 돌리고 있고 학습용 GPU를 1만 장으로 늘렸다고 밝혔습니다.
회사 이름에도 사연이 있습니다. 처음 고른 이름은 아마존의 상표였고, 법인을 세우기도 전에 한 대형 기술 기업과 연산을 받고 영구 사용권을 주는 거래를 논의하던 중 그 회사 수석과학자가 남들이 들으니 풀사이드라는 식당으로 옮기자고 한 말이 이름이 됐습니다. 거래는 성사되지 않았고, 칸트는 이 이름을 야망을 깎지 말자는 다짐으로 쓴다고 했습니다.
칸트는 모델 만들기의 90%가 엔지니어링이라고 했습니다. 3년 전 업계의 학습 환경은 배시 스크립트와 기워 붙인 데이터 파이프라인이었고, Poolside는 처음부터 분산 시스템 엔지니어를 연구 과정에 넣어 원자료 수집부터 사전학습, 후속학습, 강화학습까지 하나의 공정으로 묶었다는 겁니다. 그가 최적화하는 지표는 연구자의 아이디어가 믿을 수 있는 실험 결과를 거쳐 다음 모델 학습에 들어가기까지 걸리는 시간입니다.

숫자로는 이렇습니다. 연구자는 70명이 안 되고 엔지니어가 35명인데, 한 달에 돌리는 실험이 1만~2만 번이라 연구자 한 명당 한 달 약 140~290번꼴입니다. 학습 데이터를 미리 묶어 클러스터에 복사하는 대신 학습하는 동안 바로 흘려 넣고(스트리밍), 데이터 배합은 블렌더라는 서비스에서 설정 몇 줄로 바꿉니다. 데이터는 한 번 만들면 바꿀 수 없게 두고 실험은 모두 버전 관리되는 코드로 적어서, 2년 전 학습도 토큰 하나가 어느 코드 버전에서 들어갔는지까지 되짚어 그대로 재현할 수 있다고 했습니다.
Poolside의 공식 자료도 같은 그림입니다. 지난해 7월 공개한 설명에 따르면 모델 공장은 H200 GPU 1만 장 클러스터 위에서 돌고, 배치 크기나 학습률을 바꿔 보는 실험을 짜는 데 며칠 걸리던 일이 10분도 안 걸립니다. 5월 기술 보고서는 자동 복구가 실패할 때만 당직자를 부른다는 원칙을 적었는데, 칸트는 Laguna S를 학습하는 동안 사람을 깨운 호출이 한 번도 없었고 올해 들어 기억나는 것도 없다고 했습니다.
| 공개일 | 모델 | 전체 / 활성 파라미터 | 학습 시작부터 공개까지 |
|---|---|---|---|
| 4월 28일 | Laguna M.1 | 225B / 23B | 사전학습은 지난해 말 완료 |
| 4월 28일 | Laguna XS.2 | 33B / 3B | 5주 |
| 7월 2일 | Laguna XS 2.1 | 33B / 3B | - |
| 7월 21일 | Laguna S 2.1 | 118B / 8B | 60일(5월 22일 H200 4,096장으로 시작) |
| 학습 중 | 새 Laguna M | 비공개 | 7월 14일 시작, 39일 일정(칸트) |
칸트는 예전처럼 6개월마다 큰 모델 하나를 학습하면 그사이 바뀐 것이 너무 많이 섞여 무엇이 성능을 올렸는지 알 수 없는 수프가 된다고 했습니다. 모델을 자주 처음부터 학습할수록 연구 조직이 무엇이 통했는지 빨리 배운다는 것이 그의 설명이고, 큰 모델의 출력을 작은 모델에 가르치는 증류를 Poolside가 쓰지 않는 이유도 여기에 있습니다.
칸트는 매달 여는 오프라인 모임에서 연구자들 화면을 보면 에이전트 여러 개가 코드를 쓰고, 학습 작업을 띄우고, 결과를 평가하고, 파이프라인을 고치고 있다고 했습니다. 아이디어를 내고 디버깅을 돕는 것은 아직 사람이지만 데이터 파이프라인과 합성 데이터 쪽은 에이전트 비중이 크고, 모델 구조 쪽으로도 번지고 있어 재귀적 자기개선(RSI, AI가 다음 AI를 만드는 일을 스스로 개선하는 것)의 조짐이 보인다는 표현을 썼습니다. 엔지니어로 들어와 에이전트를 만들던 직원이 6개월 만에 제대로 된 강화학습 연구자가 된 사례도 들었습니다.
Laguna S는 Poolside가 자기 일에 의미 있게 쓰기 시작한 첫 모델이기도 합니다. 발표문에 실린 사례에서 Laguna S 2.1은 자동 반복 작업으로 Poolside의 에이전트 실행 틀(하네스)을 5.2% 빠르게 하고 메모리 할당을 약 70% 줄였습니다. 칸트는 녹음 전 10일 동안 하루 8~10시간을 이 모델과 보냈고, 전날 11시간짜리 비행에서 10시간을 작업 기록을 읽는 데 썼다고 했습니다.
그는 이 흐름에 시한도 붙였습니다. 모델이 재귀적 자기개선에 본격적으로 영향을 주기 전까지 짧은 창이 열려 있고 그 뒤에는 따라잡기가 불가능해질 수 있으니, 지금 해낼 수 있다고 믿는 연구자는 회사를 나와 자기 경쟁자가 되라고 했습니다.
제가 그 다섯 곳 가운데 하나라고 해도, 파운데이션 모델 회사가 다섯 곳인 세상보다 100곳인 세상에서 살고 싶습니다.— 에이소 칸트, Poolside 공동창업자 (Latent Space)
경쟁사를 대하는 태도도 같습니다. 녹음 다음 날 칸트는 X에 씽킹머신즈도 자기 모델 공장을 짓는 중이고 이번 모델은 한 시점의 결과일 뿐이라며, 이 경쟁에 뛰어드는 모두에게, 연구를 공개하는 곳에는 더더욱 박수를 쳐야 한다고 적었습니다.
@eisokantX 게시물 · 원문 보기
Laguna S 2.1은 전체 118B 가운데 토큰마다 8B만 쓰는 전문가 혼합(MoE) 모델로, 엔비디아의 책상용 AI 컴퓨터 DGX Spark 한 대에 들어갑니다. 칸트는 이 모델의 점수가 지능보다 행동에서 나왔다고 했습니다. 응용연구 공동책임자 왕펑밍이 7월 5일 일요일에 보낸 메시지, 곧 더 많이 검증하고 당연하게 여기지 않고 일찍 승리를 선언하지 않고 더 끈질기게 붙드는 행동이 성능을 올렸다는 말이 머릿속에 박혀 있다는 겁니다. 그 차이는 전부 후속학습에서 나왔다고 했습니다.
칸트는 여기서 한 걸음 더 나갔습니다. 그는 세계 경제의 25%, 약 25조 달러어치인 지식 노동에 쓰는 모델에는 크기를 더 키워도 본전이 안 나오는 정점이 있을 텐데, Laguna S를 보니 그 정점이 1조~10조 파라미터쯤일지 모른다고 했습니다. 그렇다면 모델은 상품이 되고 오픈소스가 이길 수 있다는 논리이고, 그는 자기 회사에 유리한 희망 섞인 주장이라는 단서를 스스로 달았습니다. 지금 세계 최고 모델은 여전히 Fable과 GPT-5.6이라고도 했습니다.
Poolside의 발표 자료에도 그 간격이 있습니다. 과제가 길어 부분 점수를 받기 어려운 DeepSWE에서 Laguna S 2.1은 40.4%였고 GPT-5.6 Sol은 73.0%였습니다. 오픈AI에서 연산을 총괄하는 사친 카티는 5월 스탠퍼드 강의에서 오픈웨이트 모델은 프런티어를 증류해 따라오겠지만 지능에서 6개월 앞선 것은 엄청난 격차라며, 프런티어 투자를 줄일 이유가 없다고 말했습니다.
칸트가 흔치 않은 의견이라며 꺼낸 전망은 강화학습이 학습의 더 이른 단계로 옮겨 온다는 것입니다. 웹에는 인류 지식 거의 전부가 담겨 있는데 다음 토큰 예측만으로는 거기서 뽑아내야 할 것을 아직 덜 뽑는다는 것이 그의 진단이고, Poolside는 학습 초기부터 모델이 생각하는 법을 배우도록 웹을 바꿔 쓰는 연구를 몇 년째 하고 있다고 했습니다. 발표문은 이를 두 번째 베팅이라고 부르며, 사람이 쓴 글은 대부분 답만 적고 거기에 이른 생각은 적지 않으니 강화학습으로 그 생각을 되살릴 수 있다고 적었습니다.
그는 업계가 두 가지 약에 기대고 있다고도 했습니다. 하나는 증류이고 다른 하나는 강화학습 환경을 계속 늘리는 일인데, 둘 다 모델을 좋게 만들지만 AGI로 가는 길이 환경을 끝없이 늘리는 데 있는지는 아직 모르겠다는 겁니다. 중간 학습(mid-training)이라는 단계도 웹 데이터에 순서를 매기는 서툰 교육과정이고, 학습이 여러 단계로 나뉜 것도 팀이 그렇게 나뉘어 있기 때문이라고 봤습니다.
칸트는 두 해째 해 온 주장이라며 MCP(모델이 외부 도구에 접속하는 표준)와 도구 호출이 멍청하다고 말했습니다. 길고 복잡한 작업일수록 모델은 데이터와 가상 머신에 깔린 프로그램을 다루는데, 그 사이에 MCP나 도구 호출을 끼우지 말고 모델이 코드를 직접 짜게 두자는 겁니다. 코드로 일하면 조건문과 반복문을 쓸 수 있고, 강화학습을 하면 모델은 시스템 프롬프트에 적힌 도구 50개 가운데 하나를 고르는 대신 가장 효율적인 길로 가려 한다고 했습니다. 그는 12개월 뒤에는 도구 20~40개를 채운 시스템 프롬프트를 볼 수 없을 것이라고 내다봤습니다.
그래도 Poolside는 MCP와 도구를 지원하고, Laguna S 2.1은 이 회사가 처음 병렬 도구 호출을 넣은 모델입니다. 자체 하네스 pool의 도구도 셸 실행과 쓰기, 웹 가져오기처럼 여섯 개 남짓뿐이라고 했습니다. 발표문이 밝힌 한계도 이 설계와 이어집니다. 자기 하네스와 조금 다른 남의 하네스 도구를 만나면 정의를 읽지 않고 기억 속 사용법대로 처음 호출하는 경우가 있고, JSON 배열을 받는 인자를 잘못 만들기도 한다는 내용입니다.
시각 이해는 아직 없어서 개발을 시작했고, 오디오는 아주 오랫동안 손대지 않겠다고 했습니다. 20~30쪽짜리 물리 논문에 담긴 생각처럼 언어가 지식과 추론을 가장 촘촘하게 담는 형식이어서, 연산과 사람이 모자란 회사에는 언어에 거는 쪽이 더 나은 투자라는 설명입니다.
칸트는 지금 능력 수준에서 오픈 모델을 어떤 식으로든 제한하면 혁신이 다친다고 했습니다. 영원히 모든 것을 열어 둘 수 있다는 주장도 지금 당장 모두 닫자는 주장만큼 극단이라며, 위험이 실제로 드러나면 다시 판단하되 공개냐 비공개냐로 나누지 말고 국제적으로 합의할 수 있는 능력 단위로 따지자고 했습니다. GPT-2 때부터 오용 걱정으로 공개를 막자는 목소리가 있었고, 업계가 이 판단을 잘해 오지 못했다는 말도 덧붙였습니다.
그가 든 비유는 담배 광고 금지입니다. 좋은 규제였지만 새 회사가 들어올 길이 막히면서 기존 담배 회사들의 과점을 굳혔다는 겁니다. 지금 능력만 보고 2026년에 두세 회사만 이 기술을 만들 수 있다고 정하면 가장 디스토피아적인 SF 소설의 14장 같다고 했고, 모델 회사가 자기 모델로 다른 파운데이션 모델을 개발하지 못하게 막는 흐름에는 그들의 권리라면서도 제정신이 아닌 일이라고 했습니다.
진행자들은 반론을 폈습니다. swyx는 안전 쪽으로 기울었다가 되돌리는 편이 반대보다 낫다고 했고, 한 곳만 안전을 택하면 다른 곳이 더 위험하게 앞서 간다는 말이 이어졌습니다. 녹음 1주일 뒤인 7월 22일 워싱턴에서는 이 논쟁의 양쪽이 한꺼번에 움직였습니다. 마이클 크라치오스 백악관 과학기술정책실장은 문샷AI가 Kimi K3를 만들며 Fable을 증류했다고 주장했고, 같은 날 미국 스타트업 179곳은 오픈웨이트를 막지 말라는 서한을 백악관에 보냈습니다.
칸트는 Poolside를 아직 H200 1만 장 규모의 회사라고 부르며 곧 훨씬 늘린다고 덧붙였습니다. 호퍼 세대와 GB300 세대의 차이가 1조 파라미터 모델과 5~6조 파라미터 모델의 차이라며, 모델의 계단식 발전은 네트워크와 시스템의 새 세대에서 나온다고 했습니다. Laguna S는 FP8로 학습했고, 엔비디아의 4비트 형식 NVFP4 학습은 블랙웰로 옮긴 뒤로 미뤘습니다.
지금 가장 큰 병목은 강화학습에 걸리는 시간입니다. 강화학습은 과제가 수백만 개로 정해져 있어 배치를 마음대로 키울 수 없고, 그래서 GPU를 더 붙여도 빨라지지 않는다고 했습니다. 그가 기대하는 해법은 추론에서 이미 쓰는 방식, 곧 입력을 읽는 단계(프리필)와 답을 만드는 단계(디코드)를 서로 다른 칩에 나눠 맡기는 구성을 강화학습에도 들이는 것입니다. 경쟁을 재는 단위는 GPU 수보다 달력 시간이라는 설명입니다.
진행자가 딥시크의 학습비 500만 달러 이야기를 꺼내자 칸트는 학습 실행 자체는 싸고 싱거운 사건이라고 답했습니다. 새 모델 학습이 시작되면 슬랙에 링크 하나가 올라오고 끝이며, 돈과 시간은 그 앞의 연구와 데이터, 인프라에 들어간다는 겁니다.
국내 파운데이션 모델 회사들도 같은 조건에서 경쟁합니다. 정부의 독자 AI 파운데이션 모델 사업은 6개월 안에 나온 최신 글로벌 모델 대비 95% 성능을 목표로 내걸었고, 업스테이지는 7월 22일 이 사업의 두 번째 모델인 250B Solar Open 2를 오픈웨이트로 공개하며 250B도 자력으로는 힘든 규모였다고 밝혔습니다.
Poolside의 숫자는 크지 않은 팀이 주기를 앞당긴 사례입니다. 연구자 70명 미만이 3개월 동안 모델 셋을 냈고, 칸트는 외부 데이터를 비교적 적게 산 제약이 다른 쪽 역량을 키웠다고 했습니다. Laguna S 2.1의 라이선스 OpenMDW-1.1에는 지역이나 이용자 수를 따지는 조항이 없어 국내 기업도 내려받아 고쳐 쓸 수 있습니다.
칸트의 말은 몇 달 안에 하나씩 확인할 수 있습니다. 7월 14일 시작한 새 Laguna M의 학습이 39일 일정대로라면 8월 22일께 끝나고, 칸트는 그 뒤로 L과 XL도 나온다고 했습니다. 도구 20~40개를 채운 시스템 프롬프트가 12개월 안에 사라진다는 예측은 내년 7월에 맞춰 볼 수 있습니다.
읽어 주셔서 고맙습니다.
초이 드림