이 글 어땠어요?
연구용 코드는 깃허브에 아파치 2.0 라이선스로 공개돼 있고 Gemini 말고 다른 언어 모델로도 돌릴 수 있습니다. 구글은 5월 19일 ERA로 만든 Computational Discovery를 Google Labs 신뢰 테스터에게 열기 시작했고, 한국에서 신청할 수 있는지는 확인하지 못했습니다.
네이처 논문의 코로나19 결과는 2025년 5월 1일 기준 데이터로 2024~25 시즌을 되짚은 소급 평가입니다. 실시간 예측은 2025~26 시즌에 따로 냈고, 5월 후속 논문은 독감·코로나19·RSV에서 CDC 허브 앙상블과 같거나 앞섰다고 밝혔습니다.
플랫은 지금까지 이 부품들로 완전히 새로운 물리학이나 과학을 발견하는 시스템은 만들지 못했다고 말했습니다. 네이처 논문도 예측 모델을 최적화하는 일과 진짜 과학적 발견의 구분을 강조했습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
그렉 크로아하트만은 9월 22일 발표에서 Mythos가 찾았다는 리눅스 버그 79건 가운데 필요한 수정은 20건, 진짜 수정은 10건이라고 했습니다. 커널 CVE는 하루 33건으로 늘었고, 그는 LLM이 만든 패치의 절반은 틀린다고 봤습니다.

숄토 더글러스는 10월 2일 공개된 대담에서 사람이 컴퓨터로 하는 모든 일을 모든 인간 이상으로 해내는 모델이 2년 안팎에 나온다고 봤습니다. 앤트로픽 측정으로 Claude가 주도하는 연구개발은 8월 26%였고, 완전 자율 업무는 아직 없습니다.
네이선 램버트는 9월 22일 Interconnects 대담에서 실험 주기는 곧 10배 빨라져도 분야의 이해는 다른 축이라고 했습니다. 에포크 AI의 JS 데냉은 오픈AI·앤트로픽이 공개한 사내 가속 수치를 임박한 지능 폭발의 강한 증거로 보지 않았습니다.

그렉 크로아하트만은 9월 22일 발표에서 Mythos가 찾았다는 리눅스 버그 79건 가운데 필요한 수정은 20건, 진짜 수정은 10건이라고 했습니다. 커널 CVE는 하루 33건으로 늘었고, 그는 LLM이 만든 패치의 절반은 틀린다고 봤습니다.

숄토 더글러스는 10월 2일 공개된 대담에서 사람이 컴퓨터로 하는 모든 일을 모든 인간 이상으로 해내는 모델이 2년 안팎에 나온다고 봤습니다. 앤트로픽 측정으로 Claude가 주도하는 연구개발은 8월 26%였고, 완전 자율 업무는 아직 없습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
진행자 브랜던 앤더슨은 플랫을 구글 펠로이자 구글 리서치 응용과학 책임자로 소개했습니다. 플랫은 머신러닝 교과서에 실린 알고리즘 두 개를 만든 사람입니다. SVM(서포트 벡터 머신)을 빠르게 학습시키는 SMO와, 분류기의 점수를 확률로 바꾸는 플랫 스케일링입니다. 1987년 탄성 변형 모델 논문으로 영화 속 옷감 시뮬레이션의 길을 열어 데메트리 테르조풀로스와 함께 2005년 아카데미 과학기술상을 받았고, 칼텍 학생 시절에는 팔로마 천문대 망원경 사진으로 소행성 두 개를 찾았습니다.
대담은 Latent Space의 과학 코너로, 앤더슨과 공동 진행자 RJ 호니키가 2시간 동안 ERA와 기후, 핵융합, 양자컴퓨터를 물었습니다. 아래는 공개 전사본에서 ERA와 연구 자동화에 관한 대목을 골라, 구글이 낸 논문과 블로그의 숫자와 맞춰 본 것입니다.
플랫이 설명한 ERA의 출발점은 단순합니다. 과학 문제 상당수를 어떤 점수를 가장 높이는 코드 한 편을 찾는 문제로 바꿔 적을 수 있다는 겁니다. 통계 모델이라면 데이터에 얼마나 잘 맞는지가 점수가 되고, 응용수학의 점근 전개라면 매개변수를 아주 작게 줄였을 때 해가 맞는지가 점수가 됩니다. 구글은 이런 문제를 점수 매길 수 있는 과제(scorable task)라고 부릅니다.
이 틀은 Kaggle에서 나왔습니다. 플랫은 Kaggle이 구글 소유라는 사실을 사람들이 잘 모른다며, 프로젝트의 처음 이름이 오토 캐글 문제였다고 했습니다. 네이처 논문을 보면 연구팀은 2023년 시즌 Kaggle 플레이그라운드 대회 16개를 개발용 시험대로 삼았고, 만든 코드를 Kaggle에 직접 제출해 사람 참가자 수천 명과 견준 백분위로 실력을 쟀습니다.
@GoogleResearchX 게시물 · 원문 보기
점수 함수를 정하는 일은 사람에게 남았습니다. 진행자가 그 부분은 에이전트에게 맡기기 어렵겠다고 하자 플랫은 맞다고 답했습니다. 사람과 에이전트가 함께 점수 함수를 만들어도 반복 과정이 빈틈을 찾아 속이는 일이 생겨, 첫날부터 맞는 점수 함수를 얻기는 어렵다는 설명입니다. 오픈AI가 9월 6일 공개한 사내 자료에서도 연구자들이 맡긴 에이전트 토큰은 코드와 실험에 몰렸고, 상위 계획에 쓰인 토큰은 아주 적었습니다. 그 자료는 오픈AI 연구 조직의 에이전트 사용량에서 다뤘습니다.
잠도 안 자는 열성적인 대학원생을 둔 것과 거의 같습니다. 이것저것 알려 주고 이리저리 이끌어 주는 식입니다.— 존 플랫, 구글 펠로
ERA가 몇 시간 돌다가 예시 몇 개를 들고 돌아오면, 사람이 논문을 가리키거나 잘못 가는 방향을 짚어 줍니다. 플랫은 이 바깥 반복이 가장 재미있고 창의적인 부분이라고 했습니다. 2024년 무렵에는 실험 코드 한 편을 짜는 데 품이 많이 들어 대학원생이 몇 가지만 해 보고 멈췄는데, ERA는 지치지 않고 계속 시도한다는 겁니다.
| 날짜 | 있었던 일 |
|---|---|
| 2025년 9월 8~9일 | 구글, 프리프린트와 블로그, 깃허브 코드 공개 |
| 2025년 11월 | CDC 독감 예측 대회 2025~26 시즌에 주간 예측 제출 시작 |
| 2026년 4월 29일 | 독감 예측·우주끈·이산화탄소·신경 회로 적용 사례 공개, Empirical Research Assistance라는 이름 발표 |
| 2026년 5월 15일 | 실시간 다중 병원체 예측, 입체 태양광, 캘리포니아 유출량 논문 공개 |
| 2026년 5월 19일 | 네이처 게재, Computational Discovery 신뢰 테스터 공개 시작 |
| 2026년 9월 22일 | Latent Space 대담 공개 |
ERA 안에서는 파이썬 노트북 수백에서 수천 개가 나무 모양으로 자랍니다. Gemini가 후보 하나를 골라 점수를 올릴 방법을 궁리해 고친 노트북을 만들고, 실행해 점수를 매긴 뒤 다시 후보 더미에 넣습니다. 고르는 규칙은 강화학습에서 쓰는 상한 신뢰 구간(UCB)입니다. 지금 점수에 불확실성을 얹은 낙관적 추정치로 고르기 때문에, 1등 후보를 두고 5등 후보를 고르기도 합니다.
한 번에 키우는 잎은 기본 10개입니다. 플랫은 병렬을 너무 늘리면 서로의 결과를 보지 못해 배우는 것 없이 연산만 쓰게 된다며, 작은 묶음이 끝날 때마다 앞선 시도의 생각과 실행 결과를 공유 맥락에 넣어 다음 시도가 배우게 한다고 했습니다. 나무가 커지면 맥락이 넘치지 않게 기록을 쳐내는 관리도 따로 합니다.
코드를 무작위로 바꿔 가며 진화시키는 발상은 1970년대부터 있었습니다. 플랫은 코드 공간의 무작위 돌연변이는 DNA처럼 대부분 해롭다며, 지금 방식이 통하는 이유를 안쪽 반복 자체가 세상 지식을 가진 AI라는 데서 찾았습니다. 그래서 그는 모델 세대를 결정적인 변수로 꼽았습니다. Gemini 2.0으로는 불가능했을 것이라고 했고, 2.0을 써 보고 실망했다는 과학자에게는 그게 1년 전, 아득한 옛날 일이라고 답한다고 했습니다.
| 항목 | 값 |
|---|---|
| 논문 실험에 쓴 모델 | Gemini 2.5 Flash(Pro로 바꿔도 개선은 소폭) |
| 한 번에 키우는 후보 | 10개(플랫, 대담) |
| 단일세포 실험 한 번 | 노드 500개, 약 7시간 |
| 코로나19 예측 한 번 | 노드 2,000개 |
| 점수가 더 오르지 않는 지점 | 노드 300~1,000개 |
연구팀은 노드 128개까지 키운 ERA를, 같은 모델로 128번 따로 뽑아 가장 좋은 것을 고르는 방식과도 견줬습니다. Gemini 3 Flash, Mistral 3, Claude Sonnet 4.6, GPT-5, Gemini 3.1 Pro 다섯 모델에서 모두 ERA가 이겼고, 예외는 단일세포 과제의 GPT-5 하나였습니다. 논문은 GPT-5의 한 번 풀이가 이미 충분히 좋아서 생긴 일로 설명하며, 모델이 좋아질수록 어렵던 과제가 포화될 것으로 봤습니다.
성적표는 여섯 분야에 걸쳐 있습니다. 단일세포 RNA 배치 통합은 실험실마다 다르게 낀 잡음(배치 효과)을 지우면서 진짜 생물학적 차이는 남기는 과제로, 이 일을 하는 도구만 300개 가까이 나와 있습니다. 코로나19 입원 예측은 미국 52개 주와 준주의 4주 치 입원 수를 23개 분위로 내고 가중 구간 점수(WIS)로 채점합니다. WIS는 얼마나 맞혔는지와 불확실성을 얼마나 정직하게 냈는지를 함께 보는 점수로, 낮을수록 좋습니다.
| 과제 | 비교 기준 | ERA 결과 |
|---|---|---|
| 단일세포 RNA 배치 통합 | OpenProblems v2.0.0, 지표 13개를 합친 종합 점수 | 87개 방법 중 40개가 공개된 최고 방법을 넘음, 1등은 ComBat보다 14% 높음 |
| 미국 코로나19 입원 예측 | CDC CovidHub 앙상블, 평균 WIS 29 | 평균 WIS 26, 앙상블을 넘은 전략 14개 |
| 범용 시계열 예측 | GIFT-Eval(데이터셋 28개), 2025년 5월 18일 리더보드 | 데이터셋별 풀이가 리더보드 전체를 앞섬 |
| 위성 영상 분할 | DLRSD, mIoU | 상위 3개 풀이 0.80 초과, 기존 최고 기법보다 약간 높음 |
| 제브라피시 뇌 활동 예측 | ZAPBench(뉴런 7만여 개) | 기존 기준 모델을 모두 앞섬 |
| 어려운 적분 | 표준 수치 적분이 실패한 19개 | 17개 정답 |
가장 큰 개선은 조합에서 나왔습니다. 단일세포 과제의 1등은 BBKNN이라는 기존 방법을 ERA가 다시 구현한 것으로, 다른 방법인 ComBat으로 먼저 보정한 주성분을 쓰도록 고친 것이 성능을 끌어올렸습니다. 이 조합은 429번째 구현 시도에서 처음 나왔고, 연구팀이 같은 변경을 손으로 넣어 보니 원래 BBKNN도 좋아졌습니다. 공개된 최고 방법인 ComBat보다 종합 점수가 14% 높았습니다.
@GoogleResearchX 게시물 · 원문 보기
평균 WIS 26이라는 숫자에는 조건이 붙어 있습니다. 연구팀은 2024~25 시즌 전체를 2025년 5월 1일에 쓸 수 있던 데이터로 되짚어 예측했고, 논문은 이 방식이 실제 예측 시점에 쓸 수 있던 데이터와의 차이를 무시한다고 적었습니다. 시즌이 끝난 뒤 정리된 숫자로 지난 주를 맞히는 방식은 그 주에 집계된 숫자로 다음 주를 맞히는 실전보다 조건이 좋습니다.
구글은 실전도 치렀습니다. 2025년 11월 CDC의 독감 예측 대회가 2025~26 시즌을 열자 모든 주에 대해 4주 뒤까지의 예측을 매주 냈고, 연말에는 코로나19와 RSV(호흡기세포융합바이러스) 예측 허브에도 들어갔습니다. 5월 15일 공개된 후속 논문은 기계가 만든 모델들을 묶은 앙상블이 표본 밖 평가에서 CDC 허브 앙상블과 같거나 앞섰다고 밝혔습니다.

같은 논문에는 보상 해킹 이야기도 있습니다. 연구팀은 통제된 소급 실험에서 로그 척도의 거리 지표를 최적화하게 하자 보상 해킹이 막혔고, 자동 심사 모델을 반복 안에 넣자 복잡한 역학 이론을 코드에 충실히 옮겼다고 적었습니다. 플랫도 대담에서 CDC 대회는 아주 잘했지만 다른 대회에서는 그만큼 좋지 못한 경우가 많았다고 했습니다.
대담에서 플랫이 가장 공들여 설명한 것은 두 종류의 모델입니다. 예측 모델은 입력과 출력만 보고 어떤 데이터에서 오류를 가장 낮추는 코드이고, 기술(記述) 모델은 물리 법칙처럼 현실의 작동 방식을 담아 본 적 없는 영역까지 내다보는 모델입니다. 그는 뉴턴이 사과를 보고 중력을 떠올렸지만 중력은 사과에 관한 법칙에 그치지 않는다며, 17세기의 머신러닝 모델이었다면 사과가 떨어진다고 맞혀도 행성 데이터가 없으니 행성은 모른다고 했을 것이라고 했습니다.
지금까지 이 부품들로 완전히 새로운 물리학이나 완전히 새로운 과학을 정말로 발견하는 시스템은 만들지 못했습니다. 이것은 완전히 새로운 과학을 발견하도록 돕는 전동공구 같은 것입니다.— 존 플랫, 구글 펠로
ERA가 내놓는 것은 예측 모델이고, 그 모델이 세상을 제대로 설명하는지 확인하는 일은 과학자에게 남는다는 것이 그의 정리입니다. 네이처 논문도 토론 부분에 같은 내용을 넣었습니다. 연구팀은 경험적 예측 모델을 최적화하는 일과, 이론과 인과 기제를 따지는 진짜 과학적 발견 사이의 구분을 강조한다고 적었습니다.
구글 연구진이 2월에 낸 제브라피시 논문은 이 구분을 실험으로 확인했습니다. 신경과 몸을 모두 시뮬레이션한 가상 제브라피시를 정답지로 두자, 언어 모델 나무 탐색은 기존 예측 기법보다 훨씬 잘 맞히는 모델을 찾았지만 그 모델들은 통계적 지름길을 썼습니다. 회로의 연결 구조를 미리 알려 주자 처음 보는 자극에서도 통하고 실제 작동 원리를 되찾는 모델이 나왔습니다. 구글은 4월 블로그에서 이 작업에 ERA를 썼다고 밝혔습니다.
전동공구라서 손가락을 베어 낼 수도 있습니다. 이제는 자신을 속이지 않으려면 더 조심하고 더 엄밀할 필요가 있습니다. 들여다보지 않는 검증 데이터를 아주 깊이 숨겨 두는 일에는 정말로, 지독할 만큼 신경을 쏟을 필요가 있습니다.— 존 플랫, 구글 펠로
플랫은 자기 팀이 연 Kaggle 비행운 탐지 대회에서 사람 참가자들이 구글을 이긴 일화를 들었습니다. 우승자들은 정답 라벨에 숨어 있던 반 픽셀 오차, 곧 픽셀 좌표의 원점을 모서리에 두느냐 가운데에 두느냐의 차이를 찾아내 점수를 더 짜냈습니다. Latent Space는 이 대회의 상금이 1만 5,000달러였다고 적었습니다.
사람도 이 언어 모델들처럼 굴면서 보상 해킹을 하려 듭니다. 굿하트의 법칙으로 돌아가는 얘기입니다. 목표가 된 지표는 더 이상 좋은 지표가 못 됩니다.— 존 플랫, 구글 펠로
재미있게 엇나간 보상 해킹 일화가 있느냐는 질문에는 당장 떠오르지 않는다고 답했습니다. 대담 공개 4개월여 전 그가 마이클 브레너, 리지 도프먼과 함께 낸 논문에는 그런 사례가 적혀 있습니다. 하루 동안 햇빛을 가장 많이 받는 입체 태양광 구조를 ERA로 찾자, 처음 나온 고효율 설계들은 서로 이어지지 않은 단이 허공에 떠 있거나 광학 계산기의 격자 오차를 파고든 결과였습니다.
연구팀은 코딩 에이전트 Antigravity가 물리 엔진에 제약을 하나씩 덧대게 해 이런 꼼수를 막은 뒤에야 쓸 만한 설계를 얻었습니다. 구글이 5월에 소개한 결과는 삼각형 500개로 만든 부채꼴 입체 구조로, 흩어진 햇빛을 가두면서 뒤쪽 그늘이 전혀 생기지 않았습니다.
그래서 그는 출발점을 낮게 잡으라고 권합니다. 진행자가 생물학에는 데이터가 많아도 단순한 기준 모델을 좀처럼 넘지 못하는 문제가 많다고 하자 이렇게 답했습니다.
저는 사람들에게 늘 일단 선형 회귀부터 맞춰 보라고 합니다. 그냥 해 보십시오. 아니면 SVM이라도 써 보십시오.— 존 플랫, 구글 펠로
ERA가 실제 연구를 풀어낸 사례로 플랫은 비행운을 꼽았습니다. 그의 설명으로는 사람이 일으킨 지구 온난화의 약 1%가 비행운 때문이라는 추정이 있습니다. 비행운은 낮에는 햇빛을 반사해 식히지만, 지구가 내보내는 10마이크로미터 부근의 적외선을 붙잡아 밤낮없이 담요처럼 데웁니다. 항공 교통이 많은 유럽에서는 이 효과가 국지적으로 1제곱미터당 약 1와트에 이르고, 사람이 만든 온난화 효과의 지구 평균은 약 3와트입니다.
비행운은 얼음 과포화 상태인 대기 구간을 지날 때 생깁니다. 두께가 몇백 미터인 납작한 구간인데, 이곳을 지나면 배기가스 1그램이 물 10킬로그램을 얼음으로 끌어당깁니다. 비행 고도를 두 단계만 내리면 연료는 조금 더 들지만 이 구간을 피해 갈 수 있습니다.
문제는 막은 온난화의 양을 재는 일이었습니다. 비행운이 없었다면 어땠을지를 추정하는 반사실 모델이 필요한데, 연구팀은 지구가 내보내는 장파 복사 쪽 모델은 갖췄지만 반사된 햇빛 쪽은 2년 동안 풀지 못했습니다. 인공 비행운을 섞어 넣은 시험 데이터로 검사하면 연구팀의 시도는 자기들이 만든 시험도 통과하지 못했고, ERA가 찾은 모델은 통과했습니다.
그 모델은 거대한 코드 덩어리도 아니었습니다. 플랫은 교란 변수 몇 개를 연구팀이 해 보지 않은 조합으로 넣은 아주 단순한 모델이었고, 돌이켜 보면 상식적이었다고 했습니다. 장파 복사 쪽은 이미 논문이 있고, 햇빛 쪽은 아직 투고 전이라 유럽지구과학연맹(EGU) 총회에서 발표만 했다고 밝혔습니다.
플랫이 같이 꺼낸 이산화탄소 지도도 ERA 작업입니다. 탄소 관측위성 OCO-2는 정밀하지만 좁은 띠만 재고 같은 곳을 16일에 한 번 지나가며, 기상위성 GOES-East는 반구 전체를 10분마다 찍지만 이산화탄소를 재도록 설계되지 않았습니다. 구글 연구진은 ERA로 GOES-East의 파장대 16개와 기상 정보를 묶어, 10분마다 어디서나 이산화탄소 농도를 추정하는 모델을 만들었습니다.

플랫은 AI가 모든 과학을 같은 속도로 바꾸지는 않는다고 봤습니다. 15일 안팎의 날씨 예보는 2018년 무렵의 머신러닝과 방대한 데이터, 연산으로 크게 좋아졌지만, 기후는 시스템 자체가 움직이는 비정상(non-stationary) 문제라 30~50년 뒤의 데이터를 미리 가질 수 없습니다. 그는 데이터가 적은 문제라서 지금까지 AI가 기후 모델링을 혁신하지는 못했다고 했습니다.
불확실성의 크기도 숫자로 들었습니다. 생물권이 오르는 기온과 이산화탄소에 어떻게 반응할지 몰라 2100년 대기 이산화탄소 전망의 오차 범위가 300ppm에 이르는데, 지금 농도가 440~450ppm 정도입니다. 그가 다음 세대 도구에 거는 기대는 사람이 평생 읽는 것보다 많은 논문을 읽고, 쌓인 과학 지식에 맞춰 상식적인 코드를 짜는 도구입니다. 그는 ERA 안에서 그런 조짐을 조금씩 보지만 지금의 ERA가 그 일을 한다고 주장하지는 않는다고 덧붙였습니다.
대담 끝에 마법으로 업계의 병목 하나를 없앨 수 있다면 무엇을 없애겠느냐는 질문을 받자, 플랫은 JSON 하나를 보내면 어떤 실험이든 자동으로 해 주는 만능 실험실을 꼽았습니다. ERA 같은 도구는 전부 계산이고, 데이터는 누군가 직접 모은다는 이유였습니다. 그는 앞선 대목에서도 실험이 정답의 근거로 남는다며, 모든 실험을 하는 범용 자동 실험실은 아직 아무도 갖고 있지 않다고 했습니다.
비용은 대담에서 나오지 않았습니다. 플랫은 구글 내부 Gemini 호출을 쓰기 때문에 예산을 모른다고 했고, 점수 함수 안에 시뮬레이션이 들어가면 CPU와 GPU도 상당히 쓴다고 했습니다. 네이처 논문의 단일세포 실험 한 번이 노드 500개에 약 7시간이었다는 것 말고는 공개된 숫자가 없습니다.
ERA 연구용 코드는 2025년 9월 깃허브에 아파치 2.0 라이선스로 올라왔습니다. Latent Space는 이 구현이 Gemini로 돌았지만 다른 언어 모델로도 쓸 수 있고, ERA 자체는 아직 구글 제품으로 나오지 않았다고 적었습니다. 진행자 한 명은 대담 중에 공개판 ERA를 Claude에 연결해 돌려 보는 중이라고 말하기도 했습니다.
구글은 5월 19일 네이처 게재와 함께 ERA와 AlphaEvolve로 만든 Computational Discovery를 Google Labs 신뢰 테스터 프로그램으로 조금씩 열기 시작했습니다. 이 프로그램을 한국에서 신청할 수 있는지는 확인하지 못했습니다. 플랫이 젊은 과학자에게 준 조언은 깊은 도메인 지식을 쌓으면서 나와 있는 도구를 다 써 보라는 것이었고, 차로 오를 수 있는 산도 가끔은 걸어서 오를 만하다고 했습니다.
플랫은 자기 팀에 일의 20%를 배우고 실험하는 데 쓰게 하는 규칙을 지금도 지킨다고 했습니다. 모든 것을 짜내 최적화하면 무언가를 잃는다며, 그건 과적합이라고 했습니다. 그는 1982년에 수업을 들었던 리처드 파인먼의 말을 빌려, 자신을 속여서는 안 되고 가장 속이기 쉬운 사람이 자기 자신이라고 했습니다.

읽어 주셔서 고맙습니다.
초이 드림