이 글 어땠어요?
이번 발표는 수학 여러 분야의 미해결 문제 100건 이상을 건수로 밝힌 것입니다. 나비에-스토크스는 9월 9일 오픈AI가 클레이 문제의 (C)·(D)를 증명했다고 밝힌 사안이고 외부 심사는 끝나지 않았으며, 호지 추측은 The Information이 전한 내부 기대일 뿐 해결 발표는 없습니다.
알 수 없습니다. 오픈AI는 건수만 공개하고 어떤 문제를 풀었는지, 모두 몇 문제를 시도했는지, 증명이 무엇인지는 밝히지 않아 통과율을 계산할 수 없습니다.
쓸 수 없습니다. 오픈AI가 「새 내부 모델」이라고만 밝힌 사내 모델이고, 일반 이용자가 쓸 수 있는 최신 모델은 9월 3일 공개된 GPT-6 Astra입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
오픈AI가 9월 29일 DevDay에서 20개 넘는 발표로 주간 사용자 12억 명의 ChatGPT를 사람과 에이전트의 공용 공간으로 열었습니다. 마이크로소프트가 Copilot을 새로 짠 지 4일, 앤트로픽이 Claude Marketplace를 연 지 6일 만입니다.

9월 넷째 주 오픈AI 에이전트 사고가 호주 메디케어에서 미국 정부 사이트 세 곳과 사용자 이미지 53장까지 번졌습니다. 오픈AI 확인 집계는 스무 건 남짓에서 업계 전체 수만 건으로 벌어졌습니다.
FTC가 9월 30일 오픈AI·앤트로픽 조사에 들어갔고, 고위 당국자는 두 회사의 사고 조사를 맡아 온 METR에도 자료와 증언을 요구할 계획이라고 로이터에 말했습니다. 하루 전 6개사는 외부 감사를 약속한 백악관 합의에 서명했습니다.

오픈AI가 9월 29일 DevDay에서 20개 넘는 발표로 주간 사용자 12억 명의 ChatGPT를 사람과 에이전트의 공용 공간으로 열었습니다. 마이크로소프트가 Copilot을 새로 짠 지 4일, 앤트로픽이 Claude Marketplace를 연 지 6일 만입니다.

9월 넷째 주 오픈AI 에이전트 사고가 호주 메디케어에서 미국 정부 사이트 세 곳과 사용자 이미지 53장까지 번졌습니다. 오픈AI 확인 집계는 스무 건 남짓에서 업계 전체 수만 건으로 벌어졌습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@OpenAIX 게시물 · 원문 보기
발표문은 새 내부 모델의 성과와 자문그룹을 한 페이지에 담았습니다. 앞 문단은 모델이 100건이 넘는 난제를 풀었고 그 속도가 사내 수학자들도 놀랄 정도였다는 내용이고, 뒤 문단은 결과를 어떻게 검토하고 알릴지 조언할 독립 그룹을 꾸렸다는 내용입니다. 성과와 그 성과를 다루는 장치를 같은 날 같이 내놓은 겁니다.
오픈AI가 공개한 숫자는 두 개입니다. 학습 시작 8월 28일부터 발표 9월 21일(미국 시각)까지 24일, 그리고 푼 문제 100건 이상입니다. 분야는 수학 대부분에 걸친다고 적었습니다.
발표에 없는 숫자도 있습니다. 어떤 문제들을 풀었는지, 모두 몇 문제를 시도했는지, 100건의 증명을 언제 공개하는지입니다. 나비에-스토크스 때 166쪽 논문과 Lean 코드를 함께 냈던 것과 달리, 이번 100건은 건수만 나왔습니다. 하버드대 마크 키신은 100개를 풀었다면 전체 몇 문제를 시도했는지도 함께 알아야 한다고 짚었습니다. 100이 분자라면 분모가 비어 있어서, 모델이 맡은 문제를 얼마나 자주 푸는지는 이 발표만으로 계산할 수 없습니다.
시도의 규모가 공개되지 않는 흐름은 나비에-스토크스 때도 있었습니다. 9월 9일 발표에서 오픈AI는 시도한 문제 전체에 출력 토큰 약 3,000억 개를 썼고 그 가운데 나비에-스토크스에 약 1,300억 개가 들어갔다고 밝혔는데, 나머지 1,700억 개가량이 들어간 다른 문제들은 외력 없는 오일러 하나만 결과가 나왔을 뿐 무엇을 시도해 어디까지 갔는지는 공개되지 않았습니다. 성과의 숫자는 커지는데 시도와 실패의 숫자는 가려지는 모습이 100건 발표에서 한 번 더 되풀이된 겁니다.
오픈AI가 따로 공개한 미해결 문제 평가에서는 비슷한 연산량을 줬을 때 새 내부 모델이 GPT-6 Astra보다 높은 통과율을 기록했습니다. 연산을 늘려 오래 탐색하는 효과에 더해, 같은 조건에서 푸는 능력 자체가 올랐다는 그래프입니다.

이번 발표는 한 달여에 걸친 흐름의 끝에 있습니다. 8월 1일 오픈AI는 미출시 모델 Astra로 난제 열 건을 풀고 증명마다 Lean 인증서를 붙였는데, 성공한 해답에 쓴 토큰은 Sol API 요금으로 약 2,000달러어치였습니다. 9월 3일에는 일반 이용자용 GPT-6 Astra를 공개했습니다.
그다음이 나비에-스토크스였습니다. 9월 9일 오픈AI는 Astra보다 강한 내부 모델로 에이전트 약 1만 개를 88시간 돌려 나비에-스토크스 증명을 냈다고 발표했습니다. 이때 오픈AI가 증명했다고 밝힌 것은 클레이 문제 네 명제 가운데 외력을 허용하는 (C)와 (D)이고, 외력이 없는 (A)·(B)는 그대로 열려 있으며 상금은 청구하지 않겠다고 했습니다. 외부 수학자의 심사도 발표 시점에는 시작되지 않았습니다. 노엄 브라운은 이 결과에 수백만 달러가 들었다고 밝혔습니다.
@polynoamialX 게시물 · 원문 보기
브라운은 같은 글에서 o3를 발표할 때 ARC-AGI 1에서 87.5%를 받는 데 약 50만 달러가 들었지만 지금은 Astra가 약 20달러로 더 높은 점수를 낸다며, 1년 뒤에는 누구나 이 정도 문제를 푸는 AI를 손에 쥘 것이라고 적었습니다. 8월 1일의 2,000달러에서 9월 9일의 수백만 달러로, 한 과제에 붓는 계산량은 한 달 사이 이만큼 불어났습니다. 9월 21일의 100건에 든 비용은 공개되지 않았습니다.
방식도 발표문에 적혀 있습니다. 이미 사전학습을 마친 모델에 대규모 강화학습을 더해 여러 풀이를 시도하고 결과를 확인하며 더 나은 길을 찾도록 했고, 연구 도중 더 학습된 버전이 나오면 기존 에이전트를 새 버전으로 바꿔 다시 투입했습니다. 모델을 학습하면서 그 모델로 난제를 푸는 일을 동시에 돌린 겁니다.
세 번의 발표를 견주면 성과가 커지는 동안 함께 공개하는 자료는 줄었습니다.
| 발표 | 성과 | 함께 공개한 것 |
|---|---|---|
| 8월 1일 | 미해결 난제 10건 | 증명마다 Lean 인증서, 성공 해답 토큰 약 2,000달러어치 |
| 9월 9일 | 나비에-스토크스 (C)·(D) | 166쪽 논문, Lean 코드, 토큰·비용 일부 |
| 9월 21일 | 난제 100건 이상 | 건수 (문제 목록·증명·시도 총수 미공개) |
이 방식이 수학 바깥에서도 중요한 까닭은 연구 자동화로 이어지기 때문입니다. 오픈AI는 9월 6일 모델이 사람의 지시를 받아 숙련된 연구자에게 며칠이 걸릴 명확한 연구 과제를 수행하는 「자동화된 연구 인턴」 단계에 이르렀다고 밝혔습니다. 긴 풀이를 탐색하고 오류를 고치는 능력은 연구 코드 작성, 실험 설계, 결과 분석에도 쓸 수 있습니다.
같은 맥락에서 수석과학자 야쿠프 파초키는 9월 6일 회사의 자율 안전 약속을 제3자와 정부가 집행하는 의무 기준으로 올리자고 적었습니다. 모델이 다음 모델을 만드는 연구에 쓰이기 시작하면, 속도를 누가 어떻게 조절하느냐가 회사 안팎의 문제가 됩니다.
이런 성과를 낸 모델이 무엇인지는 밝혀지지 않았습니다. 오픈AI가 공식적으로 쓴 이름은 「새 내부 모델」이고, 9월 3일 공개한 GPT-6 Astra보다 훨씬 강하다고만 설명했습니다. 일반 이용자가 쓸 수 있는 최신 모델은 Astra이고, 내부 모델을 언제 어떤 형태로 내놓을지는 이번에도 나오지 않았습니다.
밀레니엄 문제 쪽에서는 호지 추측도 거론됐습니다. The Information은 9월 17일 오픈AI 내부에서 호지 추측 해결에 가까워지고 있다는 기대가 나온다고 전했는데, 공식 해결 발표는 없습니다. 호지 추측은 다항식으로 정의된 공간의 위상적 특징을 대수적으로 정의된 부분 공간들의 조합으로 나타낼 수 있는지를 묻는 문제로, 나비에-스토크스와 분야가 많이 다릅니다.
같은 날 출범한 자문그룹은 프린스턴 고등연구소(IAS)가 호스팅하며 오픈AI와 독립적으로 움직입니다. 요청하지 않은 조언을 할 수 있고, 조언을 외부에 공개할 수 있으며, 구성원은 오픈AI에서 보수를 받지 않고 멤버십도 그룹이 정합니다. 초기 구성원 9명의 명단은 다음과 같습니다.
| 구성원 | 소속 |
|---|---|
| 프랑수아 샤를 | ENS-PSL |
| 카밀로 데 렐리스 | IAS, GSSI |
| 티머시 가워스 | 콜레주 드 프랑스, 케임브리지 |
| 마르틴 하이러 | EPFL, 임페리얼 칼리지 런던 |
| 니힐 스리바스타바 | 버클리, 사이먼스 연구소 |
| 울리케 틸만 | 옥스퍼드, INI |
| 라비 바킬 | 스탠퍼드 |
| 에드워드 위튼 | IAS |
| 멜러니 매칫 우드 | 하버드 |
명단에는 유체와 편미분방정식을 연구해 온 카밀로 데 렐리스·마르틴 하이러, 대수기하의 라비 바킬·프랑수아 샤를처럼 오픈AI가 성과를 냈다고 밝힌 분야와 겹치는 전문가들이 들어 있습니다. 나비에-스토크스와 호지 추측 같은 결과를 읽어 낼 사람은 모였습니다.
이들이 맡는 일은 새로 나온 수학 결과의 의미를 평가하고, 어떻게 알릴지 조율하고, 학술·직업 기준을 조언하고, AI 도구가 수학 연구와 학습을 어떻게 도울지 자문하는 것입니다. 발표문은 한 가지를 분명히 적었습니다. 이 그룹은 오픈AI가 내부 수학 연구의 진행 속도를 어떻게 정할지에 대해서는 조언하지 않습니다. 결과를 바깥에 어떻게 내보일지는 함께 보지만, 안에서 얼마나 빨리 밀고 나갈지는 그룹이 조언하는 범위에서 빠져 있습니다.
이 구분은 오픈AI 자신의 다른 발언과 겹쳐 놓고 보면 뚜렷해집니다. 나비에-스토크스를 발표하던 9월 9일 오픈AI는 능력 향상의 속도를 신중하게 정하겠다고 적었고, 샘 올트먼도 안전을 위해 속도를 조절할 필요가 있다는 이야기를 많이 해 왔다고 썼습니다. 속도 조절을 말하면서, 그 속도를 외부 그룹의 조언 범위에서는 빼 둔 겁니다.
오픈AI가 자문그룹을 꾸린 계기도 발표문에 적혀 있습니다. 「A Severe Misalignment of AI in Mathematics」라는 공개 서한에서 수학자들이 난제 풀이를 새 AI의 성능 과시 수단으로 쓰는 데 따르는 부작용을 우려했고, 오픈AI는 이런 비판이 수학계와의 신중한 대화가 필요하다는 점을 보여 준다고 적었습니다. TechCrunch에 따르면 이 서한에는 필즈상 수상자 25명이 이름을 올렸습니다.
비슷한 우려는 나비에-스토크스 발표 때도 나왔습니다. 테렌스 타오는 9월 9일 좋은 미해결 문제가 재생되지 않는 자원처럼 채굴되고 있다며, 누군가 어떤 문제를 연구한다는 소문만으로도 그 문제를 밀어 버리는 막대한 AI 연산이 촉발될 수 있다고 적었습니다. 제이 커밍스는 증명을 대량으로 만들어 내는 시대를 이야기했습니다. 자문그룹은 이런 목소리에 대한 오픈AI의 응답입니다. 다만 발표문이 그어 둔 선대로, 그룹이 다룰 수 있는 것은 결과를 다루는 방식이고 결과를 내는 속도는 아닙니다.
국내 이용자에게 당장 달라지는 것은 없습니다. 성과를 낸 모델은 공개되지 않았고, 지금 쓸 수 있는 오픈AI 최신 모델은 9월 3일 나온 Astra입니다. 100건의 증명이 공개되지 않아, 국내 연구자가 내용을 확인하거나 후속 연구에 쓸 수 있는 단계도 아닙니다.
정작 남는 문제는 검토를 어떻게 하느냐입니다. AI가 만든 수학 결과가 빠르게 늘면 그것을 누가 어떤 기준으로 심사하고 어떻게 공개하느냐가 수학계 전체의 일이 됩니다. 오픈AI가 독립 그룹을 세운 것도 그래서이고, 국내 학회와 대학도 AI가 만든 증명을 심사 과정에 어떻게 받아들일지 같은 질문을 먼저 정리해 둘 수 있습니다.
다음에 확인할 것은 세 가지입니다. 나비에-스토크스 166쪽에 대한 외부 수학자들의 심사, 오픈AI가 100건의 문제 목록과 시도한 총수, 증명을 공개하는지, 그리고 자문그룹이 첫 조언을 어떤 형태로 내놓는지입니다. 오픈AI는 이 모델의 학습이 아직 끝나지 않았다고 밝혔습니다.
읽어 주셔서 고맙습니다.
초이 드림