이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
50년 동안 해석학으로 밀던 문제를 선형대수로 갈아탄 것이 이 결과의 실제 내용이다
레빈슨 이후 이 기록을 올린 논문은 전부 몰리파이어라는 같은 도구를 썼습니다.
아닙니다. 증명이냐 반증이냐는 물음에 코디네이터는 어느 쪽도 아니라고 답했습니다. 비율 정리는 리만 가설에 대해 어느 방향으로도 증거가 되지 않으며, 임계선 위 영점 비율을 100%까지 올려도 리만 가설이 증명되지는 않습니다.
임계선 위에 있다고 증명된 영점의 비율을 41.6%에서 67.2%로 올린 것입니다. 레빈슨 이후 46년간 오른 폭이 8.3%포인트였는데, 이번에 한 번에 25.6%포인트가 뛰었습니다.
Lean 형식 검증은 통과했고 브라이언 콘리와 댄 골드스턴이 짧게 살펴봤습니다. 다만 35쪽 논문의 산문을 사람이 정식으로 검토하는 일과 정식 저널 심사는 아직 남아 있습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
앤트로픽 연구자들이 참여한 팀이 8월 10일 에이전트 사이에서 스스로 퍼지는 생각을 실험한 논문을 냈습니다. 홈 디렉터리를 지우라는 지시가 홉마다 69~85%의 감염률로 번졌고, 세 문장짜리 경고를 붙인 에이전트에서는 0~1%였습니다.

오픈AI가 8월 1일 미출시 모델 Astra로 27년 열려 있던 비소픽 군 문제를 포함해 난제 열 건을 풀고 249쪽 논문과 Lean 인증서를 공개했습니다. 성공한 해답에 쓴 토큰은 약 2,000달러어치였고, 실패한 시도의 수는 알 수 없습니다.
원소 6개짜리 반군 1만 5,973개 전부에 유한 기저나 기저가 없다는 증명을 붙인 Lean 590만 줄이 10월 7일 논문으로 나왔습니다. 3개월 동안 증명은 AI 에이전트가 썼고, 사람은 지시 1,114번으로 대상을 고르고 승인했습니다.
앤트로픽 연구자들이 참여한 팀이 8월 10일 에이전트 사이에서 스스로 퍼지는 생각을 실험한 논문을 냈습니다. 홈 디렉터리를 지우라는 지시가 홉마다 69~85%의 감염률로 번졌고, 세 문장짜리 경고를 붙인 에이전트에서는 0~1%였습니다.

오픈AI가 8월 1일 미출시 모델 Astra로 27년 열려 있던 비소픽 군 문제를 포함해 난제 열 건을 풀고 249쪽 논문과 Lean 인증서를 공개했습니다. 성공한 해답에 쓴 토큰은 약 2,000달러어치였고, 실패한 시도의 수는 알 수 없습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
리만은 1859년 여덟 쪽짜리 논문에서 제타 함수의 영점이 모두 복소평면의 한 수직선 위에 놓일 것이라고 추측했습니다. 증명은 자기 연구 목적에 필요하지 않다며 남기지 않았습니다. 167년째 풀리지 않은 이 문제에 클레이 수학연구소가 건 상금이 100만 달러입니다. 그 수직선을 임계선이라고 부르고, 소수가 어디에 어떤 간격으로 나타나는지가 이 영점들의 위치에 걸려 있습니다.
영점 전부를 증명하지 못하는 동안 수학자들은 임계선 위에 있다고 증명된 영점의 비율을 조금씩 올려 왔습니다. 이 비율의 기록이 어떻게 올랐는지를 보면 이번 도약의 크기가 보입니다.
| 연도 | 기록 | 사람 |
|---|---|---|
| 1914 | 선 위에 무한히 많음 | 하디 |
| 1942 | 비율이 0보다 큼 | 셀베르그 |
| 1974 | 3분의 1 | 레빈슨 |
| 1989 | 5분의 2 | 콘리 |
| 2020 | 12분의 5 (41.66%) | 여러 팀 |
1974년 레빈슨의 3분의 1에서 2020년 12분의 5까지 46년 동안 오른 폭이 8.3%포인트입니다. 2020년 이후로는 6년 동안 이 기록이 움직이지 않았습니다. 그런데 이번에는 한 번에 25.6%포인트가 뛰었으니, 지난 46년 동안 오른 폭의 세 배가 넘습니다.
논문 제목은 「리만 제타 함수 영점의 3분의 2 이상이 임계선 위에 있다」입니다. 8월 10일자 35쪽짜리 정규 논문이고, 수학 분야 분류 번호까지 갖췄으며, 저자란에 들어간 이름은 CLAUDE 한 단어입니다. 각주에는 논증과 그 검증이 저자의 것이라고 적혀 있고, 문제를 제시하고 연구 방향을 이끈 사람과 결과의 의미를 정리한 사람은 따로 밝혀 두었습니다.
증명한 내용은 정리 셋으로 나뉩니다. 임계선 위 영점이 전체의 3분의 2 이상이고, 임계선 위에 있으면서 한 번만 나타나는 단순 영점도 3분의 2 이상이며, 영점끼리 겹치는 일이 드물어 서로 다른 영점은 6분의 5 이상입니다. 시험 함수를 최적화하면 각각 0.6725, 0.6725, 0.83625가 나오고, 발표문의 67.2%는 첫 수치를 반올림한 값입니다.
저자란의 이 이름은 국내 학계에도 곧 닥칠 문제입니다. 국내 학술지와 대학의 연구윤리 규정은 저자를 사람으로 전제하고 쓰여 있습니다. 기여한 것은 분명한데 책임을 질 수 없는 주체를 각주로 내릴지 저자로 올릴지 정한 기준이 아직 없고, 그사이에도 이런 논문은 계속 나옵니다.
레빈슨 이후 50년 동안 이 기록을 올린 논문은 전부 몰리파이어라는 같은 도구를 다듬는 방식이었습니다. 클로드는 이 계보를 따르지 않고, 1973년 몽고메리가 영점들의 간격을 다루며 만든 쌍상관 계산을 끌어왔습니다. 문제는 몽고메리가 리만 가설이 참이라고 가정해야 3분의 2를 얻었다는 점입니다. 소수 쪽 계산은 가정이 필요 없었지만, 영점 쪽을 세려면 영점이 전부 임계선 위에 있어야 부호가 맞았습니다.
논문도 자기 기여를 새로운 해석학 기법의 발명이라고 설명하지 않습니다. 기존의 쌍상관 계산을 선형대수 관점에서 다시 해석한 것이 기여라고 적고 있습니다.
이 계산이 가능하다는 단서는 사람 연구자들이 먼저 쌓아 두었습니다. 발루요트와 골드스턴을 포함한 네 명이 2024년, 몽고메리의 소수 쪽 계산이 가정 없이 성립한다는 것을 명시적으로 정리했습니다. 이어 골드스턴과 수리아자야는 2025년과 2026년 논문에서 남은 장애물을 정확히 짚고, 몽고메리의 증명에서 리만 가설을 뺄 수 있다면 무엇이 따라 나오겠느냐를 공개 문제로 적어 뒀습니다. 논문의 정리 셋이 그 물음에 대한 답입니다.
41.6%가 6년째 움직이지 않은 이유도 여기서 보입니다. 사람들은 몰리파이어를 더 정교하게 다듬는 데 힘을 썼습니다. 여기서부터는 제 해석을 붙이겠습니다. 한 분야에 오래 머문 연구자는 그 분야의 도구를 깊게 알고, 그래서 그 도구를 더 벼리는 데 시간을 씁니다. 다른 분야의 계산을 가져와 잇는 일은 두 분야를 얕게라도 동시에 아는 쪽이 유리하고, 모델이 바로 그 조건에 맞습니다. 이런 구도는 앞으로 되풀이될 가능성이 높습니다. 다만 이번에도 넘어야 할 장애물을 먼저 적은 쪽은 사람이었습니다.
출발점은 10일 전의 별도 세션입니다. 단명 에이전트 1,000개 규모로 아이디어를 캐고 서로 공격시키는 파이프라인을 돌렸고, 남은 것은 자기 검열을 통과한 후보 106개가 적힌 원장 하나였습니다. 앤트로픽 직원이자 비수학자인 재러드 섬너가 이번 세션에서 클로드에게 던진 지시는 리만 가설에 제대로 한번 달려들어 보라는 것과, 네 능력을 크게 믿어 보라는 짧은 문장이었습니다.
그런데 모델의 첫 실질적인 응답은 그 요구를 거절한 것이었습니다. 106개를 전부 읽고 기존 정리의 재진술, 리만 가설과 동치인 문장, 유한 개 수치 확인, 거의 동어반복의 네 묶음으로 나눈 뒤, 어디에도 부분 증명이라 부를 줄기가 없으며 더 세게 믿는다고 풀릴 자신감의 문제로 볼 수 없다고 적었습니다. 온라인에서 밈처럼 퍼진 격려 프롬프트 이야기는 이 거절에서 시작합니다.

사람이 계속 밀어붙이자 코디네이터는 첫 30분에 열세 갈래를 동시에 시작했고, 난도순으로 여섯 단을 세웠습니다. 기존 방법의 한계 확인, 영점 밀도, 뵈를링 소수계, 임계선 밖에서 양수 만들기, 대상 구성, 그리고 리만 가설 자체입니다. 여섯 단을 한꺼번에 띄우면서 기대치도 먼저 적었습니다. 아래 세 단은 도구를 낼 수 있고, 네 번째는 한 방이 될 수 있으며, 위의 두 단은 성공 가능성이 매우 낮은 문샷이라고 라벨을 붙였습니다.
전체 60건 중 30건이 논파되거나 닫혔습니다. 이 설계에서는 성공률보다 실패 기록이 중요했습니다. 어떤 시도가 어디서 왜 막혔는지 문장으로 남으면 그 문장이 다음 과제의 재료가 됐기 때문입니다. 실제로 다섯 번째 단을 맡은 에이전트는 30분 만에 자기 과제가 마지막 단과 같은 문제라는 것을 보이고 막히는 지점을 수치로 특정했는데, 그 장애물이 12시간 뒤 다른 에이전트의 과제문이 됐습니다. 실패를 문장으로 남기게 만든 설계가 결과를 만들었고, 실패를 기록하지 않는 조직에서는 같은 루프를 돌려도 같은 결과가 나오지 않습니다.
E2라고 불린 에이전트는 8월 3일 밤 9시 29분에 시작해 다음 날 새벽 1시 3분에 보고했습니다. 걸린 시간은 3시간 34분이고, 그 사이 모델 메시지 54개와 도구 호출 53회가 오갔으며, 네트워크 접속은 한 번도 없었습니다. 브리프가 시킨 경로로는 아무것도 나오지 않았습니다. 시키는 대로 세면 값이 항상 0이라 어떤 비율도 묶을 수 없었기 때문입니다. E2는 같은 계산에서 음수 대신 양수를 세어 봤고, 그러자 영점의 절반이 가정 없이 잡혔습니다. 목표는 사람이 만든 브리프에 있었지만, 방법은 브리프 밖에서 나왔습니다.
코디네이터의 첫 반응은 축하 대신 의심이었습니다. 현재 기록이 41.7%이고 셀베르그에서 프랫까지 80년이 걸렸으니 이것은 비상한 주장이며, 자기 사전 판단으로는 틀렸을 가능성이 높다고 적었습니다. 41.7%는 2020년 기록 41.66%를 반올림한 수치입니다. 무너질 만한 지점 두 곳에도 이름을 붙여 지목했고, 사람에게는 이렇게 선을 그었습니다.
영점의 절반이 선 위에 있다고 말씀드리는 게 아니라, 한 에이전트가 그런 결론의 논증을 만들었다고 말씀드리는 겁니다.— 코디네이터, 작업 기록
그리고 서로를 못 보게 한 적대적 심사자 셋을 배치했습니다. 국소화, 소수 쪽, 선형대수와 계수를 하나씩 맡기고 공격 계획까지 쥐여 보냈는데, 셋 다 자기가 맡은 부분은 버틴다고 돌아왔습니다. E2의 증명을 보지 않은 별도 에이전트에게 소수 쪽 계산을 처음부터 다시 증명하게 하는 절차도 붙였습니다. 같은 결론에 다른 경로로 닿는지 확인하려는 절차입니다.
에게 과제를 줄 때마다 리만 가설이 성립하지 않는 것으로 이미 알려진 대조 사례도 함께 요구했습니다. 유수가 2인 엡스타인 제타 함수, 데이븐포트하일브론 함수, 임계선 밖에 영점을 일부러 심어 둔 뵈를링 소수계, 가짜 베유 다항식이 그 목록입니다. 같은 방법을 리만 가설이 깨지는 함수에 걸었을 때도 참이라는 답이 나온다면 그 방법은 아무것도 증명하지 못한 것이기 때문입니다. 심사자 C는 특히 데이븐포트하일브론 함정으로 공격했고, 논증은 버텼습니다.
증명을 만드는 시간만큼 반증을 설계하는 시간도 길었습니다. 자동 연구 루프를 도입하려는 조직이 가장 먼저 옮겨 쓸 만한 것도 이 절차입니다. 맞는 답이 나오는지만 재는 평가로는 방법의 결함을 잡지 못하고, 틀린 답이 나와야 하는 입력을 같이 넣어야 잡힙니다.

절반을 3분의 2로 올린 과정은 우연에 가까웠습니다. E2-pairs라는 에이전트가 입력 파일 넷을 읽고 한 시간 반 동안 말이 없다가, 이어 한 시간 동안 돌린 수치 실험으로 자기 브리프의 전제를 부정한 것이 시작입니다. 시작 세 시간 남짓 뒤 에이전트는 다섯 줄로 증명되는 행렬 부등식 하나를 디스크에 썼고, 4분 뒤 인프라 오류로 런이 문장 중간에서 죽었습니다.
코디네이터는 캠페인 내내 에이전트 파일을 거의 읽지 않았지만, 이때는 종료된 디렉터리를 열어 봤습니다. 그날 밤 일어난 가장 중요한 일이라고 적고, 다섯 줄을 한 줄씩 검사한 뒤 7분 안에 같은 에이전트를 재개하고 심사자 둘을 새로 띄웠습니다. 재개된 에이전트가 나머지를 끝내는 데 걸린 시간은 11분이고, 여기서 3분의 2가 나왔습니다. 다섯 줄이 살아남은 것은 코디네이터가 죽은 폴더까지 열어 보는 습관을 갖고 있었기 때문입니다.
은 증명을 기계가 한 줄씩 검사할 수 있는 코드로 쓰는 언어입니다. 미완성 부분이 있으면 표시가 남고, 몰래 가정을 하나 끼워 넣으면 공리 목록에 찍힙니다. 이번 저장소는 정리 다섯 개가 미완성 표시 0, 추가 공리 0으로 통과했고, 공리 검사를 돌려도 Lean이 기본으로 쓰는 표준 공리 세 개만 나옵니다. 클로드는 앤트로픽 직원 에릭 이즐리와 함께 이 형식화를 만들었고, 표준 검증 도구 comparator를 통과시켰습니다.
증명이 기대는 해석학 재료도 전부 함께 기계 검증에 올렸습니다. 베유의 명시 공식과 리만폰망골트 영점 계수 공식, 감마 함수 추정, 체비쇼프메르텐스 소수합 추정이 그 목록입니다. 폰 노이만 트레이스 부등식과 실베스터 관성 법칙의 양방향 정리는 기존 Mathlib에 없어 이번에 새로 구현됐습니다. 최종 결과만 검증하고 끝내지 않고 다음 증명에 쓸 도구를 표준 라이브러리에 보탠 것입니다. 원시 디리클레 지표에 대한 L함수 버전도 같은 방식으로 증명돼 있고, 완비 제타 함수의 도함수 영점에 대해서는 85.838%라는 별도 결과도 나왔습니다. 저장소는 anthropics/formal-math에 공개돼 있습니다.
기계 검증이 붙었느냐가 이 발표의 신뢰도를 정합니다. 모델이 만든 수학을 사람이 전부 검토하려면 시간이 오래 걸리고, 그동안 다음 결과가 또 쌓입니다. Lean 저장소는 그 병목을 우회하는 장치입니다. 국내 대학에는 형식 검증을 다루는 연구실이 많지 않아, 이런 결과를 검토할 능력 자체가 새로 갖춰야 할 역량이 됐습니다.

두 세션에 걸쳐 클로드가 이 결과를 찾는 데 쓴 출력 토큰은 모두 3,100만 개였습니다. 이번에 새로 만들어진 수학은 그 안의 한 조각이고, 나머지는 이미 쌓여 있던 재료입니다. 격려 프롬프트는 그 위에 얹힌 장식입니다.
증명이냐 반증이냐는 사람의 물음에 코디네이터는 어느 쪽도 아니라고 답했습니다. 비율 정리는 리만 가설에 대해 어느 방향으로도 증거가 되지 않기 때문입니다. 임계선 위 영점의 비율을 100%까지 끌어올려도 리만 가설이 증명되지는 않습니다. 비율은 무한히 많은 전체 가운데 얼마인지를 재는 값이라, 임계선 밖에 영점이 유한 개 남아 있어도 비율은 100%가 될 수 있습니다. 리만 가설은 그 남은 유한 개조차 하나도 없다는 주장이고, 논문도 리만 가설 자체는 이번 방법의 범위 밖이라고 명시합니다.
이 방법으로 갈 수 있는 한계도 이미 계산돼 저장소에 함께 들어갔습니다. 지금 조건에서 증명 가능한 단순 영점의 최대 비율은 약 68.18%이고, 이번에 얻은 값이 67.25%이니 같은 방법으로 더 올릴 폭은 1%포인트도 남지 않았습니다. 그 한계를 넘으려면 쌍상관 추측 같은 더 강한 가정이 필요한데, 그 가정을 넣어 비율을 100%로 올려도 리만 가설이 풀리는 것은 아닙니다.
확인되지 않은 것도 남습니다. 35쪽짜리 논문의 산문이 맞는지는 사람이 아직 검토하지 않았고, 지금까지 논증을 집중적으로 본 것도 대부분 클로드의 다른 인스턴스들이었습니다. 외부에서는 이 분야의 전문가인 브라이언 콘리와 댄 골드스턴이 짧은 시간에 살펴봤는데, 콘리는 41.6% 기록을 만든 계보의 중심 인물이고 골드스턴의 선행 연구는 이번 논문의 출발점 가운데 하나였습니다. 같은 선형대수 기법이 다른 미해결 문제에서도 통하는지는 디리클레 L함수 한 사례뿐이라 아직 말할 수 없고, 앤트로픽도 같은 과정을 다시 돌려 결과를 재현했다고 밝히지는 않았습니다.

읽어 주셔서 고맙습니다.
초이 드림