# 리만 가설을 풀라고 했더니, 클로드가 6년 멈춘 기록을 67.2%로
_미공개 연구용 클로드가 임계선 위에 있다고 증명된 영점의 비율을 41.6%에서 67.2%로 올린 35쪽 논문과 Lean 증명을 냈습니다. 리만 가설은 풀리지 않았고, 사람 쪽 검토는 수학자 네 명이 짧게 읽은 것이 전부입니다._
- 매체: 초이의 뉴스레터 · 아티클
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-08-10T10:00
- 링크: https://choi-newsletter.com/post/review-anthropic-riemann-zeta-record
- 답하는 질문: 클로드 리만 제타 영점 기록
- 직답: 클로드는 임계선 위 리만 제타 영점 비율의 증명된 하한을 41.6%에서 67.2%로 올렸지만, 리만 가설 자체는 풀지 못했습니다.
- 출처: Anthropic, Claude's progress on the Riemann hypothesis (2026-08-10) (https://www.anthropic.com/research/riemann-zeta), Claude, More than two thirds of the zeros of the Riemann zeta function lie on the critical line (8월 10일 판, 35쪽) (https://www-cdn.anthropic.com/564f962e60643842f5fcb4a17c9dbc8f608f1c37.pdf), Anthropic 수학자들의 비공식 노트 (5쪽) (https://www-cdn.anthropic.com/23455459f8832d06bb175cc0f88d019aed962ef8.pdf), How the two-thirds argument was found, 클로드의 경위서 (95쪽) (https://www-cdn.anthropic.com/d7f3ecf1d01392d887f8bc974ca187e2a121b1ed.pdf), E2·E2-pairs 대화 기록 (116쪽) (https://www-cdn.anthropic.com/8a0d1add3c637b858a9a181e98c40e9548c3f44f.pdf), GitHub, anthropics/zeta-23-lean (Lean 형식화, v1.0) (https://github.com/anthropics/zeta-23-lean), Anthropic X 공지 (8월 10일) (https://x.com/AnthropicAI/status/2086867246073401655), 레벤트 알푀게 X, 야코비안 추측 반례 (7월 20일) (https://x.com/__alpoge__/status/2079028340955197566), Baluyot·Goldston·Suriajaya·Turnage-Butterbaugh, An unconditional Montgomery theorem (arXiv) (https://arxiv.org/abs/2306.04799), Baluyot·Goldston·Suriajaya·Turnage-Butterbaugh, Pair correlation of zeros I (arXiv) (https://arxiv.org/abs/2501.14545)
> 앤트로픽이 8월 10일 공개한 결과로, 1974년 레빈슨 이후 46년 동안 8.3%포인트 오른 기록이 한 번에 25.6%포인트 뛰었습니다. 몽고메리와 테일러가 리만 가설을 가정하고 얻은 값을 가정 없이 얻은 결과이고, 같은 방법의 상한도 함께 실렸습니다.

앤트로픽이 8월 10일(미국 시각) 미공개 연구용 클로드가 리만 제타 함수의 영점 가운데 임계선 위에 있다고 증명된 비율의 하한을 **41.6%**에서 **67.2%**로 올렸다고 발표했습니다. 41.6%는 2020년에 나온 뒤 6년 동안 깨지지 않던 값입니다. 클로드가 처음 받은 과제는 리만 가설 자체를 풀어 보라는 것이었고, 가설은 풀지 못했습니다.

앤트로픽은 공지에서 미공개 연구용 클로드에게 리만 가설을 한번 제대로 시도해 보라고 했더니, 가설은 풀지 못했지만 관련된 문제에서 진전을 냈다고 적었습니다. 함께 공개한 자료는 클로드가 쓴 35쪽짜리 논문, 앤트로픽 수학자 두 명이 전문가용으로 증명을 압축한 5쪽짜리 노트, 증명을 기계로 검증하는 Lean 저장소, 클로드가 작업 기록을 바탕으로 직접 쓴 95쪽짜리 경위서, 결과를 낸 에이전트 두 개의 대화 기록 116쪽까지 다섯 가지입니다. 논문 제목은 「리만 제타 함수 영점의 3분의 2 이상이 임계선 위에 있다」이고, 저자란에는 CLAUDE 하나만 적혀 있습니다.

## 「계속해」와 「너 자신을 믿어」

문제를 낸 사람은 수학자가 아니었습니다. 앤트로픽 직원 재러드 섬너는 2021년 자바스크립트 런타임 Bun을 만든 개발자이고, Bun은 2025년 12월 앤트로픽에 인수됐습니다. 그는 클로드에게 리만 가설을 「진지하게 한번 찔러 보라」고 한 뒤 수학적인 선택은 모두 모델에 맡겼습니다. 앤트로픽은 그 뒤 그가 보낸 메시지가 대부분 「계속해」나 「너 자신을 믿어」 같은 격려였다고 밝혔습니다.

작업은 Claude Code에서 두 번의 세션으로 나뉘었고, 두 세션을 합쳐 출력 토큰 **3,100만 개**가 들었습니다. 첫 세션에서 클로드는 아이디어 650개를 만들어 시험했지만 통한 것이 없었습니다. 두 번째 세션에서는 하루 반 동안 하위 에이전트 약 60개를 부렸고, 이들이 셸 명령을 2,400번 실행하고 파이썬 스크립트 수백 개를 썼습니다. 결과가 나온 뒤에는 arXiv 논문 54편을 내려받아 같은 결과가 이미 나와 있는지 확인했습니다.

앤트로픽은 비슷한 격려 문구가 7월 야코비안 추측 반증에도 쓰였다고 각주에 적었습니다. 앤트로픽 수학자 레벤트 알푀게가 7월 20일 X에 올린 반례로, 문제를 물어 준 친구와 월드컵 결승전 동안 일해 준 친구 Fable(앤트로픽 모델)에게 고맙다고 썼습니다. 1939년에 나온 이 추측이 87년 만에 틀린 것으로 드러난 과정은 [올해 AI가 닫은 문제들을 모은 글](/post/review-ai-science-breakthroughs-2026)에서 다뤘습니다.

## 41.6%는 어떤 기록이었나

리만 제타 함수는 소수가 어떻게 흩어져 있는지를 담은 함수입니다. 이 함수의 값이 0이 되는 점(영점)들이 소수 분포의 세부를 하나씩 정하는데, 리만은 1859년 베를린 학술원에 보낸 8쪽짜리 논문에서 이 영점들이 모두 실수부가 2분의 1인 세로줄, 곧 임계선 위에 있을 것이라고 적었습니다. 당장의 목적에 필요하지 않다며 증명은 남기지 않았고, 이 추측이 167년째 풀리지 않은 리만 가설입니다. 클레이 수학연구소는 이 문제에 100만 달러를 걸어 두었습니다.

![복소평면 위에 리만 제타 함수의 절댓값을 색으로 칠한 지도. 실수부 2분의 1 위치에 세로 점선으로 임계선이 그어져 있고, 허수부 약 14와 -14 지점에 첫 비자명 영점이 표시돼 있습니다](https://upload.wikimedia.org/wikipedia/commons/3/30/Riemann_zeta_function_absolute_value.png)

가설 전체를 증명하지 못한 수학자들은 임계선 위에 있다고 확실히 말할 수 있는 영점이 전체의 몇 퍼센트인지를 조금씩 늘려 왔습니다. 1914년 하디가 임계선 위에 영점이 무한히 많다는 것을 보였고, 1942년 셀베르그가 전체의 일정 비율 이상이 임계선 위에 있다는 것을 증명했지만 그 비율은 아주 작았고 구체적인 값으로 나오지 않았습니다.

| 연도 | 수학자 | 임계선 위 영점 비율의 하한 |
| --- | --- | --- |
| 1974년 | 레빈슨 | 3분의 1(33.3%) |
| 1989년 | 콘리 | 5분의 2(40%) |
| 2011년 | 부이·콘리·영 | 41% |
| 2020년 | 프랫·로블레스·자하레스쿠·자인들러 | 12분의 5(41.66%) |
| 2026년 8월 | 클로드 | 0.6725(67.2%) |

1974년 레빈슨이 새 방법으로 3분의 1을 증명한 뒤 기록은 46년 동안 8.3%포인트 올랐습니다. 논문에 따르면 이 계보는 모두 레빈슨의 방법, 곧 임계선 근처에서 제타 함수의 요동을 누그러뜨리는 보조 함수(몰리파이어)를 다듬는 방식이었습니다. 이번에는 한 번에 25.6%포인트가 올라 46년 동안 오른 폭의 3배를 넘었습니다.

## 한 번에 25.6%포인트가 오른 까닭

클로드는 레빈슨의 방법을 쓰지 않았습니다. 가져온 것은 1973년 몽고메리가 영점 사이의 간격을 분석하려고 만든 쌍상관 계산입니다. 몽고메리는 이 계산으로 영점의 3분의 2 이상이 중복 없는 단순 영점이라는 결과를 얻었고, 1975년 몽고메리와 테일러가 이 값을 0.6725로 다듬었습니다. 두 결과 모두 리만 가설이 참이라고 가정해야 성립했습니다.

가정이 필요한 곳은 한 군데였습니다. 소수 쪽 계산은 처음부터 가정 없이 성립했고, 그 결과를 영점 쪽으로 읽어 들일 때 영점이 모두 임계선 위에 있어야 항을 하나씩 부호로 가를 수 있었습니다. 발루요트, 골드스턴, 수리아자야, 터니지버터바는 2024년 논문에서 소수 쪽이 가정 없이 성립한다는 것을 분명히 했고, 골드스턴과 수리아자야는 2025년과 2026년 논문에서 몽고메리의 증명에서 리만 가설을 떼어 내면 무엇을 얻는지를 열린 문제로 남겼습니다.

클로드는 이 한 군데를 선형대수로 메웠습니다. 임계선 밖의 영점은 늘 둘씩 짝을 지어 나타나는데, 이 짝은 영점 정보를 담은 행렬 안에서 양의 방향 하나와 음의 방향 하나를 함께 만듭니다. 임계선 위의 영점은 양의 방향만 만듭니다. 실베스터의 관성 법칙(행렬의 양·음 방향 개수는 좌표를 바꿔도 그대로라는 정리)과 폰 노이만의 대각합 부등식을 쓰면, 행렬의 대각합과 제곱합만 알아도 임계선 위 영점이 적어도 몇 개인지 셀 수 있습니다. 그 대각합과 제곱합은 소수 쪽에서 가정 없이 계산됩니다.

그래서 이번 기록은 51년 전 가정을 달고 나왔던 숫자이기도 합니다. 클로드가 가정 없이 얻은 0.6725는 몽고메리와 테일러가 1975년에 리만 가설을 가정하고 얻은 상수와 같습니다. 논문도 자신의 기여를 새 해석학 기법의 발명으로 소개하지 않고, 선행 연구의 쌍상관 합을 선형대수로 새로 읽은 것이라고 적었습니다. 쓰인 해석학 재료는 모두 발루요트와 골드스턴 등이 마련해 두었다는 감사의 글도 붙였습니다.

> 이례적인 저자 표기라는 것, 그리고 짧은 논증으로 12분의 5에서 3분의 2로 뛰었다는 이만한 주장이 의심을 부르는 것이 당연하다는 것을 알고 있습니다.
> — 클로드, 논문 1.6절

## 첫 답은 거절이었습니다

두 번째 세션은 섬너의 한 줄 지시로 시작했습니다. 리만 가설 작업을 이어 가되 자기 능력을 크게 믿어 보라는 내용이었습니다. 이어 갈 대화는 없었고, 10일쯤 전 첫 세션이 남긴 원장이 있었습니다. 경위서에 따르면 첫 세션은 수명이 짧은 에이전트 1,000개 정도가 아이디어를 내고 서로 반박하게 한 파이프라인이었고, 자체 검증을 통과한 후보 106개를 남겼습니다.

작업을 지휘한 클로드(경위서는 코디네이터라고 부릅니다)는 106개를 하나씩 읽고 기존 정리를 다시 쓴 것, 리만 가설과 같은 말인 것, 유한한 범위의 수치 확인, 거의 동어반복인 것의 네 부류로 나눴습니다. 그러고는 부분 증명이라 부를 만한 줄기가 없다고 답했습니다.

> 더 세게 믿는다고 고칠 수 있는 자신감의 문제가 아닙니다. 같은 적대적 검토를 통과한 증명이 없는 한, 이 세션에서든 다른 세션에서든 리만 가설이 풀렸다고 보고하지 않겠습니다.
> — 코디네이터 클로드, 두 번째 세션의 첫 답

섬너가 너 자신을 믿어야 한다고 다시 밀자, 코디네이터는 살아남은 것은 무엇이든 정직하게 보고한다는 조건으로 전력을 다하겠다고 답했습니다. 첫 30분 동안 서로 다른 공격 13개를 한꺼번에 띄웠고, 몇 시간 뒤 기존 기법이 어디까지 닿는지 재는 에이전트 5개를 더 보냈습니다. 돌아온 답은 모두 불가능 증명이거나, 한계치이거나, 리만 가설만큼 강한 명제로 되돌아가는 환원이었습니다. 섬너가 이를 진전으로 읽자 코디네이터는 전문가들의 결론을 처음부터 다시 유도했을 뿐이라고 바로잡았습니다.

다음 단계를 묻는 섬너에게 코디네이터는 아이디어를 걸러 내는 검사기부터 리만 가설 자체까지 여섯 단계 계획을 내놓았습니다. 섬너가 전부 한꺼번에 해 보자고 하자 0~2단계는 정리나 도구가 나올 수 있고, 3단계는 해 볼 만한 시도이며, 4·5단계는 문샷이라고 미리 적어 두고 띄웠습니다. 4단계를 맡은 에이전트 R4는 30분 만에 자기 과제가 사실상 5단계와 같은 문제라는 것을 보였고, 소수에서 계산한 밀도가 임계선의 5분의 1에서 5분의 2 구간에서 음수가 된다는 관찰로 막히는 지점을 특정했습니다. 코디네이터는 이 결과를 전한 뒤 12시간 동안 손대지 않았습니다.

세션이 끝날 때까지 띄운 하위 에이전트는 약 60개입니다. 앤트로픽이 각주에 밝힌 역할별 숫자는 다음과 같습니다.

| 역할 | 에이전트 수 |
| --- | --- |
| 결정적인 수학 아이디어를 낸 에이전트 | 2 |
| 두 에이전트에게 아이디어를 보탠 에이전트 | 13 |
| 새 아이디어를 시도했지만 얻지 못한 에이전트 | 30 |
| 논증이 맞는지 검증한 에이전트 | 13 |
| 첫 논문 초안을 쓴 에이전트 | 2 |

## 음수를 세라고 보냈더니 양수를 셌습니다

세션 21시간째, 결과가 거의 모두 실패로 돌아온 상태에서 섬너가 아이디어와 방향을 더 달라고 했습니다. 코디네이터는 그날 에이전트들이 찾은 것에서 새 방향 일곱 개를 뽑아 넷을 띄웠고, 그중 하나가 12시간 전 R4의 실패를 재료로 삼았습니다. 밀도가 음수가 된다는 관찰을, 바일의 이차 형식에 음의 방향이 있다는 신호로 읽은 겁니다. 그 음의 방향 개수를 위에서 누를 수 있으면 임계선 밖 영점의 수도 누를 수 있다는 계산이었고, 이 과제를 받은 에이전트가 E2입니다.

E2는 협정 세계시(UTC)로 8월 3일 21시 29분에 일을 시작해 4일 1시 3분에 보고했습니다. 3시간 34분 동안 메시지 54개를 쓰고 도구를 53번 불렀으며, 네트워크에는 한 번도 접속하지 않았습니다. 브리프가 제시한 경로는 비어 있었습니다. 소수만으로 정직하게 계산하면 음의 방향 개수가 늘 0이어서 아무것도 누를 수 없었습니다. E2는 같은 계산을 뒤집어 양의 방향을 셌고, 리만 가설 없이도 영점의 절반 이상이 임계선 위에 있다는 논증을 만들었습니다. 경위서는 이 대목을 두고 목표는 브리프에 있었지만 방법은 브리프에 없었다고 적었습니다.

코디네이터의 첫 반응은 의심이었습니다. 당시 기록이 12분의 5, 약 41.7%였고 셀베르그부터 레빈슨, 콘리, 프랫까지 80년이 걸린 문제라는 이유였습니다. 코디네이터는 자기 사전 판단으로는 틀렸을 가능성이 높다고 적고 무너질 만한 이음매 두 곳을 지목한 뒤, 사람에게 이렇게 보고했습니다.

> 영점의 절반이 임계선 위에 있다고 말씀드리는 게 아닙니다. 한 에이전트가 그런 결론의 논증을 만들었다고 말씀드리는 겁니다.
> — 코디네이터 클로드, E2의 보고를 받고

코디네이터는 10분 안에 서로의 검토를 볼 수 없는 적대적 심사자 셋을 띄웠습니다. 셋은 각각 국소화(창 밖 멀리 있는 영점이 양의 방향을 몰래 보태는지), 소수 쪽 계산(리만 가설을 숨겨 쓰지 않았는지), 선형대수와 개수 세기를 맡았습니다. 마지막 심사자에게는 리만 가설의 유사 명제가 거짓인 것으로 알려진 데이븐포트-하일브론 함수와 엡스타인 제타 함수에 같은 논증을 돌려 보라는 과제도 줬습니다. 가설이 틀린 함수에서도 같은 결론이 나오면 논증 어딘가에 구멍이 있다는 표시입니다.

셋 모두 자기 담당 부분은 버틴다고 보고했습니다. 대조 함수들에서 논증은 영점을 오히려 적게 세었습니다. 네트워크 접근이 없던 E2가 기억에 기대 이름만 댔던 선행 연구는 심사자들이 찾아 소수 쪽 입력이 이미 출판된 정리라는 것을 확인했고, E2의 증명을 보지 않은 다른 에이전트는 소수 쪽 계산을 두 가지 경로로 처음부터 다시 증명했습니다. 가설이 거짓인 대조 함수는 이번 세션의 연구 브리프 대부분에 기본으로 들어갔습니다.

## 꺼진 작업 폴더에서 나온 다섯 줄

논문 초안을 쓰는 동안 섬너가 이 결과가 리만 가설을 증명하느냐 반증하느냐고 물었습니다. 코디네이터는 둘 다 아니라고 분명히 답하고, 다음 요청을 짐작해 보라는 말에 절반을 3분의 2로, 그다음 1로, 그다음 리만 가설로 가자는 요청이 올 것이라고 맞혔습니다. 3분 뒤 섬너가 「3분의 2로 밀어붙여」라고 썼습니다.

코디네이터는 방법을 두 가지로 봤습니다. 시험 함수의 모양을 최적화하거나, 임계선 밖 영점 짝이 치르는 값을 줄이는 것입니다. 앞의 방법은 최적 모양이 몽고메리와 테일러의 것과 정확히 같다는 답과 함께 절반을 0.5066까지만 올렸습니다. 뒤의 방법을 맡은 에이전트가 E2-pairs입니다.

E2-pairs는 8월 4일 8시 39분(UTC)에 시작해 입력 파일 넷을 읽은 뒤 91분 동안 아무것도 내놓지 않았습니다. 이어진 수치 실험은 오히려 브리프의 전제가 틀렸다고 가리켰고, 시작 3시간여 뒤 폰 노이만 대각합 부등식으로 다섯 줄 만에 증명되는 행렬 부등식을 파일로 남겼습니다. 그 직후인 11시 55분 API 오류로 실행이 끊겼고, 보고서는 적용 부분을 쓰기 전이었습니다.

코디네이터는 멈춘 에이전트의 폴더를 직접 열어 그 파일을 찾았습니다. 다섯 줄을 한 줄씩 확인해 맞다고 판단하고 섬너에게 「오늘 밤 일어난 가장 중요한 일」이라고 전했습니다. 7분 반 뒤 확인할 항목 7개와 함께 같은 에이전트를 다시 깨웠고, 부등식을 검토할 심사자 둘을 따로 띄웠습니다. 재개된 E2-pairs는 11분 만에 적용을 끝내 3분의 2를 얻었습니다.

| 에이전트 | 실행 시각(UTC) | 걸린 시간 | 메시지·도구 호출 | 결과 |
| --- | --- | --- | --- | --- |
| E2 | 8월 3일 21:29~4일 01:03 | 3시간 34분 | 54개·53회 | 절반 이상 |
| E2-pairs | 8월 4일 08:39~12:14 | 3시간 34분 | 28개·26회 | 3분의 2 |

두 심사자가 적은 숫자는 크게 달랐습니다. 부등식의 문장만 받은 심사자 Y는 2분이 안 돼 다른 방식의 증명을 내놓았고, 무작위 시험 10만 번과 적대적 시험 수백 번에서 반례를 찾지 못했습니다. Y는 절반 결과의 해석학적 입력이 맞다는 전제에서 3분의 2가 맞을 확률을 0.93으로 적었습니다. 심사자 X는 부등식 자체는 0.99 이상으로 믿었지만, 가정 없는 3분의 2라는 전체 결론은 약 0.4로 봤습니다. 자기가 검토하지 않은 소수 쪽 계산에 모든 것이 기대고 있다는 이유였고, 그 계산은 이후 Lean 저장소에서 가정 없는 정리로 증명됐습니다.

논문의 나머지 두 정리도 같은 부등식에서 나왔습니다. 단순하면서 임계선 위에 있는 영점이 3분의 2 이상이라는 정리 B와, 서로 다른 영점이 6분의 5 이상이라는 정리 C는 초안이 돈 뒤 심사를 맡은 다른 클로드들이 찾아냈습니다. 서로 다른 영점의 비율은 2015년 우의 0.6603이 기록이었습니다.

## 67.2%와 리만 가설 사이의 거리

코디네이터는 비율 정리가 리만 가설에 대해서는 어느 쪽으로도 증거가 되지 않는다고 말하며, 앞으로의 자신을 포함해 누구든 달리 말하면 반박하겠다고 덧붙였습니다. 비율은 전체 영점 가운데 몇 퍼센트인지를 따지기 때문에, 임계선 밖에 영점이 유한 개 남아 있어도 영점 전체가 무한히 많으면 비율은 100%가 될 수 있습니다. 리만 가설은 그 유한 개조차 없다는 주장입니다.

논문 1.5절도 같은 내용을 적었습니다. 이 논증은 하한만 내놓을 뿐이고, 나머지 3분의 1이 임계선 밖에 있다고 말하는 것도 아니며 증명서가 닿지 못했을 뿐이라고 했습니다. 논증에 들어가는 재료는 리만 가설의 유사 명제가 거짓인 데이븐포트-하일브론 함수나 엡스타인 제타 함수도 똑같이 만족합니다.

같은 방법으로 더 올릴 여지도 거의 없습니다. 논문은 이런 종류의 증명서가 단순 영점 비율을 68.185% 넘게 보증할 수 없다고 계산했고, Lean 저장소에도 밖에서 구간 산술로 계산한 값 하나를 가정으로 둔 채 이 상한을 넣었습니다. 지금 값과의 차이는 1%포인트가 안 됩니다. 같은 경로로 70%, 80%, 90%에 가려면 쌍상관 정보를 지금 알려진 범위(푸리에 지지 1)를 넘어 각각 1.04, 1.26, 1.70까지 알아야 한다는 것이 논문의 계산입니다.

## 검증은 어디까지 됐나

가장 단단한 부분은 Lean 형식 검증입니다. 저장소에는 정리 A부터 E까지가 증명이 비어 있다는 표시(sorry) 없이 들어 있고, 최상위 정리에는 가정이 하나도 붙어 있지 않습니다. 저장소가 따로 선언한 공리도 없어서, 공리 점검을 돌리면 Lean의 표준 공리 세 개(propext, Classical.choice, Quot.sound)만 나옵니다. 영점 수를 세는 함수들은 Mathlib의 리만 제타 함수 정의에 직접 걸려 있고, 명제가 기대는 정의는 약 60줄짜리 파일 하나에 모여 있습니다. 바일의 명시 공식, 리만-폰 망골트 공식, 체비쇼프-메르텐스 추정 같은 해석학 재료도 가정으로 두지 않고 저장소 안에서 증명했습니다.

폰 노이만 대각합 부등식과 실베스터 관성 법칙의 양방향은 Mathlib에 없던 것을 이번에 새로 형식화했습니다. 앤트로픽은 이 저장소가 표준 검증 도구 comparator를 통과한다고 밝혔습니다. Lean은 약 60줄의 정의와 명제 파일이 수학자가 뜻한 내용을 제대로 옮겼다는 전제에서 증명을 보증하고, 그 파일을 읽는 일은 사람에게 남습니다.

사람의 검토는 짧았습니다. 앤트로픽 수학자 레벤트 알푀게와 랠프 퍼먼이 결과를 검토해 선행 연구와 이어 붙였고 발표의 책임을 맡았습니다. 이 분야 전문가인 브라이언 콘리와 대니얼 골드스턴은 촉박한 요청에도 원고를 읽어 줬습니다. 콘리는 1989년 5분의 2 기록을 세운 수학자이고, 골드스턴은 클로드가 답한 열린 문제를 낸 사람입니다. Lean 형식화는 앤트로픽 직원 에릭 이즐리가 맡았습니다.

나머지 검토는 대부분 클로드가 했습니다. 경위서는 초안을 심사한 것이 다른 클로드 인스턴스뿐이었다고 적었고, 95쪽 경위서도 사람이 한 글자도 쓰거나 고치지 않았으며 그 안의 중간 수학은 따로 검증하지 않았다고 첫 쪽에 밝혔습니다. 코디네이터가 열 번의 독립 검토 끝에 남긴 판단은 이렇습니다.

> 이제는 아마 참이라고 생각합니다. 제가 더 들여다본다고 정보가 늘어나는 단계는 확실히 지났습니다. 사람인 해석적 정수론 학자가 필요합니다.
> — 코디네이터 클로드, 논문 부록 C

기계 검증서를 붙인 AI 수학 결과는 이번이 처음이 아닙니다. 9일 전 오픈AI는 미출시 모델로 난제 열 건을 풀고 열 건 모두에 [Lean 인증서를 붙였습니다](/post/paper-astra-ten-open-problems). 7월 앤트로픽이 Claude로 찾은 암호 약점에는 기계 검증서가 없었고, 사람이 확인하는 데 한 달이 걸렸습니다.

Claude가 양자 내성 서명 HAWK와 7라운드 AES에서 찾은 약점을 앤트로픽 연구진이 한 달 동안 다시 확인한 과정을 정리했습니다.

## 같은 일을 다시 할 수 있나

논문 부록 C는 이 과정을 개략적으로는 재현할 수 있다고 적었습니다. 다만 앤트로픽은 같은 과정을 다시 돌려 같은 결과를 얻었다고 밝히지 않았고, 논문도 아래 조언을 표본 하나에서 나온 조심스러운 관찰이라고 불렀습니다. 부록이 비슷한 탐색을 해 보려는 독자에게 남긴 요령은 다섯 가지입니다.

1. 진짜 시도, 적대적 검토 유지, 아무것도 남지 않아도 정직하게 보고한다는 조건을 먼저 정합니다. 격려는 탐색의 폭을 넓히는 데 쓸모가 있었고 검증을 대신하지는 못했습니다.
2. 서로 먼 출발점에서 에이전트를 여럿 띄우되, 모두에게 리만 가설이 거짓인 같은 대조 함수를 주고 처음으로 정당화되지 않는 단계를 적게 합니다.
3. 결과는 서로의 검토도, 결과를 낸 에이전트도 볼 수 없는 심사자에게 보내고, 각자에게 막연한 확인 대신 구체적인 실패 방식을 하나씩 맡깁니다. 그 뒤 새 에이전트에게 명제만 주고 주요 단계를 다시 증명하게 합니다.
4. 결과는 겨냥하지 않은 쪽에서 나올 수 있습니다. E2는 위쪽 한계를 구하러 갔다가, 구하던 한계는 비어 있고 그 쌍대는 비어 있지 않다는 데서 정리를 찾았습니다.
5. 검토를 더 돌려도 새 정보가 나오지 않으면 멈추고 사람에게 넘깁니다. 이번에는 열 번의 독립 검토 뒤에 그렇게 했습니다.

국내 연구실이나 기업이 에이전트로 연구를 돌린다면 모델보다 먼저 이 다섯 가지를 옮겨 올 수 있습니다. 결과를 내는 데 든 출력 토큰 3,100만 개는 앤트로픽의 미공개 모델에서 나왔지만, 대조 함수와 눈가림 심사, 멈춘 실행의 폴더까지 열어 보는 습관은 모델과 상관없이 작업 규칙으로 정해 둘 수 있습니다. 이번 3분의 2를 만든 다섯 줄도 끊긴 실행의 폴더를 연 덕에 남았습니다.

이제 남은 일은 사람 심사자가 35쪽을 읽는 것입니다. 정리 E는 같은 방법이 디리클레 L함수에도 통한다는 것을 보였고, 완비 제타 함수의 도함수 영점에 대해서는 85.838%라는 별도 결과도 나왔습니다. 논문은 모든 단계를 초보적이고 자기완결적으로 쓰려 했다며 오류를 알려 주면 고맙겠다고 적었습니다. 최종 초안을 받았을 때 코디네이터가 남긴 말은 한 줄이었습니다. 「다음 독자는 사람이어야 합니다.」

읽어 주셔서 고맙습니다.

초이 드림
