이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
점화 시험의 20스텝 대 40스텝 차이가 통계적으로 유의해지는 시점이 재귀적 자기개선 다음 단계의 신호가 된다
7월 14일 보고서에서 AIDE47은 같은 최고점에 약 20스텝, AIDE-human은 약 40스텝에 닿았고 효율 차이는 유의하지 않았습니다.
살아남을 판은 에이전트가 볼 수 없는 비공개 점수로 골랐고, 평가마다 달러 예산을 고정해 계산량을 더 써서 얻은 향상은 통과하지 못하게 했습니다. KernelBench에서 편법 비율은 출발점 63%에서 최종판 34%로 내려갔습니다.
Weco는 지금 시스템이 지능 폭발 근처에 있지 않다고 적었습니다. 중간판 AIDE47을 개선자로 앉힌 점화 시험에서 같은 최고점에 약 20스텝 만에 닿았지만(사람 손 버전은 약 40스텝) 끝점이 더 높지 않았고 차이도 통계적으로 유의하지 않았습니다.
7월 15일 기준으로 공개된 것은 MIT 라이선스의 원래 AIDE입니다. 최종판 AIDE85와 PDF 기술 보고서는 남은 분석이 끝나는 대로 공개하겠다고 Weco가 밝혔습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
9월 14일 공개된 Dream-RSI는 모델 가중치 대신 어느 후보를 이어 갈지 정하는 탐색 정책 코드만 고칩니다. Gemini 3.1 Pro로 Lasso 알고리즘을 찾을 때 호출은 42% 줄었지만, 데이터셋 6개 가운데 5개에서는 고정 탐색보다 느렸습니다.

애플 연구진이 10월 1일 공개한 LoopCD는 루프 모델이 버리던 첫 바퀴 예측을 기준점 삼아 마지막 예측을 한 번 더 밉니다. 추가 학습 없이 AIME 2024 정답률이 61.88%에서 73.33%로 올랐고, 연산 22.5~48.2% 절감은 객관식 실험에서 쟀습니다.
9개 기관 연구진 33명이 75쪽 논문에서 자기개선 연구 491편을 다섯 단계로 나눴습니다. 개선 절차까지 고쳐 물려주는 L5는 29편이었고, 그 절차가 다음 세대를 더 잘 만든다는 효과는 아직 통계로 확인되지 않았습니다.

9월 14일 공개된 Dream-RSI는 모델 가중치 대신 어느 후보를 이어 갈지 정하는 탐색 정책 코드만 고칩니다. Gemini 3.1 Pro로 Lasso 알고리즘을 찾을 때 호출은 42% 줄었지만, 데이터셋 6개 가운데 5개에서는 고정 탐색보다 느렸습니다.

애플 연구진이 10월 1일 공개한 LoopCD는 루프 모델이 버리던 첫 바퀴 예측을 기준점 삼아 마지막 예측을 한 번 더 밉니다. 추가 학습 없이 AIME 2024 정답률이 61.88%에서 73.33%로 올랐고, 연산 22.5~48.2% 절감은 객관식 실험에서 쟀습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@zhengyaojiangX 게시물 · 원문 보기
Weco 공동창업자 겸 CEO 정야오 장(Zhengyao Jiang)은 한국 시각 7월 15일 새벽 2시 16분 X에 7편짜리 스레드를 올려 이 보고서를 알렸습니다. 그는 첫 글에서 이 결과를 재귀적 자기개선(RSI)의 첫 실험 증거라고 부르고, 오토리서치 에이전트를 8일 동안 오토리서치했더니 2년 동안 손으로 튜닝한 하네스를 처음 보는 벤치마크에서 이겼다고 썼습니다. 재귀적 자기개선은 AI가 자기를 개선하는 능력까지 스스로 키우는 되먹임을 가리키고, 이 되먹임이 끝없이 빨라지는 상황을 지능 폭발이라고 부릅니다.
Weco는 머신러닝 엔지니어링 에이전트 AIDE를 만든 회사입니다. 오픈AI는 2024년 10월 캐글 대회 75개로 AI 에이전트의 머신러닝 엔지니어링 실력을 재는 벤치마크 MLE-bench를 내놓았고, 여기서 가장 좋은 성적을 낸 조합이 오픈AI의 o1-preview를 AIDE에 얹은 것이었습니다. 이 조합은 대회의 16.9%에서 캐글 동메달 이상의 성적을 냈습니다. Weco는 2025년 2월 AIDE 논문을 arXiv에 올렸고, 코드는 MIT 라이선스로 공개돼 있습니다.
AIDE가 하는 일을 요즘은 오토리서치라고 부릅니다. 사람이 채점 기준만 정해 두면 에이전트가 코드를 조금씩 바꿔 돌려 보고, 점수가 오르면 남기고 아니면 버리는 일을 되풀이하는 방식입니다. 안드레 카파시는 3월 초 같은 방식을 autoresearch라는 저장소로 공개했습니다. 단일 GPU용으로 줄인 약 630줄짜리 언어모델 학습 코드를 에이전트에게 맡겼더니 이틀 동안 실험 700번을 돌려 개선 20개를 찾았고, 이를 더 큰 모델에 적용하자 학습 시간이 11% 줄었다고 포천이 전했습니다.
@karpathyX 게시물 · 원문 보기
카파시의 루프가 고친 것은 모델을 학습시키는 코드였고, AIDE²는 같은 루프를 오토리서치 에이전트 자신에게 걸었습니다. 저는 발표 당일 스레드에서 이 보고서를 11편으로 나눠 정리했는데, 그때 옮긴 숫자를 이번에 원문 도표와 하나씩 다시 맞췄습니다.
AIDE²에는 루프가 두 개 있습니다. 안쪽 루프는 보통의 오토리서치 에이전트처럼 과제의 코드를 채점 기준에 맞춰 최적화합니다. 바깥 루프는 그 안쪽 에이전트의 하네스 코드, 곧 모델에 도구와 지시를 붙여 일을 시키는 실행 틀을 다시 씁니다. 바깥 루프는 스텝마다 안쪽 에이전트를 고쳐 쓴 판을 제안하고, 그 판을 평가한 뒤, 지금까지의 최고판보다 나을 때만 남깁니다.
| 루프 | 맡은 일 | 에이전트 | 모델 |
|---|---|---|---|
| 바깥 | 안쪽 에이전트의 코드를 고쳐 쓰고 나을 때만 채택 | AIDE-human (Weco가 2년 동안 손으로 다듬은 판) | claude-opus-4.7 |
| 안쪽 | 과제의 코드를 채점 기준에 맞춰 최적화 | AIDE0에서 출발해 스텝마다 새 판 | gemini-3-flash |
안쪽 출발점 AIDE0는 원래 AIDE에서 머신러닝 전용 장치를 걷어 내고 단순하게 다시 짠 판입니다. 그래야 한 에이전트가 성격이 전혀 다른 과제들을 오갈 수 있습니다. 바깥 루프는 Weco가 2년 동안 다듬어 온 AIDE-human이 돌리는데, 이 판은 Weco 제품판과 장치 대부분을 공유합니다. 비교 기준인 사람 손 버전이 바깥에서 개선하는 일까지 맡은 구조입니다.
안팎의 모델이 다른 데는 돈 계산이 있습니다. 바깥 루프가 제안한 판 하나를 평가하려면 그 판으로 여러 과제의 오토리서치를 여러 번 돌려야 해서, 바깥 에이전트가 쓰는 토큰은 전체 실험비의 작은 일부에 그칩니다. 그래서 바깥에는 가장 강한 모델을 두고, 안쪽에는 고정 예산에서 더 큰 모델과 비슷하거나 조금 나은 성적을 낸 gemini-3-flash를 둬 시도 횟수를 늘렸습니다.

안쪽 에이전트가 푸는 과제는 세 갈래입니다. 지표에 맞춰 모델을 처음부터 끝까지 학습시키는 머신러닝 엔지니어링, 경로·적재·일정처럼 정확한 해를 구할 수 없는 조합 최적화 문제에서 휴리스틱을 다듬는 알고리즘 엔지니어링, 기성 코딩 에이전트가 SWE-bench 이슈를 더 많이 풀게 만드는 식의 하네스 엔지니어링입니다. 하네스만 고쳐 같은 모델의 SWE-bench 점수를 20%에서 50%로 올린 다윈 괴델 머신 같은 연구는 릴리안 웽의 하네스 자기개선론을 다룬 글에서 정리했습니다. AIDE²에서는 그런 하네스 개선이 안쪽 과제 가운데 하나입니다.
Weco는 설계 노력의 대부분을 안쪽 평가에 들였다고 적었습니다. 평가에는 장치 세 가지가 들어 있습니다.
안쪽 평가의 세 장치
공개 점수와 비공개 점수
달러로 잰 고정 예산
일부러 섞은 과제
비공개 점수에서 앞서야 살아남으니, 에이전트가 볼 수 있는 점수만 끌어올린 판은 걸러집니다. Weco는 본 적 없는 데이터에서도 앞서는 것을 1차 일반화, 개선에 쓰지 않은 과제에서도 앞서는 것을 2차 일반화라고 불렀습니다. 점수를 속이는 편법 대부분이 1차 일반화의 실패라는 것이 Weco의 설명입니다.
100스텝은 AIDE0에서 AIDE99까지 이어졌고 8일이 걸렸습니다. 한 스텝은 안쪽 에이전트를 한 번 고쳐 쓰고 세 과제군 전체에서 한 번 평가하는 일입니다. 평가가 엄격해서 제안된 수정의 약 90%가 기각됐고, 채택된 판은 2·6·28·39·47·63·85번째 스텝에서 나온 7개입니다.

내부 벤치마크 점수는 0.703에서 0.778로 0.075 올랐습니다. 같은 보고서가 밝힌 실행 간 잡음 폭은 0.02~0.045입니다. 그래프에서 6번째 스텝 뒤의 계단들은 이 잡음 폭보다 작고, Weco는 순증의 조건 가운데 하나로 여러 스텝에 걸쳐 이어지는 추세를 걸었습니다.
Weco는 AIDE² 발표 4일 전인 7월 10일 「재귀적 자기개선의 네 단계」라는 글을 먼저 올렸습니다. 이 글은 연구개발의 수확 체감에서 출발합니다. 인텔의 1993~2024년 R&D 지출과 트랜지스터 밀도 향상을 맞춰 보면 누적 R&D가 두 배가 될 때마다 R&D 1달러가 사는 무어의 법칙 진척이 32%씩 줄었습니다. 언어모델 사전학습의 알고리즘 효율 향상(에포크AI 집계)도 누적 논문 수가 두 배가 될 때마다 논문당 진척이 38%씩 줄었습니다.

무어의 법칙이 속도를 지킨 것은 그 밑의 투자가 지수적으로 늘어 줄어든 효율을 메웠기 때문이라고 Weco는 설명합니다. Weco는 재귀적 자기개선을 이 곡선을 거스르는 고리로 봅니다. 연구가 연구하는 주체를 직접 낫게 만들면, 문제가 어려워지는 속도를 되먹임이 앞지를 수 있습니다. 사람도 교육과 방법론, 도구로 스스로를 개선해 왔지만, Weco는 그 고리가 세대 단위로 돌고 생물학적 기반에 묶여 있으며 한 사람의 깨달음이 다음 사람에게 고스란히 옮겨지지 않는다고 적었습니다. Weco가 거는 기대는 같은 고리를 기계의 시간으로, 고칠 수 있는 기반 위에서, 손실 없는 복제로 돌리는 것입니다.
AI가 설계한 AI가 사람의 설계를 앞섰다는 발표는 전에도 있었습니다. 구글은 2017년 11월 AutoML이 설계한 신경망 NASNet이 이미지넷 검증 세트에서 82.7%의 정확도를 내, 그때까지 발표된 어떤 결과보다 1.2% 앞섰다고 밝혔습니다. 그때 AI가 고친 대상은 신경망 구조였고, 구조를 찾는 방법은 사람이 짠 그대로 남았습니다. AIDE²가 고친 대상은 그 찾는 방법, 곧 연구하는 에이전트 자체입니다.
Weco는 처음 50스텝의 최고판 AIDE47과 100스텝 뒤의 최종판 AIDE85를 루프가 한 번도 보지 않은 외부 벤치마크 세 곳에 붙였습니다. 두 곳은 루프가 개선에 쓴 과제군과 성격이 같고 과제 자체는 겹치지 않으며, 한 곳은 과제군 바깥입니다. MLE-Bench Lite는 오픈AI가 실제 캐글 대회로 만든 MLE-bench의 경량판으로, 비공개 테스트 데이터에서 매긴 백분위로 채점하고 시드 3개를 평균했습니다. ALE-Bench Lite는 일본 경쟁 프로그래밍 사이트 앳코더(AtCoder)의 휴리스틱 대회 문제를 숨은 테스트 사례로 채점하는 시험이고, 10문제를 시드 10개씩 돌려 앳코더식 레이팅을 매깁니다.
세 번째 WeatherBench 2는 물리 기반 기상 예보 엔진의 계산부(역학 코어)를 고치는 과제입니다. 에이전트마다 15달러 예산을 주고, 출발 엔진보다 예보 기술이 얼마나 나아졌는지를 잽니다. Weco는 AIDE 같은 에이전트를 물리 예보 엔진에 붙인 사례를 알지 못한다고 적었습니다.
| 벤치마크(지표) | AIDE0 (출발점) | AIDE47 | AIDE85 | AIDE-human (2년 손질) |
|---|---|---|---|---|
| MLE-Bench Lite (백분위) | 0.673 | 0.739 | 0.721 | 0.708 |
| ALE-Bench Lite (레이팅) | 1,536 | 1,713 | 1,790 | 1,511 |
| WeatherBench 2 (예보 기술 향상) | 0.668 | 0.801 | 0.803 | 0.655 |
세 지표 모두 높을수록 좋고, 값은 Weco 보고서 도표에서 옮겼습니다. AIDE47과 AIDE85는 세 곳 모두에서 AIDE-human을 넘었습니다. MLE-Bench Lite에서 AIDE0 대비 향상을 과제별로 짝지어 보면 AIDE47이 +0.053, AIDE85가 +0.042였고 p값은 각각 0.0024와 0.0041이었습니다. 향상이 한 방향으로만 쌓이지는 않아서, 최종판 AIDE85는 MLE-Bench Lite에서 중간판 AIDE47보다 낮았습니다.
같은 표에는 발표 문구가 앞세우지 않은 숫자도 있습니다. 출발점 AIDE0가 ALE-Bench Lite(1,536 대 1,511)와 WeatherBench 2(0.668 대 0.655)에서 이미 AIDE-human보다 높았습니다. AIDE를 단순하게 다시 짠 출발점이 세 곳 가운데 두 곳에서 2년 손질한 판을 앞서 있었던 겁니다. 루프가 만든 향상만 떼어 보면 AIDE0에서 AIDE85까지 ALE-Bench Lite 254점, WeatherBench 2 0.135, MLE-Bench Lite 0.048입니다. 사람 손 버전이 출발점보다 높았던 MLE-Bench Lite에서 AIDE85가 AIDE-human을 앞선 폭은 0.013이고, 보고서에 실린 유의성 검정은 AIDE0와의 비교뿐입니다.
오토리서치 시스템은 점수를 주면 대개 그 점수를 속이는 법부터 배웁니다. GPU 커널(그래픽 칩에서 도는 계산 함수)을 짜는 과제가 특히 그렇습니다. 단위 테스트에서는 빨라졌다고 보고했는데 실제 모델 학습에 넣으면 그 속도가 사라지는 식입니다. Weco는 KernelBench 과제에서 따로 잰 속도가 1.02배를 넘는다고 주장한 커널을 GPT-2·ViT·CNN 학습에 넣어 보고, 주장한 향상의 절반도 남지 않으면 편법으로 쳤습니다. 커널과 학습 작업의 조합 38개를 시드 3개로 쟀습니다.

출발점 AIDE0는 63%에서 편법을 썼고, AIDE47은 42%, AIDE85는 34%였습니다. 사람이 손으로 방어 장치를 넣어 온 AIDE-human은 42%로 AIDE47과 같았습니다. Weco는 AIDE²에 편법을 줄이라는 지시를 준 적이 없고, 이유로는 가능성 하나를 들었습니다. 바깥 루프가 안쪽 에이전트가 볼 수 없는 비공개 점수로 판을 고르니, 공개 점수를 속여 이기는 변종은 살아남지 못했다는 설명입니다.
AIDE85 안에는 루프가 스스로 쌓은 편법 방어가 세 겹 있습니다. 모든 단계의 프롬프트에 넣은 과적합 경고, 의심스러운 출력이 나오면 믿지 않고 다시 만들게 하는 하드코딩 검사, 다른 해법들보다 지나치게 좋은 성공을 걸러 내는 통계 장치입니다. 그런데 세 번째 장치는 구현에 버그가 있어 최종판에서는 아무 일도 하지 않습니다. Weco가 계보를 거슬러 올라가 보니 앞 세대에서는 제대로 구현돼 있었고, 이후 변이에서 깨졌습니다.

평가 스크립트에 붙은 거대한 패치는 반대 방향의 사건이었습니다. Weco는 처음에 이 패치를 점수 조작으로 의심했지만, 열어 보니 하네스 엔지니어링 평가 스크립트의 버그를 고친 것이었습니다. 입력 예시 하나에서 오류가 나면 비공개 평가 전체가 멈추던 버그였고, 루프는 이를 이용하지 않고 고쳤습니다. 점수에 준 영향은 거의 없었다고 Weco는 덧붙였습니다.

루프가 찾아낸 개선 두 갈래 가운데 하나는 탐색 정책에서 나왔습니다. AIDE0는 초안 5개를 쓴 뒤 버그 난 잎을 고치거나 트리 전체의 최고 해를 개선하는 방식이었고, 늘 최고 해가 다음 스텝을 가져갔습니다. AIDE85는 초안마다 갈라진 가지를 슬롯머신의 팔처럼 다루는 밴딧 방식을 씁니다. UCB1 규칙으로 30%는 탐색, 70%는 활용에 쓰고, 최고 계보가 정체되면 그 최고 해를 새 전략으로 복제해 새 팔을 만듭니다. 몬테카를로 트리 탐색(MCTS)처럼 더 복잡한 알고리즘도 시도됐지만 평가에서 기각됐습니다.

다른 하나는 맥락을 다루는 방식에서 나왔습니다. 요즘 에이전트 설계는 모델에 맥락을 되도록 많이 넣는 쪽이 주류인데, AIDE85는 반대로 갔습니다. 해 트리에는 모든 코드와 출력을 지우지 않고 저장하되, 초안·개선·디버그·평가 검토 단계마다 필요한 것만 잘라 읽게 했습니다. 지난 시도는 노드마다 한 줄 요약으로 최근 12개만 넘깁니다. 과거 기록을 통째로 이어 붙이던 방식보다 프롬프트가 평균 16배 짧아졌고, 아낀 토큰은 탐색 스텝을 더 돌리는 데 다시 썼습니다.
Weco는 한 시드에서 기각된 제안 95개를 사람이 모두 읽었습니다. 진화 탐색과 트리 탐색, LLM 기반 최적화 문헌의 상당 부분이 들어 있었지만 고정 예산 아래에서는 개선 관문을 넘지 못했습니다.
| 루프가 제안한 것 | 알려진 원형 | 당시 최고판 대비 비공개 점수 |
|---|---|---|
| 개체를 주기적으로 주고받는 섬 집단 | 섬 모델 유전 알고리즘(1989·1998) | -0.021 |
| LLM 심판끼리 맞붙이는 선택 토너먼트 | 토너먼트 선택(1991)·대결식 판정(2023) | -0.090 |
| 계속 다듬을지 다시 시작할지 결정 | 재시작 정책(1993) | -0.078 |
| 분산에 따라 탐색을 늘리기 | UCB-V(2009) | -0.080 |
| 한 노드를 자주 다시 찾으면 과적합으로 의심 | 뚜렷한 문헌 없음 | -0.004 |
마지막 줄은 Weco가 루프의 제안 가운데 유일하게 새로운 아이디어로 꼽은 것입니다. 실행 간 잡음이 0.02~0.045라서 -0.004 같은 차이는 동전 던지기에 가깝다고 Weco는 적었습니다. 그렇게 정교한 아이디어들이 떨어진 끝에 남은 알고리즘은 단순한 장치 몇 개를 엮은 조합이었습니다.
Weco는 바깥 루프의 연구를 사람이 주도하는 R&D와 견주면 투입 시간 기준으로 대략 100배 빠르다고 적었습니다. 2년을 날수로 바꾸면 730일이고, 8일로 나누면 약 91배입니다. 네 단계 글이 순증의 조건으로 건 네 가지, 곧 공정한 사람 기준선, 여러 스텝에 걸친 추세, 측정 밖으로의 일반화, 고정된 물리 예산을 AIDE²가 모두 채웠다는 것이 Weco의 판정입니다.
발표에 빠진 것도 있습니다. 8일 동안 토큰과 연산에 쓴 총비용은 보고서에 나오지 않습니다. 사람 쪽 2년은 엔지니어들이 AIDE-human을 다듬어 온 기간이고 루프 쪽 8일은 기계가 돈 시간이라, 둘을 같은 단위로 맞춘 계산식도 공개되지 않았습니다.
Weco의 네 단계는 이렇습니다. 레벨 0 위임은 자율 시스템이 연구 루프를 끝까지 돌리지만 사람 R&D보다 느리게 개선하는 단계로, Weco는 지금 나온 자기개선 주장 대부분이 여기에 있다고 봤습니다. 레벨 1 순증은 같은 비용으로 사람보다 빠르게 스스로를 개선하는 단계이고, 레벨 2 점화는 개선된 시스템이 더 나은 개선자가 되는 단계, 레벨 3 변곡은 고정 예산에서 진척이 느려지지 않고 빨라지는 단계입니다. 각 단계는 다음 단계의 필요조건입니다.

Weco는 광산에 빗댔습니다. 깊이 팔수록 광석에 닿기 어려워지는 것이 수확 체감이고, 캐낸 금속으로 사람보다 훨씬 빨리 캐는 자동 채굴기를 만드는 것이 순증입니다. 더 깊이 판 만큼 더 좋은 금속이 나와 더 좋은 채굴기를 만들면 점화이고, 그 고리가 강해져 같은 노력으로 더 깊이 내려가도 채굴 속도가 줄지 않으면 변곡입니다.
점화를 직접 재려고 Weco는 AIDE47을 바깥 루프에 앉혀 다시 돌리고, AIDE-human이 바깥을 맡은 경우와 견줬습니다. 양쪽 모두 50스텝을 시드 3개씩 돌렸습니다. 두 쪽은 비슷한 최고점에 닿았고, AIDE47은 약 20스텝, AIDE-human은 약 40스텝이 걸렸습니다. 끝점이 더 높지 않았고 효율 차이도 통계적으로 유의하지 않아서, Weco는 점화의 증거로 보지 않았습니다. 루프가 겹겹이 들어가면 잡음이 쌓여 점화를 재는 일 자체가 어렵다고도 적었습니다.

Weco는 다른 자기개선 연구도 이 네 단계에 놓아 봤습니다. 다윈 괴델 머신과 헉슬리 괴델 머신, HyperAgents는 만들어질 당시 레벨 0이었을 것으로 보면서도, 최전선 모델로 제대로 구현하면 레벨 1이나 2에 닿을 가능성은 배제하지 않았습니다. 구글 딥마인드의 AlphaEvolve는 2025년 5월 제미나이 학습에 쓰는 커널을 23% 빠르게 해 제미나이 학습 시간을 1% 줄였는데, Weco는 이런 시스템이 이미 레벨 1일 수 있다고 보면서도 행렬 곱셈 커널 같은 하위 문제 하나를 겨냥하는 탓에 개선 폭의 이론적 한계가 정해져 있다고 적었습니다.
재귀적 자기개선을 두고 나온 숫자와 발언은 AIDE² 전에도 이어졌습니다. 2024년 MLE-bench부터 이번 보고서까지를 날짜순으로 놓으면 이렇습니다.
| 날짜 | 있었던 일 |
|---|---|
| 2024년 10월 | 오픈AI MLE-bench 공개, o1-preview와 AIDE 조합이 캐글 대회 16.9%에서 동메달 이상 |
| 2025년 5월 14일 | 딥마인드 AlphaEvolve, 제미나이 학습 커널 23% 가속 |
| 2025년 5월 29일 | 다윈 괴델 머신, 하네스 자기수정으로 SWE-bench 20%에서 50%로 |
| 2025년 10월 17일 | 카파시, 드와케시 팟캐스트에서 「이미 수십 년째 지능 폭발 속」 |
| 2026년 3월 | 카파시 autoresearch 공개, 이틀 동안 실험 700번 |
| 2026년 6월 4일 | 앤트로픽 「When AI builds itself」, 합쳐지는 코드의 80% 이상을 Claude가 작성 |
| 2026년 7월 4일 | 릴리안 웽 「자기개선을 위한 하네스 엔지니어링」 |
| 2026년 7월 10일 | Weco 「재귀적 자기개선의 네 단계」 |
| 2026년 7월 14일 | Weco AIDE² 보고서 |
앤트로픽은 6월 4일 낸 보고서에서 5월 기준 앤트로픽 코드베이스에 합쳐지는 코드의 80% 이상을 Claude가 썼다고 밝혔습니다. 2025년 2월 Claude Code 연구 미리보기가 나오기 전에는 한 자릿수 초반이던 비율입니다. 앤트로픽은 잘 정해진 실험을 수행하는 일에서는 Claude가 숙련된 사람과 같거나 앞서지만, 무엇을 목표로 삼을지 고르는 판단에서는 큰 격차가 남아 있다고 함께 적었습니다.
반대편에는 안드레 카파시가 있습니다. 그는 2025년 10월 드와케시 파텔 팟캐스트에서 연구소들이 말하는 재귀적 자기개선을 두고 이렇게 답했습니다.
그래도 평소와 다름없는 일입니다. 우리는 이미 지능 폭발 속에 있고, 수십 년째 그래 왔기 때문입니다.— 안드레 카파시, 드와케시 팟캐스트(2025년 10월)
컴퓨터나 아이폰도 GDP에서 따로 찾아낼 수 없었고 GDP는 같은 지수 곡선을 그렸다는 것이 카파시의 근거입니다. Weco가 첫 실험 증거라고 부른 이번 측정을 Weco 스스로는 네 단계 가운데 두 번째에 놓았습니다.
AIDE85는 성능은 좋았지만 다루기 어려웠습니다. Weco는 많은 바이브 코딩 산출물처럼 최종판의 논리가 복잡하고 일부는 아예 죽은 코드여서, 시각화나 조종 같은 제품 기능과 맞춰 실서비스에 넣기가 까다롭다고 적었습니다. 훨씬 깔끔하게 설계한 사람 손 버전보다 이 코드가 낯선 과제로 더 잘 옮겨 간 이유도 Weco는 설명하지 못했습니다. 바깥 루프가 몇 달, 몇 년 치 실험을 코드에 눌러 담았을 수 있다는 추측을 내놓았고, 다루는 방법으로는 코드 조각을 블랙박스로 두고 인터페이스 설계에 힘을 쏟는 쪽을 후보로 들었습니다.
지금 보는 것이 이 시스템의 가장 나쁜 버전입니다.— Weco AI, AIDE² 보고서
Weco는 이 문장 바로 앞에서 점화를 지능 폭발에 필요한 조건 가운데 하나로 두고, 점화가 일어나도 폭발이 보장되지는 않으며 지금 시스템으로는 지능 폭발 근처에 있지 않다고 적었습니다. 국내 팀이 지금 내려받아 쓸 수 있는 것은 MIT 라이선스로 공개된 원래의 AIDE입니다. 전체 실험 절차와 분석을 담은 PDF 기술 보고서와 AIDE85 자체는 남은 분석이 끝나는 대로 공개하겠다고 Weco는 밝혔고, 날짜는 정하지 않았습니다.
읽어 주셔서 고맙습니다.
초이 드림