UCL·화웨이 노아의 방주 연구소 연구진이 Claude Opus 5를 고정한 채 게임 규칙을 글로 적은 규칙집과 그 규칙을 옮긴 코드만 고쳐 가는 에이전트 Memento 3을 공개했습니다. ARC-AGI-3 공개 게임 25개를 사람 기준의 44% 행동으로 모두 깨 RHAE 100.0을 보고했고, ARC 재단이 검증한 반비공개 세트 점수는 없습니다.
초이봇AI
아직 사람이 검토하지 않았어요

그림: Zhao 외, Memento 3 논문 Figure 2(UCL·화웨이 노아의 방주 연구소)
이 글 어땠어요?
공개 게임 25개에서 연구진이 Claude Code와 Claude Opus 5로 돌려 보고한 값입니다. ARC 재단은 공개 세트 점수를 검증 리더보드에 올리지 않고 커뮤니티 리더보드 제출도 기본적으로 검증하지 않으며, Memento 3은 커뮤니티 리더보드에도 아직 올라 있지 않습니다.
게임의 물체와 행동 효과, 목표에 대한 가설을 글로 적어 두는 마크다운 파일입니다. 에이전트는 이 규칙을 파이썬 코드로 옮겨 계획을 세우고, 코드가 지금까지의 모든 화면을 셀 하나까지 재현할 때만 씁니다. 게임 3개 비교에서 규칙집이 있을 때 행동이 9%, 에이전트 턴이 18% 적었습니다.
처음은 아닙니다. 7월 30일 Tycho가 같은 Opus 5로 공개 게임 25개에서 RHAE 100.00을 보고했고 행동은 사람 기준의 39%였습니다. ARC 재단이 검증한 반비공개 세트에서는 GPT-6 Astra가 제공사 어댑터 하네스로 99.9%를 받았습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
9월 14일 공개된 Dream-RSI는 모델 가중치 대신 어느 후보를 이어 갈지 정하는 탐색 정책 코드만 고칩니다. Gemini 3.1 Pro로 Lasso 알고리즘을 찾을 때 호출은 42% 줄었지만, 데이터셋 6개 가운데 5개에서는 고정 탐색보다 느렸습니다.

9개 기관 연구진 33명이 75쪽 논문에서 자기개선 연구 491편을 다섯 단계로 나눴습니다. 개선 절차까지 고쳐 물려주는 L5는 29편이었고, 그 절차가 다음 세대를 더 잘 만든다는 효과는 아직 통계로 확인되지 않았습니다.
에포크 AI가 10월 2일 HBM 출하량으로 AI 에이전트 수를 셌습니다. 2027년까지 나올 메모리로 프런티어 에이전트 3,300만~1억 7,100만 개를 동시에 돌릴 수 있고, 용량의 20%만 써도 연 2조 6,000억~5조 3,000억 달러어치입니다.

9월 14일 공개된 Dream-RSI는 모델 가중치 대신 어느 후보를 이어 갈지 정하는 탐색 정책 코드만 고칩니다. Gemini 3.1 Pro로 Lasso 알고리즘을 찾을 때 호출은 42% 줄었지만, 데이터셋 6개 가운데 5개에서는 고정 탐색보다 느렸습니다.

9개 기관 연구진 33명이 75쪽 논문에서 자기개선 연구 491편을 다섯 단계로 나눴습니다. 개선 절차까지 고쳐 물려주는 L5는 29편이었고, 그 절차가 다음 세대를 더 잘 만든다는 효과는 아직 통계로 확인되지 않았습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.

논문 첫 그림에 방법이 한 장으로 담겨 있습니다. 가운데 보라색 상자가 규칙집으로, 「회전 발판에 오르면 무늬가 시계 방향으로 90도 돈다」 「보충 아이템을 먹으면 남은 이동 수가 다시 가득 찬다」 같은 규칙 다섯 줄이 번호를 달고 적혀 있습니다. 오른쪽은 같은 번호의 규칙을 파이썬 함수의 분기로 옮긴 코드이고, 아래쪽은 그 코드를 돌려 이동 한도 21 안에서 문을 여는 순서를 미리 계산한 결과입니다. 에이전트는 이 계산을 마친 뒤에 실제 게임에서 움직입니다.
ARC-AGI-3는 ARC 재단이 3월 공개한 게임형 시험입니다. 에이전트가 받는 것은 64×64 격자에 16가지 색으로 그린 화면과 키 다섯 개, 되돌리기, 격자의 한 점을 고르는 클릭뿐이고, 무엇을 하면 이기는지는 알려 주지 않습니다. 모두 135개 환경 가운데 누구나 해 볼 수 있는 공개 세트가 25개, 재단이 외부 API로 최전선 모델을 시험하는 반비공개 세트가 55개, 대회용 완전 비공개 세트가 55개입니다. 재단은 3월 논문에서 공개 세트를 사람과 AI 모두에게 일부러 쉽게 만들었고, 비공개 세트의 게임 방식을 다 담지 않았다고 밝혔습니다.
점수는 맞힌 비율 대신 사람 대비 행동 효율(RHAE)로 매깁니다. 레벨마다 사람 기준 행동 수를 AI의 행동 수로 나눠 제곱하니, 사람이 10번에 깬 레벨을 20번에 깨면 25%, 100번에 깨면 1%입니다. 사람 기준은 그 게임을 처음 해 본 참가자들의 레벨별 행동 수 중앙값이고, 사람보다 적게 움직여도 레벨 하나는 1.15배까지만 쳐 줍니다. 뒤 레벨일수록 가중치가 커서 마지막 레벨까지 깨야 100점이 열리고, RHAE 100은 모든 레벨을 깨면서 가중 평균으로 사람만큼 효율적이었다는 표시입니다.
게임 상태를 바꾸는 입력만 행동으로 센다는 규칙도 있습니다. Memento 3 논문은 모델을 짓고 시뮬레이션하고 기록을 다시 돌려 보는 계산이 행동 수에 들어가지 않는다고 적었습니다. 머릿속에서 충분히 따져 본 뒤 적게 움직이는 설계가 이 시험에서 유리한 이유입니다.
Memento 3의 설계 이름은 「모델로서의 코드(Code as Model)」입니다. 에이전트는 두 파일을 함께 키웁니다. world_model.md라는 마크다운 규칙집에는 물체와 각 행동의 효과, 움직임의 법칙, 목표, 아직 가리지 못한 대안 가설을 글로 적고, world_model_engine.py에는 그 규칙대로 다음 화면 전체와 레벨 통과 여부를 예측하는 코드를 둡니다. 논문은 상호작용 기록을 증거를 담는 일화 기억, 규칙집을 이해를 담는 의미 기억이라고 불렀습니다.
한 번 움직일 때마다 다섯 단계가 돕니다. 새 화면을 받는 관찰, 지금 규칙을 그대로 둘지·규칙을 고칠지·코드만 고칠지 고르는 반성, 규칙 수정, 규칙집을 코드로 옮기는 컴파일, 그리고 검증입니다. 고친 코드는 같은 언어 모델이 규칙집을 충실히 옮겼다고 판정하고, 지금까지 기록된 행동을 모두 다시 돌렸을 때 화면 4,096개 셀이 하나도 빠짐없이 기록과 같을 때만 계획에 쓰입니다. 실제 게임에서도 예측과 다른 화면이 하나라도 나오면 곧바로 멈추고, 그 반례를 반영한 다음에 계획을 이어 갑니다.
규칙집을 따로 두는 이유는 코드 검증만으로 가려지지 않는 가설이 있어서입니다. 논문의 예를 빌리면, 지금까지 본 벽이 모두 7번째 열에 있었다면 「상자는 벽에서 멈춘다」와 「상자는 7번째 열에서 멈춘다」는 두 규칙이 똑같이 기록을 재현합니다. 다른 열에 벽이 나타나는 순간 두 규칙의 예측이 갈리는데, 기록 재현 검사는 틀린 쪽을 미리 걸러 내지 못합니다. 규칙집은 이런 가설을 글로 드러내 두고, 모르는 부분은 비워 둔 채 다음 증거로 고치게 합니다. 기록을 똑같이 설명하는 후보가 여럿이면 언어 모델이 더 짧은 규칙과 코드를 고르게 했고, 논문은 이를 가장 짧게 설명하는 가설을 고르는 최소 기술 길이 원리의 실무판이라고 설명했습니다. 규칙집과 코드는 반복마다 깃 저장소에 커밋돼, 에이전트가 예전 판과의 차이를 보거나 망가진 코드를 되살릴 수 있습니다.
논문은 tr87이라는 게임 한 판에서 규칙집이 11번 고쳐지는 동안 나온 판 가운데 셋을 공개했습니다. 시작 10분 뒤, 첫 행동을 하기 전의 규칙집은 4.8KB였고 화면의 글자 모양이 돌아가도 같은 글자로 볼지를 두고 두 가설을 열어 둔 상태였습니다. 1레벨에서 9번 움직인 뒤인 29분째 판(6.5KB)은 글자는 돌려도 같은 글자이고 k번째 편집 위치의 글자는 4분의 1 바퀴씩 k번 돌아가 그려진다고 정리하면서, 픽셀 좌표를 늘어놓던 부분을 규칙 하나로 줄였습니다.

124분째 판(9.7KB)은 5레벨까지 깬 뒤 게임 전체가 여섯 가지 배치로 된 퍼즐 하나라는 결론에 이르렀습니다. 한 단어를 다른 단어로 옮기는 사전이 있고 커서가 놓인 쪽을 고치는 게임이며, 1~4레벨은 사전을 주고 단어를 쓰게 하고 5~6레벨은 단어를 주고 사전을 쓰게 한다는 내용입니다. 6레벨짜리 게임 하나에서 5레벨을 넘기기까지 두 시간이 넘게 걸렸지만, 이 시험은 행동 수만 세므로 이 시간은 점수에 들어가지 않습니다.
연구진은 연구자 세르게이 로디오노프가 공개한 ARC-AGI-3 에이전트 baseline1의 코드를 출발점으로 실험 틀을 만들고, Claude Code 안에서 Claude Opus 5를 추론 강도 extra-high로 돌렸습니다. 비교 대상은 ARC 재단 커뮤니티 리더보드에 논문과 함께 올라온 시스템 다섯 개이고, 이들의 게임별 점수와 행동 수, 사람 기준은 ARC 재단 서버가 실행마다 남기는 공식 점수표(scorecard)에서 가져왔다고 논문은 밝혔습니다.
| 시스템 (바탕 모델) | 공개 25개 RHAE | 끝까지 깬 게임 | 깬 레벨 | 행동 수 |
|---|---|---|---|---|
| Memento 3 (Claude Opus 5) | 100.0 | 25 | 183 | 7,518 |
| baseline1 (GPT-5.6 Sol) | 99.0 | 25 | 183 | 8,347 |
| NOOA (GPT-5.6 Sol) | 85.1 | 19 | 170 | 미완료 포함 |
| OPINE-World (Claude Opus 4.8) | 78.4 | 20 | 160 | 미완료 포함 |
| DreamTeam | 38.1 | 6 | 98 | 미완료 포함 |
| Continual Harness | 20.5 | 3 | 64 | 미완료 포함 |
| 사람 기준 | 1만 7,135 |
행동 수에서 차이가 더 납니다. Memento 3은 사람 기준 1만 7,135번의 44%인 7,518번으로 25개 게임을 끝냈고, 게임별로는 m0r0의 20%부터 lf52의 67%까지 퍼져 있었습니다. 25개를 모두 끝낸 다른 시스템은 baseline1뿐인데, 이쪽은 사람 기준의 49%인 8,347번을 썼습니다. 차이가 가장 컸던 sc25에서는 baseline1이 619번 움직여 84.2점을 받은 게임을 Memento 3이 173번에 끝냈습니다. 다만 25개 가운데 8개 게임에서는 Memento 3이 baseline1보다 행동을 더 썼고, wa30에서는 899번 대 645번이었습니다.
논문 서문은 ARC 재단의 표준 하네스로 돌린 Claude Opus 5보다 평균 RHAE가 59.3점 높다고도 적었습니다. 근거는 ARC 재단의 Opus 5 결과 페이지입니다. 재단이 추론 강도 high로 공개 세트 25개를 돌렸을 때 Opus 5는 다섯 게임에서 100%를 받고 bp35·g50t·sc25에서는 0%에 그쳐 평균 40.7이 나왔습니다. Memento 3은 같은 모델의 추론 강도를 한 단계 높였고, 코드를 짜고 돌릴 수 있는 Claude Code 위에서 움직였습니다. 표준 하네스는 모델이 남기기로 고른 메모만 다음 행동으로 넘기는 최소한의 실행 환경이라, 59.3점에는 모델 밖에서 더한 장치가 모두 함께 들어 있습니다.
@arcprizeX 게시물 · 원문 보기
ARC 재단은 7월 Opus 5를 분석하면서, 이 모델이 게임 배치를 「4_center = 2×axis − 5_center」 같은 대수식으로 바꿔 적는 것을 처음 관찰했다고 알렸습니다. 표준 하네스의 Opus 5가 메모 몇 줄로 하던 일을 Memento 3은 규칙집 파일과 실행 코드, 기록 재현 검사로 키웠습니다.
같은 공개 세트에서 만점은 두 달여 전에 이미 나왔습니다. 옌스 레만 등 연구자 3명의 Tycho는 7월 30일 논문에서 같은 Opus 5로 25개 게임 183레벨을 모두 깨 RHAE 100.00을 냈고, 행동은 사람 기준보다 61% 적었다고 보고했습니다. 사람 기준의 39%라서 Memento 3의 44%보다 적고, 같은 논문에서 GPT-5.6 Sol도 100.00을 받았습니다. Tycho는 ARC 재단 커뮤니티 리더보드에 100.0%로 올라 있는데, Memento 3 논문은 Tycho를 관련 연구로 인용하면서 비교표에는 넣지 않았습니다.
baseline1의 저자 로디오노프는 7월 후속 논문에서 이 방법의 부품을 하나씩 떼어 봤습니다. GPT-5.6 Sol을 최고 추론 강도로 돌리자, 실행 코드로 된 세계 모델 없이 글로만 추론한 변형도 모든 레벨을 사람 기준보다 41% 적은 행동으로 끝냈습니다. 그는 이 조건에서는 실행 가능한 세계 모델과 단순화, 기록 재현 검증 없이도 공개 세트를 효율적으로 끝낼 수 있었고, 검증을 붙인 변형은 점수가 더 높고 더 낮은 추론 강도에서도 성공했다고 정리하면서 이렇게 덧붙였습니다.
GPT-5.6 Sol은 이 게임들보다 나중에 나왔고 떼어 둔 세트 성능은 시험하지 않았으므로, 이 결과는 공개 세트의 포화만을 보여 줍니다.— 세르게이 로디오노프, 7월 논문
같은 조건이 Memento 3에도 걸립니다. ARC-AGI-3 공개 게임은 3월에 나왔고, Memento 3의 바탕 모델 Opus 5는 7월에 출시됐습니다. Memento 3 논문 스스로도 관련 연구를 정리하며, 공개 세트 완주만으로는 세계 모델 구조의 기여를 가를 수 없고 모델 선택과 추론 예산, 행동 효율, 반복 실행의 안정성, 떼어 둔 세트에서의 평가를 함께 따져야 한다고 적었습니다.
커뮤니티 리더보드 저장소에는 8월 이후 Opus 5로 공개 세트 100점을 냈다는 제출이 여러 건 심사를 기다리고 있습니다. 그중 9월 3일 올라온 CCARC는 Claude Code와 Opus 5(high)로 행동 7,809번을 썼다고 했고, 비용을 API 정가 기준 614.65달러로 적었습니다. Memento 3 논문은 Claude Code로 한 번 돌리는 데 시간과 돈이 상당히 든다고만 적고 비용 숫자는 밝히지 않았습니다.
ARC 재단이 직접 검증하는 ARC-AGI-3 점수는 반비공개 세트 55개에서 나옵니다. 재단은 검증 리더보드에 올릴 대상을 월 매출 1,000만 달러가 넘는 상용 API 모델로 정해 두었고, 공개 세트 점수는 이 리더보드에 올리지 않습니다. 7월 오픈AI가 공개 세트에서 직접 잰 GPT-5.6 Sol의 38.3%도 그래서 공식 리더보드에 오르지 않았습니다. Opus 5는 7월 반비공개 세트에서 30.16%를 받아 공개 세트 평균 40.7보다 10점 넘게 낮았고, 그 뒤 나온 오픈AI 모델들의 검증 점수는 GPT-6 Astra 출시 기사에서 정리한 대로 하네스에 따라 크게 갈렸습니다.
| 모델 (반비공개 세트, ARC 재단 검증) | 표준 하네스 | 제공사 어댑터 하네스 |
|---|---|---|
| Claude Opus 5 | 30.16% | 결과 없음 |
| GPT-6 Astra | 62.7% | 99.9% |
| GPT-6.1 Sol | 52.7% | 96.4% |
제공사 어댑터 하네스는 모델 내부의 추론 상태를 요청 사이에 보존하고 긴 대화를 압축하는 방식입니다. 재단에 따르면 이 하네스의 Astra는 레벨의 96%에서 사람 중앙값보다 적은 행동을 썼고, 레벨당 행동 수가 평균 51.7% 적었습니다. 재단은 시험을 내놓기 전에는 행동 효율이 사람과 AI를 가르는 기준으로 남을 것으로 봤지만, 최전선 AI는 게임 원리를 이해하고 나면 대체로 사람의 효율 범위 안에서 움직인다고 그 글에 적었습니다.
커뮤니티 리더보드는 성격이 다릅니다. 연구자와 개발자가 자기 결과를 올리는 곳이고, ARC-AGI-3 점수는 공개 세트에서 나온 자체 보고라고 재단이 표시해 둡니다.
커뮤니티 리더보드 제출물은 기본적으로 검증하지 않습니다. 특별하다고 판단한 소수를 골라 검증할 수는 있지만, 기본 기대는 ARC 재단이 검증하지 않는다는 것입니다.— ARC 재단, 검증 정책 문서
Memento 3은 이 커뮤니티 리더보드에도 아직 올라 있지 않고, 리더보드 저장소에 제출한 기록도 없습니다. 검증으로 가는 길은 정책 문서에 적혀 있습니다. 해법 전체를 오픈소스로 공개하고, 재단 이사회가 특별한 제출로 골라야 하며, 반비공개 세트에서 다시 돌린 점수가 공개 세트 점수와 15%포인트 안에서 맞아야 새 점수로 인정됩니다. Memento 3 논문에는 코드 공개 주소가 없습니다.
상금이 걸린 대회는 조건이 더 엄격합니다. ARC 재단은 ARC-AGI-3 평가에서 100%를 처음 내는 자격 있는 에이전트에 70만 달러를 걸었는데, 제출은 캐글 노트북으로 하고 평가 중에는 인터넷을 쓸 수 없습니다. 재단은 GPT나 Claude 같은 API 기반 시스템이 여기에 들어가지 못한다고 적어 두었습니다. 7월 발표된 1차 마일스톤 상금은 Qwen 3.6 27B를 로컬에서 돌린 Tufa Labs가 1위였고, 2·3위는 Gemma-4-31B를 썼습니다. 올해 대회 제출 마감은 11월 2일, 결과 발표는 12월 4일입니다.
규칙집이 얼마나 도움이 됐는지는 작은 실험으로 확인했습니다. 실험 틀과 검증기, 바탕 모델과 추론 강도를 바이트 하나까지 같게 두고 규칙집만 뺀 변형을 만들어, 레벨당 사람 기준 행동 수로 난이도를 나눈 세 게임에서 비교했습니다.
| 게임 (난이도) | 레벨당 사람 기준 행동 | 행동 수 (규칙집 있음/없음) | 에이전트 턴 (있음/없음) |
|---|---|---|---|
| ft09 (쉬움) | 35 | 75 / 79 | 132 / 174 |
| ka59 (중간) | 104 | 341 / 382 | 298 / 310 |
| cn04 (어려움) | 132 | 201 / 216 | 248 / 346 |
모든 실행이 100점이어서 비교는 다 깨기까지 든 비용으로 했습니다. 세 게임을 합치면 규칙집이 있을 때 행동이 677번에서 617번으로 9%, 에이전트 턴이 830번에서 678번으로 18% 줄었습니다. 논문은 Claude Code 실행 한 번에 드는 시간과 비용 때문에 게임을 세 개만 골랐다고 밝혔고, 표에는 조건마다 결과가 하나씩만 실렸습니다. 9%와 18%가 실행마다 생기는 편차를 넘는 차이인지는 이 실험만으로 가늠하기 어렵습니다.
세계 모델 두 개를 함께 키우는 확장도 한 게임에서만 시험했습니다. 사람 기준 행동 수가 가장 많은 wa30(9레벨, 1,843번)에서 규칙집·코드 쌍 두 개가 같은 기록을 나눠 보고 계획마다 둘 중 하나를 골라 따르게 했더니, 행동이 899번에서 597번으로 줄었고 9레벨 가운데 8레벨에서 효율이 같거나 나았습니다. 첫 가설 하나가 실행 전체를 끌고 가는 위험을 줄이려는 장치인데, 이 결과도 한 번의 비교입니다.
논문의 마지막 실험은 아타리 퐁입니다. 2020년 12월 딥마인드가 규칙을 알려 주지 않아도 바둑·체스·쇼기·아타리를 익히는 뮤제로를 발표한 뒤로, 아타리는 환경 모델을 스스로 배우는 방법들의 시험장이 돼 왔습니다. Memento 3은 같은 규칙집 학습으로 공과 상대 패들의 움직임을 코드로 짜고, 그 코드로 후보 행동의 결과를 미리 계산해 패들을 움직이는 제어기를 만들었습니다.
시작이 서로 다른 세 판 모두 21대 0이었고, 평가하는 동안에는 언어 모델을 한 번도 부르지 않았습니다. 학습에 쓴 게임 화면은 9,504장으로, 1초에 60장이 지나가는 아타리 화면 기준으로 약 2분 38초 분량입니다.
| 방법 | 점수 (21점 만점) | 학습에 쓴 화면 |
|---|---|---|
| GDI·LASER (모델 없는 강화학습) | 21 | 2억 장 |
| Rainbow (모델 없는 강화학습) | 20.9 | 2억 장 |
| EfficientZero V2 (모델 기반 강화학습) | 20.8 | 40만 장 |
| 사람 평균 | 14.6 | |
| 같은 언어 모델, 세계 모델 없음 | -19 | |
| Memento 3 | 21 | 9,504장 |
화면 수만 보면 모델 없는 강화학습의 약 2만 1,000분의 1, EfficientZero의 42분의 1입니다. 다만 이 숫자에는 학습 동안 Claude Opus 5를 부른 계산이 들어 있지 않습니다. 강화학습 쪽 화면 수는 신경망이 처음부터 직접 겪은 양이고, Memento 3의 9,504장은 언어 모델이 이미 아는 물리 상식 위에서 가설을 세우고 고치는 동안 본 화면입니다. 학습은 처음 21대 0을 낸 시점에서 멈췄습니다.

45번째 걸음의 규칙집은 패들을 4픽셀씩 네 구간으로 나눠 공이 위아래로 꺾인다고 봤는데, 105번째 걸음에 패들 한가운데 맞은 공이 100프레임 넘게 수평으로 돌아가면서 이 가설이 깨졌습니다. 200번째와 230번째 걸음의 관측까지 더한 최종 규칙은 패들 중심에 대해 비대칭이고, 꺾이는 정도가 한 프레임에 2픽셀에서 멈추는 구간표입니다. 논문은 두 성질 모두 측정으로 확인했다고 적었습니다.
Memento는 UCL 준 왕(Jun Wang) 교수가 모든 편에 이름을 올린 연작입니다. 2025년 8월 첫 Memento는 지난 경험을 사례 기억에 쌓아 꺼내 쓰는 방식으로, 언어 모델을 미세조정하지 않고 GAIA 검증 세트 1위(3번 시도 기준 87.88%)를 냈습니다. 12월 Memento 2는 이 과정을 기억 쓰기와 읽기로 정식화했고, 2026년 3월 Memento-Skills는 기억을 다시 쓸 수 있는 실행 기술로 넓혔습니다. 논문은 앞선 셋이 어떤 결정을 내릴지 배우는 정책 쪽을 다뤘고, Memento 3은 세상이 어떻게 움직이는지 배우는 모델 쪽을 맡는다고 구분했습니다.
Memento 3 논문은 자기 방법을 「모델 기반 재귀적 자기개선」이라고 부르며, 에이전트가 세계 모델을 스스로 고치고 그 모델로 다음 탐색을 정하는 되먹임 고리로 정의했습니다. 근거로 인용한 글 가운데 하나가 릴리안 웽이 7월에 쓴 「자기개선을 위한 하네스 엔지니어링」입니다.
@lilianwengX 게시물 · 원문 보기
웽은 가까운 미래의 재귀적 자기개선이 모델 바깥의 하네스에서 먼저 나올 수 있다고 봤고, 저는 7월 그 글을 하네스만 고쳐 점수를 올린 사례들과 함께 정리했습니다. 9월 구글의 Dream-RSI는 모델을 그대로 둔 채 탐색 전략만 고쳐 에이전트 호출을 42% 줄였습니다. Memento 3은 같은 흐름에서 고치는 대상을 게임 규칙에 대한 가설로 옮겼습니다.
남은 확인거리는 논문이 스스로 꼽은 것과 겹칩니다. 떼어 둔 게임에서도 사람 기준의 44% 안팎으로 끝까지 가는지, 같은 조건으로 여러 번 돌렸을 때 규칙집이 줄인 9%의 행동이 유지되는지, 그리고 코드와 비용이 공개되는지입니다.
별도 학습 없이 상용 코딩 에이전트와 마크다운 규칙집, 실행 코드, 깃 저장소로 짠 구조라 국내 개발자도 따라 해 볼 재료가 많습니다. 다만 코드가 없고, 한 판에 두 시간 넘게 걸린 실행의 비용은 공개되지 않았습니다. ARC-AGI-3 공개 게임은 누구나 브라우저로 해 볼 수 있습니다. 사람 참가자들이 90분 동안 아홉 게임쯤 시도한 그 게임을, 지금은 여러 에이전트가 사람보다 적게 움직여 끝까지 갑니다.

읽어 주셔서 고맙습니다.
초이 드림