이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
Prime Agent와 Opus 5 조합이 ARC Prize의 비공개 세트 검증에서도 사람 기준선 근처 점수를 낸다
8월 5일 발표의 95.5%는 공개된 25개 환경에서 나온 자체 보고입니다.
모델과 하네스를 함께 학습시키는 방식이 새 능력을 여는 주된 길이 된다
Prime Intellect는 아직 어떤 모델도 Prime Agent에 맞춰 학습되지 않았다고 밝혔습니다.
사람 대비 행동 효율입니다. 레벨마다 사람 기준선의 행동 수를 AI의 행동 수로 나눈 뒤 제곱합니다. 사람이 10번에 끝낸 레벨을 20번에 끝내면 25%, 100번이면 1%가 됩니다.
들어가지 않습니다. 게임 상태를 바꾸는 입력만 행동으로 세고, 도구 호출과 추론 단계, 재시도는 세지 않습니다. 그 토큰은 API 비용으로 남습니다.
세션 내내 살아 있는 파이썬 콘솔을 중심에 두고, 대화 기록을 변수로 넣어 코드로 걸러 읽게 합니다. 서브에이전트는 rlm 함수 호출로 띄우고, 프롬프트와 메모리, 스킬, 서브에이전트 정의는 에이전트가 작업 기록을 보고 직접 고칩니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
GPT-5.6 Sol은 ARC-AGI-1·2에서 96.5%·92.5%를 받고도 ARC-AGI-3에서는 7.8%에 그쳤습니다. 오픈AI가 사고 기록을 유지하고 압축을 켜자 공개 세트 점수는 13.3%에서 38.3%로 올랐고 출력 토큰은 6분의 1이 됐습니다.

오픈AI 팀은 사람이 쓴 코드 없이 100만 줄짜리 제품을 만들면서도 좋은 코드의 기준만은 직접 정해 린터와 문서로 옮겼습니다. 구글 킬패트릭은 하네스가 12개월 안에 모델로 흡수된다고 봤고, 커서는 행동 기록으로 제안을 21% 줄이고 수락률을 28% 올렸습니다.
Pi를 만드는 Earendil이 8월 20일 하네스를 네 부품으로 풀어 쓴 글을 냈습니다. 데이터브릭스 실측에서 같은 모델도 하네스에 따라 작업당 비용이 최대 2.08배 차이 났고, 앤트로픽 기본 캐시 수명 5분을 넘기면 쌓인 대화를 정가로 다시 읽습니다.
GPT-5.6 Sol은 ARC-AGI-1·2에서 96.5%·92.5%를 받고도 ARC-AGI-3에서는 7.8%에 그쳤습니다. 오픈AI가 사고 기록을 유지하고 압축을 켜자 공개 세트 점수는 13.3%에서 38.3%로 올랐고 출력 토큰은 6분의 1이 됐습니다.
오픈AI 팀은 사람이 쓴 코드 없이 100만 줄짜리 제품을 만들면서도 좋은 코드의 기준만은 직접 정해 린터와 문서로 옮겼습니다. 구글 킬패트릭은 하네스가 12개월 안에 모델로 흡수된다고 봤고, 커서는 행동 기록으로 제안을 21% 줄이고 수락률을 28% 올렸습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
하네스는 모델을 감싸는 실행 환경입니다. 모델에 어떤 도구를 쥐여 줄지, 대화 기록을 어떻게 잘라 넣을지, 맥락이 차면 언제 요약할지를 정합니다. Claude Code와 Codex가 대표적인 하네스이고, 앤트로픽이 하네스 구조를 고쳐 긴 작업의 실패를 줄여 간 과정은 앤트로픽이 정리한 에이전트 실패 모드 넷에서 다뤘습니다.
그런데 벤치마크 성적표에는 대개 모델 이름만 올라갑니다. 같은 모델이 어떤 하네스에서 시험을 봤는지는 각주에도 잘 들어가지 않습니다. 7월 말 오픈AI가 ARC-AGI-3 채점 환경을 들여다보니 한 수를 둘 때마다 모델의 사고 기록이 버려지고 있었고, 설정 두 개를 고치자 GPT-5.6 Sol의 점수가 13.3%에서 38.3%로 올랐습니다. 그 과정은 설정 두 개로 점수가 세 배 가까이 오른 사례에 정리했습니다.
Prime Intellect의 문제 제기도 같은 곳에서 출발합니다. 지금의 하네스는 앞 세대 모델의 능력에 맞춰 설계돼서, 도구 호출 형식을 고정해 두고 맥락을 일정 시점에 강제로 압축합니다. 회사는 이 구조 때문에 모델이 실행 환경을 활용하지 못하고 그 제약을 피해 돌아가게 된다고 봤습니다. 서브에이전트와 프롬프트, 스킬, 메모리도 설계할 때 한 번 정해 두면 에이전트가 일하면서 배운 것을 반영하지 못한다고 지적했습니다.
Prime Agent는 매 턴 세션 내내 살아 있는 파이썬 콘솔(IPython)을 부릅니다. 콘솔은 시작할 때 스킬과 도구를 모듈로 미리 불러 두고, 모델은 이것들을 코드로 꺼내 씁니다. 오픈소스 에이전트 도구 모음 pi 위에 만들었고, 코드도 MIT 라이선스로 공개했습니다.
대화 기록은 텍스트로 계속 붙는 대신 변수로 들어갑니다. 수십만 자짜리 로그를 통째로 읽어 맥락을 채우지 않고, 그 변수를 코드로 걸러 필요한 줄만 꺼냅니다. 이 설계를 재귀 언어 모델(RLM)이라고 부르는데, 맥락은 변수로, 하위 작업 위임은 함수 호출로 다룹니다. 세션 기록은 한 줄씩 파일에 쌓여서, 맥락을 요약해 비운 뒤에도 원본을 코드로 다시 꺼낼 수 있습니다.

긴 작업의 병목을 기억력에서 프로그래밍 쪽으로 옮기는 설계입니다. 쓸데없는 로그를 읽느라 쓰던 토큰도 함께 줄어듭니다. Prime Intellect는 도구로 데이터를 읽어 들이지 않고 데이터 위에서 함수를 돌리기 때문에, ARC-AGI-3에서 각 모델의 기본 하네스보다 토큰을 덜 쓰면서 더 높은 점수를 냈다고 적었습니다.
콘솔 안의 rlm 함수를 부르면 자기 모델과 콘솔, 대화 기록을 따로 가진 새 세션이 뜹니다. 비동기 함수라서 여러 개를 한꺼번에 던져 두고 본 작업을 이어 갈 수 있고, 결과는 반환값 대신 메시지로 돌아옵니다. 발표 글의 예시는 한 서브에이전트에 인증 흐름 요약을, 다른 하나에 HTTP 계층 요약을 맡겨 두고 끝나는 대로 답을 받는 식입니다.
한 번 만든 서브에이전트는 일이 끝나도 세션이 남아서, 나중에 다시 말을 걸어 이어서 시킬 수 있습니다. 30분 동안 쓰지 않으면 메모리에서 내려갔다가, 누가 부르면 디스크에서 다시 올라옵니다. 세션을 관리하는 백그라운드 데몬을 거치면 어느 세션이든 다른 세션에 메시지를 보낼 수 있어서, 서로 다른 Prime Agent 세션끼리도 일을 주고받습니다. 긴 작업 하나를 한 모델의 기억에 다 담지 않고, 기억을 나눠 가진 여러 세션에 흩어 두었다가 필요할 때 부르는 구조입니다.
Prime Agent에서는 프롬프트와 메모리, 스킬, 서브에이전트 정의를 에이전트가 직접 만들고 읽고 고치고 지웁니다. refine 명령은 지금까지의 작업 기록을 읽고, 결과를 나아지게 할 가장 작은 수정 하나만 적용합니다. 불안정하게 깨지는 테스트는 세 번까지 다시 돌리라는 메모를 남겼다가, 그 요령을 스킬로 올리는 식입니다. 수정마다 무엇이 계기였고 어떤 결과를 냈는지가 함께 기록됩니다.
수정안을 짜는 단계는 백그라운드에서 돌아 본 작업을 멈추지 않고, 디스크에 반영할 때만 다음 턴 경계에서 잠깐 기다립니다. 기본 시스템 프롬프트는 고칠 수 없게 막았고, 잘못 들어간 수정은 이력의 번호를 따라 되돌릴 수 있습니다. 사람이 하던 하네스 튜닝을 에이전트에게 넘긴 구조인데, 뒤에서 볼 Factorio 사례의 명암이 모두 이 기능에서 나옵니다.
ARC-AGI-3는 규칙을 알려 주지 않는 게임을 풀게 하는 시험입니다. 격자로 그린 게임 화면과 몇 가지 조작만 주고, 무엇을 움직여야 하는지, 무엇이 성공인지를 스스로 알아내게 합니다. 3월 공개 당시 최상위 모델들은 모두 1%를 넘지 못했습니다.
Prime Intellect는 ARC-AGI-3를 위해 바꾼 것이 과제 안내문뿐이라고 밝혔습니다. Opus 5를 얹은 세 번의 실행은 95.0%, 95.2%, 95.5%였고, 셋 가운데 가장 좋은 결과를 모으면 183개 레벨을 모두 통과해 99.97%가 됩니다. ARC가 보고한 인간 전문가 기준선이 95.4%라서, 발표 수치는 세 번 중 한 번이 기준선을 0.1%포인트 넘은 결과입니다.
| 조합 | ARC-AGI-3 점수 | 통과 레벨 |
|---|---|---|
| Prime Agent + Opus 5 | 95.5% | 179/183 |
| Prime Agent + GPT-5.6 Sol | 78.3% | 164/183 |
| Prime Agent + GPT-5.6 Terra | 25.7% | 81/183 |
| Prime Agent + GLM-5.2 | 8.6% | 43/183 |
| Opus 5, ARC-AGI-3 표준 하네스 | 30.2% | |
| GPT-5.6 Sol, Responses API | 38.3% | |
| GPT-5.6 Sol, ARC-AGI-3 표준 하네스 | 13.3% | |
| 인간 전문가 기준선 | 95.4% |
같은 하네스 안에서도 모델마다 결과가 크게 갈렸습니다. Sol은 표준 하네스의 13.3%에서 78.3%로 여섯 배 가까이 올랐지만, 오픈웨이트 모델 GLM-5.2는 8.6%에 머물렀습니다. 하네스는 모델이 가진 능력을 끌어내는 장치라서, 끌어낼 능력이 적은 모델에서는 곱하는 효과도 작습니다.
토큰을 쓰는 모양도 달랐습니다. 도표에서 읽으면 표준 하네스의 Sol은 게임당 출력 토큰을 300만 개 가까이 쓰고 13.3%에 그쳤고, Prime Agent의 Sol은 13만 개 남짓으로 78.3%에 닿았습니다. 게임당 10만 토큰 지점에서 Sol은 이미 75%였고 Opus 5는 27%였습니다. Sol은 적은 토큰으로 먼저 치고 올라가다 78.3%에서 멈췄고, Opus 5는 41만 개 남짓까지 토큰을 더 쓰며 95.5%까지 올라갔습니다.
ARC-AGI-3 점수는 정답률이 아닙니다. ARC Prize의 채점 방식은 레벨마다 사람 기준선의 행동 수를 AI의 행동 수로 나눈 뒤 제곱합니다. 사람이 10번에 끝낸 레벨을 20번에 끝내면 25%, 100번이면 1%가 됩니다. 사람 기준선은 그 게임을 처음 해 본 참가자 여러 명의 레벨별 행동 수 가운데 중앙값이고, 사람보다 적게 움직여도 레벨 하나의 점수는 115%까지만 인정됩니다.
게임 점수는 뒤쪽 레벨일수록 가중치를 크게 매겨 평균을 냅니다. 마지막 레벨까지 끝내야 100%를 받을 수 있어서, 5레벨짜리 게임에서 넷째 레벨까지만 끝내면 아무리 효율적으로 풀어도 66.7%를 넘지 못합니다. 쉬운 앞 레벨을 빠르게 넘기는 것보다 어려운 뒤 레벨을 끝까지 푸는 쪽이 점수를 더 크게 움직입니다.
규칙이 하나 더 있습니다. 게임 상태를 바꾸는 입력만 행동으로 세고, 도구 호출이나 추론 단계, 재시도처럼 환경을 바꾸지 않는 내부 작업은 세지 않습니다. 버튼을 눌러 보며 규칙을 찾는 탐색은 점수에서 깎이지만, 콘솔 안에서 코드로 가설을 세우고 따져 보는 일은 깎이지 않습니다.
Prime Agent의 설계는 이 채점 방식과 잘 맞물립니다. 모델이 콘솔 안에서 관찰을 정리하고 계획을 세운 뒤 적게 움직일수록 점수가 오릅니다. 다만 그 생각에 드는 토큰은 청구서에 그대로 남고, Prime Intellect는 토큰 곡선과 함께 추정 API 비용에 따른 점수 곡선도 공개했습니다.
ARC-AGI-3 환경은 모두 135개이고 공개된 것은 25개입니다. 95.5%는 이 공개 세트에서 나온 자체 보고이고, ARC Prize가 검증한 기록이 아닙니다. 공개 세트와 나머지 세트의 차이는 이미 드러난 적이 있습니다. GPT-5.6 Sol은 공개 세트에서 13.33%를 받았지만, 외부에 공개하지 않은 세트에서는 7.78%에 그쳤습니다.
ARC Prize는 공개 세트에서만 100%를 받는 리플레이 하네스를 직접 공개하기도 했습니다. 공개된 게임은 미리 학습하거나 맞춰 둘 가능성을 완전히 배제할 수 없다는 점을 보여 준 사례였습니다. 25개를 푼 능력과 135개를 푸는 능력은 다른 문제이고, 지금 표에 실린 것은 25개의 결과입니다.
비교 조건도 완전히 같지는 않습니다. 표의 비교 대상 수치는 Prime Intellect가 잰 것이 아니고 공식 발표치입니다. 회사는 Opus 5를 Claude Code로, Sol을 Codex로 직접 돌려 보니 공식 결과보다 낮게 나와 공식 수치를 가져왔다고 적었습니다. 경쟁 조합에 유리한 숫자를 골랐다는 설명이지만, 실행 방식은 다릅니다. Prime Agent 쪽은 목표를 이룰 때까지 에이전트를 계속 다시 밀어 주는 자율 모드로 돌았고, 과제 안내문도 따로 다듬었습니다. 같은 조건의 비교는 ARC Prize가 비공개 세트로 검증한 뒤에 나옵니다.
Prime Intellect는 긴 문맥 검색부터 긴 출력, 긴 지시 수행, 긴 추론, 긴 코딩까지 아홉 개 과제에서도 Prime Agent를 다른 하네스와 비교했습니다. 폐쇄형 모델은 제 회사 하네스와, 오픈웨이트 모델 GLM-5.2는 서브에이전트를 켠 공개 하네스 Pi-mono와 맞붙였습니다.
| 모델 | 비교 상대 | Prime Agent가 앞선 과제 |
|---|---|---|
| Opus 5 | Claude Code | 9개 중 6개 |
| GPT-5.6 Sol | Codex | 9개 중 6개 |
| GLM-5.2 | Pi-mono(서브에이전트 사용) | 9개 중 8개 |
차이가 가장 크게 벌어진 곳은 긴 문맥 과제 OOLONG이었습니다. Sol은 Codex에서 0.500, Prime Agent에서 0.940을 받았습니다. 반면 Opus 5는 같은 과제에서 Claude Code 쪽이 0.920으로 Prime Agent의 0.900보다 조금 높았습니다.
오픈웨이트 조합을 폐쇄형 조합과 직접 견주면 결과가 섞입니다. GLM-5.2와 Prime Agent 조합은 긴 지시(ManyIH IF), 긴 추론(LongCot-Mini), 에뮬레이터 제작(EmulatorBench) 세 과제에서 Opus 5와 Claude Code 조합보다 높았고, 나머지 여섯 과제에서는 뒤졌습니다. OOLONG에서는 0.700 대 0.920으로 차이가 가장 컸습니다. 공개 가중치에 공개 하네스를 얹으면 폐쇄형과 겨룰 만하다는 것이 Prime Intellect의 주장인데, 표가 보여 주는 것은 일부 과제에서의 역전입니다.
EmulatorBench는 참고 구현 없이 Rust로 게임기 에뮬레이터를 처음부터 만드는 과제입니다. CPU 플래그나 화면 처리 장치의 타이밍처럼 실제 기기의 동작을 사람이 만든 진단 프로그램으로 대조해서, 학습 데이터에서 외운 답으로는 풀기 어렵게 짰습니다. Prime Agent는 세가 제네시스와 게임보이 컬러 에뮬레이터를 재현했고, 표의 점수는 에뮬레이터 16개를 만든 결과의 평균입니다. Opus 5 쪽 실행은 도구 호출 응답이 정상이었는데도 과제를 풀지 못했다고 Prime Intellect가 따로 적었습니다.
같은 자기수정 루프가 반대로 돈 기록도 발표에 함께 실렸습니다. 공장 건설 게임 Factorio에서 Prime Agent는 캐릭터 네 명을 서브에이전트로 움직이며 실패는 메모리로, 성공은 스킬로 바꿔 쌓았습니다. 쌓인 경험으로 설비 배치를 점점 효율적으로 짜면서 실행을 거듭할수록 점수를 올렸고, 몇 시간 만에 생산 점수를 10만 점대로 끌어올렸습니다.
그러다 게임 규칙을 통째로 우회하는 원격 관리자 명령(RCON)을 찾아내, 자원을 조립 기계 안에 직접 만들어 넣기 시작했습니다. 속이지 말라는 알림을 일정 간격으로 넣어 둔 상태에서 벌어진 일입니다. Prime Intellect는 정상적인 스킬을 쌓던 바로 그 개선 루프가 이번에는 효율적인 편법 스킬을 쌓기 시작했다고 적었습니다.

Prime Intellect가 이 사례에 붙인 화면에는 경과 시간 1시간 26분, 생산 점수 530만이 찍혀 있습니다. 정상 플레이로 몇 시간에 걸쳐 올린 10만 점대와는 자릿수부터 다릅니다. 스스로 고치는 능력과 규칙을 돌아가는 능력은 한 기능에서 나오고, 스킬 파일이 쌓이는 폴더가 곧 그 에이전트의 행동 규범이 됩니다. 규범이 언제 바뀌었는지는 파일을 열어 보기 전에는 알 수 없습니다.
Prime Intellect는 아직 어떤 모델도 Prime Agent에 맞춰 학습된 적이 없다고 밝혔습니다. 지금의 숫자는 서로 맞춰 본 적 없는 조합에서 나왔고, 실제로 돌려 보면 모델과 하네스 사이에 마찰이 남아 있다는 점도 숨기지 않았습니다. 회사는 모델과 하네스를 함께 학습시키는 방식이 새 능력을 여는 주된 길이 될 것이라고 봤고, 자세한 기술 보고서를 곧 내겠다고 했습니다.
국내 팀에게 이 결과는 절반만 반가운 소식입니다. 하네스 설계는 엔지니어 몇 명과 공개 저장소 하나로 시작할 수 있어서, 가중치 경쟁에 들어가지 못한 조직도 성능을 끌어올릴 수단을 얻습니다. 하지만 ARC-AGI-3 표가 보여 주듯 하네스의 효과는 밑에 깔린 모델의 능력만큼만 커집니다. GLM-5.2가 8.6%에 머문 것을 보면, 공개 가중치와 공개 하네스만으로 폐쇄형 최상위 조합을 따라잡았다고 말하기에는 아직 이릅니다.
같은 가중치가 실행 환경에 따라 30%에서 95%까지 오간다면, 모델 이름만 적힌 성적표로는 조건의 절반을 알 수 없습니다. 같은 주에 나온 메타의 코딩 성적표도 모델마다 자기 회사 실행 환경을 붙여 잰 조합이었고, 같은 모델의 Terminal-Bench 점수가 메타 측정으로는 82.9%, 독립 기관 측정으로는 80%였습니다.

기술 보고서에 비용과 실패 사례가 어디까지 실릴지, 그리고 95.5%가 ARC Prize의 비공개 세트 검증에서도 나올지가 다음 확인거리입니다. 발표 전문은 Prime Intellect의 Prime Agent 소개 글에, 코드는 Prime Agent GitHub 저장소에 있습니다.
읽어 주셔서 고맙습니다.
초이 드림