이 글 어땠어요?
절대 시간은 크게 틀립니다. 235개 과제에서 Claude Code(Fable 5)는 실제의 3배, Codex(GPT-5.6 Sol)는 7배를 예측했고, 짧은 과제일수록 오차가 컸습니다. 과제가 10배 길어져도 예측은 1.5~1.7배만 늘었습니다.
연구팀은 하네스를 원인으로 봤습니다. Claude Code는 풀렸다고 판단할 때까지 계속하고 Codex는 일정 시간에서 멈추는 경향이 있으며, 같은 GPT-5.6도 Claude Code에서 턴을 약 2.5배 썼습니다. ProgramBench 통과율은 65.1%와 60.5%로 비슷했습니다.
끝난 뒤의 회고는 경과 시간을 알려 주는 도구가 있으면 거의 매번 맞았고, 기록에서 타임스탬프를 지우면 오차가 두 배가 됐습니다. 시작 전 예측은 문서나 실행 환경을 더 줘도 나아지지 않았습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
9개 기관 연구진 33명이 75쪽 논문에서 자기개선 연구 491편을 다섯 단계로 나눴습니다. 개선 절차까지 고쳐 물려주는 L5는 29편이었고, 그 절차가 다음 세대를 더 잘 만든다는 효과는 아직 통계로 확인되지 않았습니다.

텐센트 Youtu Lab이 8월 28일 공개한 ContextPilot은 EMNLP 2026 본회의에 채택됐습니다. 평균 55만 토큰짜리 문서 더미에서 답을 찾는 BrowseComp+에서 원래 Qwen3-14B는 6.27점, ContextPilot은 55.50점이었습니다.
구글 리서치가 9월 24일 소개한 VQQA는 영상 평가를 질문 목록으로 바꿔 프롬프트를 고칩니다. CogVideoX-5B에서 T2V-CompBench 점수를 41.89%에서 53.46%로 올렸고, 평균 1.245번 수정에 VLM을 약 7.23번 불렀습니다.

9개 기관 연구진 33명이 75쪽 논문에서 자기개선 연구 491편을 다섯 단계로 나눴습니다. 개선 절차까지 고쳐 물려주는 L5는 29편이었고, 그 절차가 다음 세대를 더 잘 만든다는 효과는 아직 통계로 확인되지 않았습니다.

텐센트 Youtu Lab이 8월 28일 공개한 ContextPilot은 EMNLP 2026 본회의에 채택됐습니다. 평균 55만 토큰짜리 문서 더미에서 답을 찾는 BrowseComp+에서 원래 Qwen3-14B는 6.27점, ContextPilot은 55.50점이었습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.

그래프의 가로축은 실제로 걸린 시간, 세로축은 시작 전에 적은 예측입니다. 몇 초에서 1분 사이에 끝난 과제에도 5분이나 15분 같은 예측이 찍혀 있고, 예측과 실제가 비슷한 점은 한 시간 안팎을 넘는 과제에서 늘어납니다. 저자들은 오차가 짧은 과제에서 가장 크고, 여러 시간짜리 과제에 가서야 현실과 맞는다고 정리했습니다.
과제는 성격이 다른 시험에서 고루 뽑았습니다. 대학원 수준 과학 문제를 모은 GPQA 다이아몬드에서 60개, 인류의 마지막 시험(HLE)에서 18개, 웹을 돌아다니며 답을 찾는 AssistantBench에서 16개, 데스크톱 화면을 조작하는 OSWorld 2.0에서 8개를 가져왔고, 프로그램을 다시 짜는 ProgramBench와 알고리즘 대회형 ALE-Bench에서도 12개씩 골랐습니다. 벤치마크마다 붙어 있던 시간 제한과 예산은 모두 풀었습니다. 제한 없이 일할 때 에이전트가 원래 쓰는 시간을 보려는 설계입니다.
막심 안드리우셴코는 2024년 에이전트가 해로운 요청을 얼마나 수행하는지 재는 벤치마크 AgentHarm 논문의 제1저자입니다. 그때는 에이전트가 무엇을 하는지를 쟀고, 이번에는 에이전트가 자기가 얼마나 오래 일하는지 아는지를 쟀습니다.
ProgramBench는 컴파일된 실행 파일과 문서만 주고 같은 동작을 하는 프로그램을 처음부터 다시 짜게 하는 시험으로, 과제가 200개입니다. 사람에게는 몇 시간에서 며칠이 걸리는 일이지만 코딩 에이전트는 대개 몇 분에서 몇 시간 안에 끝냅니다. 실행 파일을 얼마나 더 찔러 볼지, 언제 디버깅을 멈출지를 에이전트가 스스로 정해야 해서, 연구팀은 이 시험에서 시간 판단이 그대로 드러난다고 봤습니다. 지시문은 출력 첫 줄에 예상 소요 분을 적고 과제를 시작하라는 것이었습니다.
첫 실험에는 Claude Code에 Opus 4.8을, Codex에 GPT-5.5를 넣었습니다. 아티피셜애널리시스 기준 출력 속도가 초당 62토큰과 81토큰으로 비슷하고 능력도 비슷한 두 모델인데, Opus 4.8은 평균 85분, GPT-5.5는 평균 17.5분을 일했습니다. 숨은 테스트 통과율은 65.1%와 60.5%로 4.6점 차이였습니다.
| 항목 | Claude Code(Opus 4.8) | Codex(GPT-5.5) |
|---|---|---|
| 평균 예측 | 99분 | 72분 |
| 평균 실제 시간 | 85분(10~177분) | 17.5분(5~38분) |
| 예측 ÷ 실제 | 1.16배 | 4.12배 |
| 실제의 1.5배 안에 든 예측 | 200번 중 128번 | 200번 중 2번 |
| 숨은 테스트 통과율 | 65.1% | 60.5% |
표의 Claude 쪽만 보면 시간을 꽤 맞힌 것처럼 보입니다. 한데 저자들은 이 정확도를 우연으로 봤습니다. 두 모델 모두 과제와 상관없이 한 시간 반 안팎을 적었고, Claude의 실제 평균이 마침 85분이라 그 숫자와 맞아떨어졌다는 분석입니다. Claude가 25분 안에 끝낸 실행만 따로 떼어 보면, 같은 과제에서 Codex와 같은 비율로 틀렸습니다.

예측이 실제를 얼마나 따라가는지는 로그 눈금에서 잰 기울기로 나타냈습니다. 저자들이 압축 지수라고 부른 이 값은 예측이 실제를 그대로 따라가면 1, 무엇을 맡기든 같은 숫자를 내면 0인데, Claude 0.24, Codex 0.19가 나왔습니다. 이 기울기라면 실제 시간이 10배로 늘 때 예측은 1.5~1.7배 느는 데 그칩니다. 저자들은 에이전트가 「이런 과제는 보통 얼마나 걸리나」에는 답해도 「이번 실행에 내가 얼마나 걸리나」에는 답하지 못한다고 적었습니다.
속도와 실력이 비슷한 두 모델의 실행 시간이 5배 벌어진 이유를 저자들은 하네스와 노력에서 찾았습니다. 하네스는 모델에 도구와 지시, 작업 절차를 붙여 실제 일을 시키는 실행 틀입니다. 실행 시간의 80% 넘게가 모델이 생각하고 글을 생성한 시간이었고, 도구 응답을 기다린 시간은 그 나머지였습니다. Claude Code 하네스는 모델을 바꿔 넣어도 Codex보다 턴을 2.5배 많이 썼고, 같은 GPT-5.6을 두 하네스에 번갈아 넣은 실험에서도 그 배율이 나왔습니다.
멈추는 방식도 달랐습니다. 예측과 실행을 다른 턴으로 나눈 두 번째 실험에서는 그사이 나온 Opus 5와 GPT-5.6 Sol을 썼는데, Sol은 과제가 복잡하든 단순하든 30분쯤 일하고 멈췄습니다. 앞 실험의 GPT-5.5는 17분 근처에서 멈췄습니다. Claude Code의 Opus 5는 중앙값 93분을 일했고, 첫 턴 정확도도 96.8%로 Sol의 82.0%보다 높았습니다.
예측 쪽은 하네스를 타지 않았습니다. 같은 모델을 Claude Code와 Codex에 번갈아 넣고 세 번씩 물었더니, Fable 5는 어느 하네스에서든 20% 안쪽에서 같은 숫자를 냈습니다. Sol은 반복할 때마다 흔들림이 Fable의 2.5배였지만 하네스에 따라 달라지지는 않았습니다. 문서를 붙여 주거나 샌드박스에서 실행 파일을 직접 찔러 보게 해도 예측은 나아지지 않았고, Sol은 정보를 더 줄수록 예측이 길어졌습니다.
하네스 하나가 결과를 크게 바꾼 기록은 점수에서도 나왔습니다. 릴리안 웽이 소개한 연구에서는 모델을 그대로 두고 하네스만 고쳐 SWE-bench 점수가 20%에서 50%로 올랐고, 메타는 8월 Muse Code를 자기 하네스로 잰 점수를 냈다가 같은 실행 틀로 잰 독립 평가와 차이가 났습니다. 이번 측정에서는 같은 차이가 작업 시간에서 나왔습니다.
에이전트가 예측할 때 누구를 기준으로 삼는지도 따졌습니다. 연구팀은 235개 과제를 글로만 주고 「이 과제를 끝내는 데 당신이 / 최전선 AI 에이전트가 / 숙련된 인간 전문가가 얼마나 걸리겠는가」를 바꿔 가며 새 세션 4,100개에서 물었습니다. 「끝내다」에 해당하는 동사를 complete에서 finish로 바꾸는 것만으로도 예측이 10% 안팎 움직였고, 「숙련된 인간 전문가」를 「인간 전문가」로 바꾸면 3% 안쪽에서 움직였습니다. 누구를 묻느냐에 따른 차이는 이보다 훨씬 컸습니다.
| 누가 하나 | Claude Code(Fable 5) | Codex(GPT-5.6 Sol) |
|---|---|---|
| 당신(에이전트 자신) | 7.5분 | 13.5분 |
| 최전선 AI 에이전트 | 9.9분 | 15.6분 |
| 숙련된 인간 전문가 | 32.1분 | 35.8분 |
과제별 예측의 기하평균입니다(출처: 오펜겐덴·안드리우셴코).
두 에이전트 모두 인간 전문가에게는 자신보다 3~4배 긴 시간을 줬고, 최전선 AI 에이전트보다는 자기가 조금 빠르다고 봤습니다. 짧은 과제에서는 사람보다 빠르다고 주장하지 않다가, 과제가 길고 무거워질수록 그 차이를 10배까지 벌렸습니다. 예외는 데스크톱 화면을 마우스와 키보드로 다루는 OSWorld로, 두 에이전트 모두 인간 전문가가 코딩 에이전트보다 낫다고 답했습니다.
가장 큰 차이는 LuaJIT(루아 언어를 빠르게 돌리는 JIT 컴파일러)를 다시 구현하는 과제에서 나왔습니다. Fable 5는 자기에게 480분, 사람에게 24만 분을 줬고 Codex는 240분 대 25만 분을 적었습니다. 24만 분은 4,000시간으로, 하루 8시간씩 일하면 500일입니다. 사람을 묻는 질문에는 그 과제를 처음 해낸 실존 인물의 이름을 대는 경우도 있었는데, 정작 자기 예측을 적을 때는 자기가 AI라는 말 없이 해야 할 기술 단계만 늘어놓았습니다.
사람의 시간 예측에도 잘 알려진 편향이 있습니다. 대니얼 카너먼과 아모스 트버스키가 1979년 이름 붙인 계획 오류는 자기 일에 걸릴 시간을 지나치게 짧게 잡는 경향입니다. 1994년 한 실험에서 심리학과 학생 37명은 졸업논문을 끝내는 데 평균 33.9일이 걸린다고 답했고, 모든 일이 최악으로 꼬이는 경우를 물어도 48.6일이라고 했는데, 실제로는 평균 55.5일이 걸렸습니다. 예상한 기간 안에 끝낸 학생은 30% 안팎이었습니다.
이 편향은 자기 일을 예측할 때만 나타나고, 남의 일을 예측하는 바깥 관찰자는 오히려 시간을 길게 잡는 쪽으로 기웁니다. 에이전트는 자기 일을 예측하면서 바깥 관찰자처럼 길게 잡았고, 사람의 일을 물으면 그보다 더 길게 잡았습니다. 1868년 카를 폰 피어오르트(Karl von Vierordt)가 기록한 시간 지각 법칙은 짧은 시간은 길게, 긴 시간은 짧게 어림한다는 것인데, 짧은 과제에서 오차가 가장 크다는 이번 결과와 방향이 같습니다.
저자들은 에이전트의 시간 감각이 어디서 오는지도 짚었습니다. 코딩 에이전트를 훈련하는 데이터에는 도구 호출 기록이 많고, 그 기록에는 타임스탬프와 시간 단서가 가득합니다. 그래서 모델은 시계가 없어도 도구 호출 하나가 보통 얼마나 걸리는지는 잘 알지만, 자기 사고 과정이 얼마나 길어질지는 예측하지 못하고 자기 생성 속도도 낮게 잡는 경향이 있다고 적었습니다. 실행 시간의 80% 넘게가 생각과 생성에 쓰이니, 생성 속도를 낮게 잡으면 예측도 그만큼 길어집니다.
지나간 시간을 묻는 회고는 사정이 달랐습니다. 연구팀은 과제를 마친 세션을 그대로 복제해 얼마나 걸렸는지 물으면서 단서를 하나씩 뺐습니다. 경과 시간을 알려 주는 도구를 쥐여 주면 거의 매번 맞혔고, 평소 도구만 두면 몇 퍼센트 틀렸고, 도구를 모두 끄면 조금 더 틀렸습니다. 대화 기록을 재구성해 하네스 없이 API로만 넣으면 크게 나빠졌고, 기록에서 타임스탬프와 시각 언급을 모두 지우면 오차가 두 배가 됐습니다.
에이전트가 기댄 단서는 기록 곳곳에 있었습니다. 도구가 끝날 때 찍히는 「2.34초 만에 완료」 같은 경과 시간, ls -la 명령이 출력하는 파일 날짜, git 로그와 빌드 로그의 시각, 「이건 10분쯤 걸릴 것」 같은 자기 추론 가운데 하나 이상이 모든 세션에 남아 있었습니다. 저자들은 많은 에이전트가 세션 내내 자기 기록에서 시계 값을 캐냈다고 적었습니다.
기록의 길이만 세는 단순한 방법과도 겨뤘습니다. Claude Code 실행 200건에서 끝난 뒤 에이전트가 보고한 시간과 실제 시간의 상관계수는 0.86이었는데, 화면에 보인 사건 수만 센 값은 0.91이었습니다. Codex는 사후 보고 0.48, 사건 수 0.52로 둘 다 낮았습니다. 기록 길이의 영향을 빼고도 세션 안 회고에 0.4의 상관이 남아, 저자들은 에이전트가 토큰 수만 세는 것은 아니라고 봤습니다. 회고 조건을 어떻게 바꾸든 과제 사이의 길이 순서는 유지됐습니다.
| 실제 시간과의 상관계수 | Claude Code | Codex |
|---|---|---|
| 시작 전 예측 | 0.41 | 0.17 |
| 끝난 뒤 보고 | 0.86 | 0.48 |
| 화면에 보인 사건 수 | 0.91 | 0.52 |
| 채점용으로 압축한 기록 길이 | 0.91 | 0.62 |
로그 값의 피어슨 상관계수이고, 하네스마다 실행 200건입니다(출처: 오펜겐덴·안드리우셴코).
통제된 실험 밖의 기록도 있습니다. AI Digest가 운영하는 AI Village는 최전선 에이전트들이 컴퓨터를 다루며 함께 일하는 환경으로, 2025년 4월부터 매주 과제를 돌려 왔습니다. 이 기록에서 에이전트들은 타임스탬프가 보일 때 작업 시간을 정확히 맞혔지만, 스스로 쉬기로 한 대기 6,070번에서는 추정과 실제의 차이가 기하평균으로 두 배를 넘었습니다.
시간 추정은 에이전트 사이에서 옮아가기도 했습니다. 다른 모델의 추정을 본 에이전트의 다음 추정은 그 숫자의 2분 안쪽에 떨어졌는데, 조건을 맞춘 비교군에서는 그 차이가 19분이었습니다. 한 번은 한 모델이 「80분 넘게」 일했다고 했는데 실제 경과 시간은 74분이었고, 두 번째 에이전트가 25초 만에 그 숫자를 확인해 주자 세 번째 에이전트가 그대로 물려받았습니다.
연구팀은 시간과 함께 점수 감각도 쟀습니다. 같은 턴 실험에서 작업을 마치기 직전 스스로 매긴 점수(0~100)를 적게 했더니, 채점 결과를 보지 못한 Opus 4.8과 GPT-5.5는 실제보다 평균 20점과 21점 높게 적었습니다. 자기 점수와 실제 점수의 상관은 0.28과 0.29에 그쳤고, 실패한 실행에도 높은 점수를 줬습니다.
다음 세대에서는 방향이 갈렸습니다. 과제를 마친 뒤 별도 턴에서 얼마나 잘했는지 묻자 Sol은 자기 성적을 꾸준히 높게 봤고, 실제로는 50%를 넘지 못한 실행 여러 건에 90점대 중반을 줬습니다. Opus 5는 반대로 대부분 10점 넘게 낮춰 적었고, 99.5%와 96.7%를 받은 실행에 86점을 줬습니다. 평균으로는 Opus 5가 11~15점 낮게, Sol이 7점 높게 적었고, 저자들은 지금까지 시험한 모델 가운데 자기 성적을 낮게 보는 모델은 Opus 5가 유일하다고 밝혔습니다.
일이 잘못된 것을 알아챈 경우에도 얼마나 잘못됐는지는 몰랐습니다. PHP 인터프리터 소스(php-src)를 다시 짜는 과제에서 두 모델은 실행이 나빴다는 것까지는 알고 나란히 70점쯤을 적었지만, 실제 점수는 7%와 14.5%였습니다.
저자들이 이 실험을 시작한 이유는 에이전트에게 맡기는 일이 길어지고 있어서입니다. 저자들은 METR 측정을 들어 최전선 모델이 17시간짜리 과제를 절반의 확률로 푼다고 적으면서, 그 시간은 바깥에서 잰 값이라고 덧붙였습니다. 「이 과제를 30분 안에 끝내 줘」나 「회의에 다녀올 테니 두 시간 동안 계속 다듬어 줘」 같은 지시를 지키려면 에이전트가 자기가 얼마나 일했고 얼마나 남았는지를 알아야 하는데, 지금의 평가는 이 능력을 재지 않는다는 것이 저자들의 문제의식입니다.

Claude Code와 Codex를 쓰는 개발자에게 바로 걸리는 숫자도 몇 개 있습니다. 계획 단계에서 에이전트가 적는 예상 시간은 짧은 과제일수록 크게 부풀려져 있고, 과제가 10배 길어져도 예측은 1.5~1.7배밖에 늘지 않았습니다. 같은 모델도 Claude Code에 넣으면 Codex보다 턴을 2.5배 썼고, 경과 시간을 알려 주는 도구가 있을 때 회고는 거의 정확했습니다. 여러 에이전트에게 추정을 받아 평균을 내는 방식은, AI Village 기록대로라면 서로의 숫자를 본 뒤에는 독립된 추정이 되지 못합니다.
저자들의 다음 실험은 정해 준 시간을 지키는 능력입니다. 원래 걸린 시간의 0.25배·0.5배·2배·4배 같은 시간을 정해 주는 방안을 적었고, 모델과 하네스, 시계 접근을 하나씩 바꿔 가며 「N분만 일해」라는 지시를 지키는지 잴 계획입니다. 이들은 이 능력을 감시 가능성과 연결했습니다. 올해 3월 나온 CoT-Control 논문은 추론 모델이 사고 과정을 지시대로 통제하는 비율이 낮다고 밝혔는데(Claude Sonnet 4.5는 사고 과정 2.7%, 최종 출력 61.9%), 그 비율은 모델이 클수록 높고 강화학습을 더 할수록 낮았습니다. 저자들은 시간 통제 능력이 낮게 머무는 동안은 에이전트를 감시하기 쉬운 상태가 이어지고, 그 능력이 올라갈 때를 대비해 잴 도구를 먼저 만들겠다고 밝혔습니다.
저는 이 연구에서 마지막 대목이 가장 오래 남았습니다. 지금은 무엇을 맡겨도 한 시간 반을 적는 어수룩한 답이라 웃어넘길 수 있지만, 자기가 얼마나 일했는지 아는 모델은 보여 주고 싶은 속도를 골라 보여 줄 수도 있습니다. 시계 도구 하나로 회고가 거의 정확해졌다는 이번 결과를 보면, 그 감각을 갖추는 데 오랜 시간이 걸리지 않을 수도 있습니다.
연구팀은 실험 세부와 세션 기록, 재구성한 대화를 허깅페이스와 깃허브에 공개하고 실험을 더한 논문을 낼 예정이라고 밝혔습니다. 지금 나온 것은 LessWrong에 올린 중간 보고이고, 실험에 쓴 조합은 Claude Code와 Codex 두 하네스에 모델 다섯 개입니다.
읽어 주셔서 고맙습니다.
초이 드림