이 글 어땠어요?
사람과 에이전트가 각각 돈을 쓸 때의 성과 곡선이 만나는 지점의 금액입니다. 에이전트의 토큰·GPU 비용과 사람 인건비를 같은 달러로 놓고, 그 지점까지는 에이전트가, 그 뒤로는 사람이 더 효율적이라고 봅니다.
상위 기여자 두 명의 인터뷰와 LLM 채점관의 추정을 합쳐 1% 개선에 16시간이 든다고 보고, 시급 150달러를 곱해 어림한 값입니다. METR은 실제 비용이 이보다 훨씬 높거나 낮을 수 있다고 밝혔습니다.
원래 기록에서는 개선이 있는 듯 보였지만, METR이 해법을 40번 넘게 다시 돌려 확인하자 기준선보다 빨라진 것이 없었습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
MATS 연구원 마이클 오펜겐덴과 막심 안드리우셴코가 8월 14일 Claude Code와 Codex의 시간 감각을 잰 결과를 공개했습니다. 235개 과제에서 Fable 5는 실제의 3배, GPT-5.6 Sol은 7배를 예측했고, 짧은 과제일수록 오차가 컸습니다.
.png)
영국 AI보안연구소가 8월 4일 공개한 사이버 평가에서 에이전트가 실재하는 깃허브 저장소에 악성 코드를 올린 뒤 부계정으로 편들고, 지적을 받자 이력을 덮어쓰고 사과했습니다. 사람을 겨냥한 기만을 지시 없이 관측한 첫 공개 사례입니다.
구글 리서치가 9월 24일 소개한 VQQA는 영상 평가를 질문 목록으로 바꿔 프롬프트를 고칩니다. CogVideoX-5B에서 T2V-CompBench 점수를 41.89%에서 53.46%로 올렸고, 평균 1.245번 수정에 VLM을 약 7.23번 불렀습니다.

MATS 연구원 마이클 오펜겐덴과 막심 안드리우셴코가 8월 14일 Claude Code와 Codex의 시간 감각을 잰 결과를 공개했습니다. 235개 과제에서 Fable 5는 실제의 3배, GPT-5.6 Sol은 7배를 예측했고, 짧은 과제일수록 오차가 컸습니다.

영국 AI보안연구소가 8월 4일 공개한 사이버 평가에서 에이전트가 실재하는 깃허브 저장소에 악성 코드를 올린 뒤 부계정으로 편들고, 지적을 받자 이력을 덮어쓰고 사과했습니다. 사람을 겨냥한 기만을 지시 없이 관측한 첫 공개 사례입니다.
.png)
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@METR_EvalsX 게시물 · 원문 보기
METR은 한국 시각 22일 새벽 공식 X 계정에 이 개념도를 올렸습니다. 사람과 에이전트가 각각 돈을 쓸 때 성과가 어떻게 오르는지 곡선을 그리고, 두 곡선이 만나 사람에게 맡기는 편이 더 싸지기 시작하는 지점을 그 에이전트의 지출 지평으로 부르자는 제안입니다. METR의 그림에서 에이전트는 처음에 쉬운 개선을 빠르게 주워 담아 앞서 나가다가 곧 평평해지고, 사람은 꾸준히 올라갑니다. 지출 지평이 클수록 에이전트가 사람보다 효율적인 구간이 깁니다.
METR의 발표가 나온 주에는 AI가 AI 연구를 스스로 해낸다는 소식이 잇달아 나왔습니다. 7월 14일 Weco AI는 연구 에이전트를 다른 에이전트가 8일 동안 고쳐 쓰게 한 실험에서 사람이 2년 다듬은 에이전트를 앞섰다고 밝혔습니다. 7월 21일에는 텐센트가 연구 에이전트 Hyra가 수학 문제 55개 중 29개에서 기록을 넘었다고 발표하면서 점수만 따 낸 해법 두 건을 함께 적었습니다.
AI가 연구 속도를 얼마나 올리는지에 대한 숫자도 쌓여 있었습니다. METR이 글머리에 정리한 바로는, 앤트로픽의 Mythos Preview 시스템 카드에 연구자들이 스스로 답한 생산성 향상이 약 4배, METR의 5월 사용 조사에서는 약 2배였습니다. 앤트로픽은 Mythos가 병합된 코드 줄 수를 8배로 늘렸다고 했고, 내부 응답자 18명 중 4명은 작업 틀을 3개월쯤 다듬으면 Mythos Preview가 신입 연구원을 대신할 수 있다고 봤습니다. METR은 이 숫자들이 모두 자기 보고이거나 코드 양이라 연구 속도로 옮기기 어렵다고 적었습니다.
METR이 지금까지 쓴 대표 지표는 AI가 절반 확률로 끝내는 과제의 길이를 사람 작업 시간으로 재는 시간 지평입니다. 시간 지평은 과제마다 성공과 실패만 기록하고, 에이전트에게 토큰이나 실험용 연산을 얼마나 쓰게 할지는 정해 두지 않습니다. 지출 지평은 점수가 연속으로 매겨지는 최적화 문제를 골라, 사람의 인건비와 에이전트의 토큰·GPU 비용을 같은 달러 단위로 놓고 비교합니다.
시험장으로 고른 NanoGPT 스피드런은 GPT-2 소형 모델(1억 2,400만 파라미터)을 H100 GPU 8장으로 학습시켜, 따로 떼어 둔 FineWeb 데이터에서 교차 엔트로피 손실 3.28에 닿기까지의 시간을 겨루는 공개 대회입니다. 하드웨어와 목표 손실은 고정하고 모델 구조, 옵티마이저, 하이퍼파라미터, 시스템 최적화는 마음대로 바꿀 수 있습니다. 2024년 5월 약 45분이던 기록은 2026년 4월까지 기록이 82개 쌓이는 동안 2분 아래로 내려왔습니다.

METR이 이 대회를 고른 이유는 프런티어 사전학습과 닮았기 때문입니다. 지금 여러 대형 모델이 쓰는 Muon 옵티마이저가 원래 이 대회에서 처음 나왔습니다. METR이 인용한 파커 휫필의 계산으로는 지금의 스피드런 방식으로 GPT-2를 다시 학습하면 2019년보다 707배 빠르고, 그중 같은 장비에서 초당 연산이 15배, 같은 손실에 필요한 연산량이 46분의 1로 줄었습니다.
에이전트는 이미 이 대회에 들어와 있습니다. METR이 4월에 낸 분석에 따르면 2025년 말부터 2026년 초까지 공식 기록 네 개에 사람과 함께 AI 에이전트가 기여자로 올랐습니다. Hiverge, Intology의 Locus, Aster Lab의 Aster, Dualverse AI의 Station으로, 모두 범용 코딩 도구가 아닌 연구용으로 따로 만든 시스템입니다. Station은 컴파일된 코드가 설정값 하나(window_size)를 몇 달째 무시하고 있던 버그를 찾아냈는데, 사람들이 놓친 버그였습니다.
METR은 글에서 이런 물음을 스스로 던집니다. 1,000달러로 사람보다 잘하는 에이전트라면 두 번 돌려 두 배를 얻으면 되지 않느냐는 물음입니다. 답은 이 연구의 첫 저자 톰 커닝햄이 3월에 내놓은 사과 따기 모형에서 나옵니다. 에이전트가 찾을 수 있는 개선의 종류가 정해져 있다면 에이전트는 낮게 달린 사과부터 빠르게 따서 적은 예산에서는 사람을 앞서고, 딸 사과가 줄어든 큰 예산에서는 뒤처집니다. 사람과 견준 에이전트의 성적은 사람이 그동안 들인 돈과는 상관없고, 에이전트들이 그 문제에 이미 들인 돈에 따라 달라진다는 예측도 이 모형에서 나옵니다.
이번 출발점인 78번 기록에도 이미 에이전트의 손길이 들어 있습니다. 72번 기록이 AI가 만든 것이어서, METR은 사람만 다듬은 코드에서 출발할 때보다 에이전트의 성과가 작게 나올 것으로 예상했습니다.
에이전트를 잴 눈금은 사람 쪽에서 나옵니다. METR은 기록 25개를 세운 상위 기여자 두 명을 인터뷰했습니다. 두 사람의 기록은 전체 82개의 30%, 누적 속도 향상의 12%를 차지합니다. 이들이 세운 기록 가운데 6개에 들인 시간을 물었더니 합계 약 142시간이었고, 이 6개가 학습 시간을 9.8% 줄였습니다. 1%포인트에 약 14시간이 들었고, METR은 LLM 채점관(Opus 4.6)이 모든 기록을 보고 추정한 시간을 이 인터뷰 값으로 보정해 1% 개선에 16시간이라는 기준을 잡았습니다.
시급은 150달러로 잡았습니다. 연봉 30만 달러를 시간으로 나눈 값으로, METR은 신입 AI 연구원의 출발 연봉으로 무리가 없다고 봤습니다. 16시간에 150달러를 곱한 2,400달러를 어림해 1% 개선의 사람 비용은 약 2,500달러가 됐고, 2024년 5월부터 2026년 4월까지 사람이 이 대회에 들인 노동은 약 1,650시간, 돈으로 약 25만 달러로 추산됐습니다.

인터뷰에는 숫자 밖의 이야기도 있었습니다. 기여자들은 시간 대부분을 실패한 아이디어에 썼고, 기록 하나의 실마리를 찾기까지 20시간쯤 만지작거린 경우도 있었습니다. 두 사람이 모든 기록에 쓴 GPU 비용은 각자 3,000~4,000달러였고, 실험은 주로 H100 한 장이나 구글 코랩에서 돌렸습니다. METR이 사람 쪽 비용에서 GPU를 빼고 인건비만 센 이유입니다.
병목은 아이디어였고, 컴퓨트는 병목이 아니었습니다.— NanoGPT 스피드런 상위 기여자, METR 인터뷰
METR은 에이전트 여섯을 3월에 세워진 78번 기록(학습 시간 85.56초)에서 출발시켰습니다. 모델마다 클라우드 Modal에서 H100 노드 4개(GPU 32장)를 줬고, 한 번 실행에 5일 동안 모델 API 비용과 GPU 비용을 합쳐 최대 1만 달러까지 쓰게 했습니다. 에이전트가 덜 해 놓고 일찍 끝났다고 선언하는 일이 잦아, 큰 토큰 한도에 닿을 때까지 계속하도록 하네스가 독려했습니다. 비용의 70~90%는 에이전트가 돌린 실험이었습니다.
에이전트가 기록을 줄였다고 주장한 해법은 METR이 40번 넘게 다시 돌려 확인했습니다. 학습 시간은 실행마다 들쭉날쭉해서, 원래 기록만 보면 여섯 모델 모두 무언가를 해낸 것처럼 보였습니다. 다시 재자 GPT-5와 Claude Opus 4.1은 잡음만 쫓았고 실제 개선이 없었습니다.
@METR_EvalsX 게시물 · 원문 보기
| 모델 | 지출 지평 | 다시 잰 개선 |
|---|---|---|
| Claude Opus 4.8 | 3,333달러 | 약 1.5% |
| GPT-5.5 | 2,347달러 | 약 1% |
| GPT-5.2 | 840달러 | 1% 미만 |
| Claude Opus 4.5 | 613달러 | 1% 미만 |
| GPT-5 | 0달러 | 의미 있는 개선 없음 |
| Claude Opus 4.1 | 0달러 | 의미 있는 개선 없음 |
가장 좋은 두 모델이 다시 잰 개선은 1~1.5%로, METR은 사람 기여 한두 개에 해당한다고 적었습니다. 사람들이 같은 대회에 들인 25만 달러와 견주면 Opus 4.8의 3,333달러는 1.3% 남짓입니다. METR은 자율 최적화가 지금까지 NanoGPT의 연구 속도에 준 영향은 아주 작다고 결론 내렸습니다.
비용 쪽 단서도 METR이 직접 달았습니다. 에이전트에게 H100 노드 4개를 계속 열어 줘서 실험을 비효율적으로 많이 돌렸을 가능성이 크고, 하네스를 다듬으면 같은 개선을 더 싸게 얻을 수 있다는 설명입니다. 다만 곡선을 왼쪽으로 옮겨도 지출 지평이나 최대 속도 향상이 크게 달라지지는 않을 것으로 봤습니다.

METR은 대회 관리자에게 두 최신 모델의 주요 수정을 하나씩 평가받았습니다. 아래 표는 METR이 공개한 수정 10개 가운데 속도 향상이 큰 6개를 옮긴 것입니다.
| 모델 | 주요 수정 | 속도 향상 | 관리자 판정 |
|---|---|---|---|
| Opus 4.8 | 학습 일정 1,450스텝을 1,390스텝으로 압축하고 마지막 긴 문맥 단계에 비중을 더 줌 | 0.6~0.8% | 병합 가능, 좋은 최적화 |
| Opus 4.8 | 3단계의 짧은 어텐션 창을 5블록에서 3블록으로 | 약 0.6% | 병합 가능, 일반성 낮음 |
| Opus 4.8 | 목표에 닿을 때까지 일정 끝을 넘겨 학습 | 0.55% | 거절, 깨지기 쉬운 최적화 |
| GPT-5.5 | 마지막 손실 확인에 출력 헤드(lm_head) 가중치의 지수이동평균 사용 | 0.5% | 병합 가능, 좋은 최적화 |
| GPT-5.5 | 손실이 목표에서 0.001 안으로 들어오면 MLP를 얼려 큰 행렬 연산 두 개를 건너뜀 | 0.5% | 거절, 깨지기 쉬운 최적화 |
| GPT-5.5 | 데이터 로더를 다시 짜 GPU로 데이터를 넣는 방식 개선 | 0.4% | 병합 가능, 좋은 최적화 |
관리자는 에이전트 아이디어의 약 70%를 병합할 만하다고 봤습니다. 한데 속도 향상분으로 따지면 병합할 만한 비율은 Opus 4.8이 약 60%, GPT-5.5가 약 50%로 내려가고, 하이퍼파라미터 조정 같은 탐색이 대부분이라 새로움은 낮다고 평가했습니다. 사람 기여는 구조나 시스템을 바꾸는 경우가 많아 다른 모델에도 옮겨 쓸 수 있는 반면, GPT-5.5는 연장 길이와 이동평균 계수, 검증 주기를 바꾼 변형을 약 650개 쏟아냈고, Opus 4.8도 마지막으로 채택된 수정 뒤에 창 크기와 학습률, 옵티마이저 설정 수십 가지를 훑었습니다.
대부분 설정값을 이리저리 돌려 본 수정이라 병합은 되겠지만, 다른 모델을 돕는 데는 덜 쓸모가 있습니다.— NanoGPT 스피드런 관리자, METR 보고서
좋은 수정도 있었습니다. 관리자는 GPT-5.5의 데이터 로더 개편을 이번 묶음에서 가장 멋진 수정으로 꼽았는데, 모델이 학습 로그에서 스텝별 시간을 직접 재 보고 찾아낸 시스템 최적화였습니다. Opus 4.8이 다시 잰 개선의 대부분은 학습 일정을 압축해 목표에 60스텝쯤 일찍 닿게 만든 수정에서 나왔습니다.
거절된 수정에는 공통점이 있었습니다. 첫 검증 단계에서 목표 손실에 닿자마자 학습을 끊거나, 손실이 목표 근처에 오면 계산 일부를 건너뛰는 식입니다. 목표 손실에 닿는 순간만 재는 채점 방식의 빈틈을 노린 해법으로, METR은 이를 보상 해킹의 한 형태로 봤습니다. 관리자는 학습 막바지에 가중치를 얼리는 기법 자체는 합리적이지만 지금 형태는 목표값에 지나치게 맞춰져 있어 거절한다고 했습니다.

METR은 처음 만든 과제에서 에이전트들이 부정행위를 시도하는 것을 보고 시험장을 고쳤습니다. 지금은 에이전트가 고칠 수 있는 파일과 고칠 수 없는 파일을 나누고, 시간 재기는 보호된 실행기가 맡습니다. 모델은 손실값 대신 출력값(로짓)만 내놓고 손실은 보호된 검증기가 계산하며, 학습 시작 전에는 미리 학습된 가중치를 몰래 넣지 않았는지 검사합니다. 같은 날 영국 AI보안연구소는 프런티어 모델 다섯이 모두 사이버 평가에서 부정행위를 시도했다는 분석을 냈고, METR은 6월 26일 GPT-5.6 Sol 사전 평가에서 지금까지 본 것 가운데 가장 높은 부정행위 비율을 보고한 바 있습니다.
METR이 출발점을 3월 기록으로 늦춘 데도 이유가 있었습니다. 처음에는 2024년 11월의 5분짜리 12번 기록에서 출발시켰는데, Opus 4.7(학습 데이터 기준 2026년 1월)과 Opus 4.8(2026년 5월)이 그 뒤에 나온 13번, 14번, 18번 기록의 기법을 이름까지 대며 알고 있었습니다. Opus 4.7은 실행 중에 알려진 스피드런 개선을 적용하겠다며 14번 기록의 기법을 그대로 넣었고, GPT-5.5(2025년 12월)도 18번, 22번, 24번 기록과 아주 비슷한 최적화를 썼습니다.
78번 기록 이후의 기록을 같은 방식으로 물었을 때는 Opus 4.8을 포함해 아는 모델이 없었습니다. 그래도 METR은 오픈AI와 앤트로픽이 NanoGPT로 모델을 학습시켰는지 공개하지 않아 확신할 수 없다고 적었습니다. 개발사가 이 문제로 따로 학습시켰다면 단기 성적은 실제보다 좋게 나옵니다.
지출 지평은 사람의 1% 개선을 얼마로 치느냐에 크게 흔들립니다. METR은 1% 개선에 1,000달러(쉬움), 2,500달러(보통), 1만 달러(어려움)를 넣어 두 모델의 지평을 다시 계산했습니다.
| 사람의 1% 개선 비용 | Opus 4.8 | GPT-5.5 |
|---|---|---|
| 1,000달러 | 120달러 | 160달러 |
| 2,500달러 | 3,300달러 | 2,300달러 |
| 1만 달러 | 1만 4,400달러 | 9,400달러 |
같은 Opus 4.8의 지평이 가정에 따라 120달러에서 1만 4,400달러까지 120배 벌어지고, 1,000달러 기준에서는 GPT-5.5가 Opus 4.8을 조금 앞섭니다. METR은 모델 순서는 대체로 유지된다고 보고, 지평의 절대 금액보다 모델끼리 견주는 척도로 쓰자고 했습니다. 모델들이 비용을 늘릴 때 개선이 늘어나는 비율이 비슷하다면, 사람 비용을 일정 비율로 키우거나 줄여도 모델 사이의 상대적 크기는 유지된다는 것이 METR의 설명입니다.
이 표는 사람 시급이 다른 조직에도 그대로 옮겨 볼 수 있습니다. METR의 시급 150달러는 연봉 30만 달러짜리 신입 AI 연구원을 가정한 값입니다. 연구원 시급이 그보다 낮은 조직이라면 사람의 1% 개선 비용이 내려가고, 같은 에이전트 곡선이 사람 곡선과 더 일찍 만나 지출 지평이 짧아집니다. 에이전트의 토큰값과 GPU값은 어느 나라에서 쓰든 같은 달러 가격표로 청구됩니다.
이번 측정이 다루지 않은 것도 있습니다. METR이 가장 최근 모델로 쓴 것은 Opus 4.8과 GPT-5.5이고, 7월 9일 정식 출시된 GPT-5.6 Sol은 들어 있지 않습니다. 모델마다 실행은 한 번씩이었고, 문제도 NanoGPT 하나입니다. METR은 여러 어려운 최적화 문제에서 지출 지평을 재는 편이 이상적이라고 적었습니다.
사람이 AI의 도움을 받으며 일하는 하이브리드 방식도 재지 않았습니다. METR은 사람이 AI를 잘 쓰면 하이브리드 곡선이 사람 혼자나 에이전트 혼자보다 위에 있을 것으로 예상하면서도, 하이브리드가 사람 혼자보다 못했던 자체 연구 결과도 함께 적었습니다. 사람에게 AI를 쥐여 준 실험과 쥐여 주지 않은 실험을 비교하는 일은 조직하기 어렵지만 아주 많은 것을 알려 줄 실험이라고 했습니다.
METR의 정의에는 끝나는 지점도 들어 있습니다. 지출 지평은 에이전트의 성과가 사람보다 빨리 꺾인다는 가정 위에서만 정의되고, 예산을 늘려도 에이전트의 성과가 꺾이지 않으면 교차점이 사라집니다. METR은 그런 일이 프런티어 AI 연구 전반에서 일어나면 여러 연구소의 책임 있는 확장 정책이 말하는 AI 연구 자동화에 이른 것이라고 적었습니다. 7월의 NanoGPT에서 그 교차점은 3,333달러에 있었습니다.
읽어 주셔서 고맙습니다.
초이 드림