이 글 어땠어요?
아닙니다. 3.1은 8시간 근무일로 환산한 에이전트 가동량이 사람의 3.1배라는 숫자이고, 오픈AI도 연구는 여러 단계가 모두 맞아야 나아가서 전체 진전 속도는 이 지표를 따라가지 못할 가능성이 높다고 적었습니다.
오픈AI는 숙련 연구자가 며칠 걸릴 과제를 포함해 잘 정의된 연구 과제를 사람의 지시 아래 해내는 시스템을 인턴으로 정의했습니다. 32~64시간 과제는 사람의 개입을 포함하면 76%가 성공했고, 개입 없이 끝낸 비율은 13%였습니다.
8월 7일 이후 일주일 동안 Astra급 강화학습 GPU 배분은 59.2% 줄었지만 다른 모델급 배분이 17.2% 늘어 감소분의 약 85%를 메웠고, 분석 대상 작업의 총 배분은 거의 그대로였습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
AI 과제 길이의 2배 주기 4.3개월은 METR이 새 과제로 잰 2023년 이후 추세이고, 2019년부터 전체로는 두 판 모두 약 7개월이었습니다. 오픈AI는 Astra 계열 GPU 배분이 59.2% 줄어든 주에 다른 계열을 늘려 감소분의 85%를 메웠습니다.

오픈AI 수석과학자 야쿠프 파초키가 GPT-6 Astra 공개 3일 뒤 회사 자율 약속을 제3자·정부가 집행하는 의무 안전 기준으로 바꾸자고 썼습니다. 같은 날 오픈AI는 Astra급 GPU 배정이 59.2% 줄자 다른 모델 배정이 17.2% 늘었다고 공개했습니다.
FTC가 9월 30일 오픈AI·앤트로픽 조사에 들어갔고, 고위 당국자는 두 회사의 사고 조사를 맡아 온 METR에도 자료와 증언을 요구할 계획이라고 로이터에 말했습니다. 하루 전 6개사는 외부 감사를 약속한 백악관 합의에 서명했습니다.

AI 과제 길이의 2배 주기 4.3개월은 METR이 새 과제로 잰 2023년 이후 추세이고, 2019년부터 전체로는 두 판 모두 약 7개월이었습니다. 오픈AI는 Astra 계열 GPU 배분이 59.2% 줄어든 주에 다른 계열을 늘려 감소분의 85%를 메웠습니다.

오픈AI 수석과학자 야쿠프 파초키가 GPT-6 Astra 공개 3일 뒤 회사 자율 약속을 제3자·정부가 집행하는 의무 안전 기준으로 바꾸자고 썼습니다. 같은 날 오픈AI는 Astra급 GPU 배정이 59.2% 줄자 다른 모델 배정이 17.2% 늘었다고 공개했습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@kliu128X 게시물 · 원문 보기
글을 알린 사람은 오픈AI 연구원 케빈 리우입니다. 그는 재귀적 자기개선(AI가 다음 AI의 개발을 점점 스스로 이끄는 과정)이 앞으로 몇 년 동안 AI 능력을 끌어올리는 가장 큰 요인이 될 수 있는데, 그대로 두면 이 과정은 소수 프런티어 연구소 안에서만 보인다고 적었습니다. 모델 개발 속도를 조절할지, 어떻게 조절할지를 두고 공론을 만들려면 투명성이 어느 때보다 급하다며, 다른 AI 회사들에도 같은 공개를 요청했습니다.
목표가 처음 나온 것은 2025년 10월 28일 오픈AI 라이브 방송입니다. 샘 올트먼 CEO는 다음 날 X에 방송 내용을 요약하며 2026년 9월까지 수십만 개 GPU에서 돌아가는 자동화된 AI 연구 인턴을, 2028년 3월까지 진짜 자동화된 AI 연구자를 만드는 것이 사내 목표라고 적었습니다. 완전히 실패할 수도 있지만 파급력이 워낙 커서 공개하는 것이 공익에 맞다는 설명도 붙였습니다.
@samaX 게시물 · 원문 보기
이번 글에서 오픈AI는 연구 인턴을 숙련 연구자가 며칠 걸릴 과제를 포함해 잘 정의된 연구 과제를 사람의 지시 아래 해내는 시스템이라고 정의했습니다. 야쿠프 파초키 수석과학자가 TIME 취재에서 이 단계를 사내적으로 이미 통과했다고 말한 일은 8월 말에 알려졌고, 그 판단의 근거가 된 숫자가 이번에 나왔습니다. 오픈AI는 같은 글에서 자사와 다른 회사들이 재귀적 자기개선을 향한 진척을 공개적으로 추적하도록 의무화돼야 한다는 입장도 다시 밝혔습니다.
사용량 순으로 연구자를 줄 세웠을 때 한가운데 있는 연구자는 1월만 해도 코딩 에이전트를 거의 쓰지 않았습니다. 사용액 중앙값은 1월 첫 주 0달러, 3월 초 5.7달러였고, 6월 첫 주 148달러를 거쳐 8월 15일 601달러가 됐습니다. 상위 10% 연구자는 같은 날 7,047달러를 썼는데, 7월 19일 주 2,188달러에서 26일 주 4,412달러로 한 주 만에 두 배가 된 구간이 있었습니다.

이 금액에는 조건이 붙어 있습니다. 차트 설명에 따르면 API 가격으로 환산한 값이고, 실제로 청구된 금액도 연간으로 늘린 값도 아닙니다. 오픈AI가 자기 모델을 사내에서 돌리는 원가는 공개되지 않았으니, 하루 600달러는 연구자 한 명이 하루에 쓰는 추론의 양을 외부 고객 가격표로 잰 숫자입니다.
조직 전체로 보면 에이전트가 일한 시간이 사람을 넘어섰습니다. 8시간 근무일로 환산한 에이전트 가동량(28일 누적 기준)은 5월 3일 사람의 0.48배였다가 6월 12일 1.01배로 사람을 넘었고, 8월 15일 3.14배가 됐습니다. 에이전트를 4개 이상 동시에 돌리는 연구자 비율도 4월 12일 29.6%에서 8월 15일 74%로 올랐고, 여기에는 사람이 직접 띄운 에이전트가 다시 만든 하위 에이전트까지 들어갑니다. 오픈AI가 말하는 연구자에는 연구 인프라를 만드는 사람과 프로젝트 관리자도 포함됩니다.
산출 쪽을 보면, 회사 전체에서 활성 기여자 한 명이 하루에 바꾸는 코드 줄 수가 2025년 이전 평균을 1로 놓았을 때 2026년 1분기 3.5배, 2분기 5.1배였고, 8월 15일까지 46일을 잰 3분기는 7.02배였습니다. 2025년까지의 분기 막대는 모두 2배 아래였습니다.

실험 수는 1.6배로 나와서 코드와의 차이가 커 보이지만, 두 숫자는 기준이 다릅니다. 실험은 2025년 평균을 1로 잡았고, 코드는 그보다 낮은 2025년 이전 평균을 1로 잡았습니다. 같은 2026년 안에서 비교하면 코드는 1분기 3.5배에서 3분기 7.02배로 두 배가 됐고, 실험자 1인당 실험 수는 1월 첫 주 0.72에서 8월 1.61로 2.2배가 됐습니다.
| 지표 | 기준(=1) | 2026년 초 | 8월 |
|---|---|---|---|
| 기여자 1인당 하루 변경 코드 줄 | 2025년 이전 평균 | 1분기 3.5배 | 3분기 7.02배 |
| 실험자 1인당 실험 수 | 2025년 평균 | 1월 첫 주 0.72배 | 8월 1.61배 |
코드 줄 수는 커밋마다 상위 1% 크기에서 잘랐고, 기여자는 지난 365일 동안 활동한 계정 기준이라 실제 사람 수와 같지 않습니다(출처: OpenAI).
오픈AI는 실험 증가가 Codex 도입과 함께 움직였다고 적으면서, 2025년 이후 쓸 수 있는 컴퓨트도 크게 늘었다고 덧붙였습니다. 연구는 개선안 설계, 평가 작성, 대규모 시험 인프라, 훈련 중 버그와 정렬 어긋남 잡기, 본 훈련 통합이 모두 맞아야 나아가고 한 단계만 막혀도 전체가 막히니, 전체 진전 속도는 이 지표들을 따라가지 못할 가능성이 높다는 문장도 회사가 직접 썼습니다. 자동화가 진행될수록 가장 자동화하기 어려운 일이 연구자의 시간을 더 많이 차지하고, 컴퓨트가 갈수록 큰 병목이 될 수 있다는 설명입니다.
오픈AI는 에이전트가 어떤 일에 쓰이는지도 셌습니다. 미국 직업 분류 체계 O*NET을 본떠 Epoch AI가 만든 AI 연구개발 업무 분류를 빌려, 에이전트가 낸 출력 토큰을 결정·설계·구축·실행·분석·소통 여섯 단계로 나눴습니다. 1월 20~31일과 8월 1~15일 사이 연구 직원 한 명이 하루에 쓰는 출력 토큰은 모두 합쳐 약 65만 4,000개 늘었습니다.
| 단계 | 연구자 1인당 하루 증가분 | 비중 |
|---|---|---|
| 구축(코드·데이터셋) | 21만 1,900 | 32.4% |
| 소통(기술 지원·리뷰·문서) | 18만 4,900 | 28.3% |
| 실행(실험 가동·디버깅·클러스터 운영) | 18만 3,400 | 28.0% |
| 분석 | 5만 5,300 | 8.5% |
| 설계 | 1만 4,500 | 2.2% |
| 결정 | 3,900 | 0.6% |
세부 항목으로 보면 연구·인프라 코드가 19만 8,200개로 가장 많이 늘었고, 기술 지원과 리뷰가 15만 8,800개, 실험 가동·감시·디버깅이 13만 3,100개였습니다. 무엇을 연구할지 정하는 일은 2,300개, 계속할지 멈출지 정하는 일은 200개였습니다. 오픈AI는 높은 수준의 계획이 여전히 에이전트 출력 토큰에서 아주 작은 부분이라고 적었고, 연구 우선순위를 정하고 어떤 아이디어와 결과를 밀지, 규모를 키울지 멈출지 배포할지는 사람이 정한다고 밝혔습니다.

토큰은 세션 일부를 표본으로 뽑아 추정했고, 사용자별 하루 사용량은 상위 5%에서 잘라 냈습니다. 이 표가 나눈 것은 에이전트가 낸 출력 토큰의 양이고, 연구자가 각 단계에 쓴 시간은 표에 없습니다.
사람끼리 묻고 답하던 일은 줄었습니다. 오픈AI 추론팀의 주 기술 지원 채널에 올라온 하루 게시물은 2025년 2~12월 평균 17.6건이었는데, 2026년 7~8월에는 2.5~4.9건이었습니다. 오픈AI는 질문이 사람이 응대하는 다른 채널로 옮겨 간 흔적은 없다고 적었고, 실험 문제를 돕던 오피스아워 여러 곳의 참석자가 줄어 한 팀은 세션을 아예 없앴다고 밝혔습니다.

저는 이 채널 숫자를 생산성보다 조직의 학습 경로로 봅니다. 다른 팀 사람에게 묻던 질문이 에이전트로 가면 답은 빨라지지만, 질문하면서 사람 사이에 쌓이던 맥락은 그만큼 덜 오갑니다. 오픈AI 글에는 이 변화가 신입 연구자의 성장에 어떤 영향을 주는지에 대한 숫자는 없습니다.
에이전트가 맡은 일을 해냈는지는 성공률로 쟀습니다. 정답이 있는 과제만 골라 결과를 AI 분류기가 판정했고, 판정이 불확실한 경우와 세션 50개 또는 사용자 50명이 안 되는 경우는 뺐습니다. 아래는 사람이 했다면 걸렸을 시간별로, 에이전트가 사람의 개입 없이 끝낸 비율입니다.
| 사람 기준 소요 시간 | 1월 | 3월 | 5월 | 6월 | 7월 |
|---|---|---|---|---|---|
| 2~4시간 | 27.8% | 57.8% | 62.0% | 57.9% | 56.8% |
| 4~8시간 | 18.5% | 47.9% | 43.4% | 54.0% | 53.3% |
| 8~16시간 | 10.0% | 23.3% | 42.9% | 58.2% | 34.5% |
무개입 성공률(출처: OpenAI 차트 데이터).
1월부터 7월 사이 2~4시간짜리 과제는 27.8%에서 56.8%로, 4~8시간짜리는 18.5%에서 53.3%로 올랐습니다. 다만 2~4시간 구간은 3월에 이미 57.8%였고 그 뒤 4개월 동안 57~62% 사이에 머물렀습니다. 8~16시간 구간은 6월 58.2%에서 7월 34.5%로 내려갔는데, 오픈AI는 7월 말 세션은 결과를 지켜볼 7일이 다 차지 않았다고 적었습니다.

개입까지 포함하면 그림이 달라집니다. 1~7월을 합친 결과에서 4~8시간 과제는 무개입 성공 43%, 사람이 한 번 이상 끼어든 뒤 성공 45%였고, 성공한 4~8시간 과제의 절반 넘게 개입이 있었습니다. 8시간 근무일로 4~8일 걸리는 32~64시간 과제는 무개입 성공 13%, 개입 후 성공 63%, 실패 13%, 도구 오류 10%였습니다.
오픈AI가 정의한 인턴은 사람의 지시 아래 과제를 해내는 시스템이니, 32~64시간 과제에서 개입을 포함한 성공 76%는 그 정의와 맞습니다. 같은 과제를 사람의 개입 없이 끝낸 비율은 13%였고, 오픈AI도 과제가 복잡해질수록 에이전트가 성공하려면 사람의 상당한 조종이 필요하다고 적었습니다.
Codex라는 이름이 처음 나온 5년 전 기록도 있습니다. 2021년 7월 오픈AI가 낸 Codex 논문에서 이 모델은 함수 설명(독스트링)을 보고 파이썬 함수 하나를 짜는 시험 HumanEval 문제의 28.8%를 첫 시도에 풀었습니다. 2026년 오픈AI 연구 조직의 Codex 에이전트는 사람이 2~4시간 걸리는 연구 과제의 57%를 혼자 끝냅니다.
글의 4장은 안전 조치가 실제 연구 컴퓨트를 어떻게 움직였는지를 날짜별 GPU 배분으로 공개했습니다. 7월 20일 오픈AI는 에이전트들이 연구 인프라를 침해한 사실을 발견하고 훈련용 컨테이너 서비스를 잠시 내렸다가 추가 제한을 걸어 다시 열었습니다. 허깅페이스 사건 보고서가 다룬 일 뒤에는 배포용 최신 모델의 강화학습을 2주 동안 멈췄고, 이 결정은 8월 18일 공개됐습니다.

차트 데이터로 보면 강화학습 GPU 배분은 7월 19일 하루 최고치의 90.5%였다가 22일 33.7%까지 떨어졌습니다. 8월 7일에는 Astra가 준비 프레임워크 기준 사이버 Critical 능력을 가졌을 수 있다는 예비 증거가 나와, Astra는 보안 수준이 더 높은 연구 환경에서만 돌리게 됐습니다. 오픈AI는 9월 1일 Astra를 사이버 위험 최고 등급 Critical로 확정했습니다.
그 뒤 일주일 동안 Astra급 GPU 배분은 59.2% 더 줄었지만, 다른 모델급 배분이 17.2% 늘어 감소분의 약 85%를 메웠습니다. 분석 대상 강화학습 작업의 총 배분은 거의 그대로였고, 8월 7~15일 하루 배분은 최고치의 52~68%를 오갔습니다. 차트 주석에는 7월 20일부터 8월 6일까지의 Astra 컴퓨트 대부분이 안전·보안 개선을 시험하는 데 쓰였다는 문장도 있습니다.
새 통제가 들어와도 컴퓨트는 여전히 값지고 유연해서, 연구 조직 안의 다른 쓰임새로 자연스럽게 흘러갑니다.— OpenAI, Research acceleration
오픈AI는 이 결과를 들어, 앞으로 AI 진전 속도를 다루는 논의는 새로 통제를 받게 된 컴퓨트를 어디에 쓸지까지 넓혀야 한다고 적었습니다. 같은 날 파초키는 회사의 자율 약속을 제3자와 정부가 집행하는 의무 기준으로 바꾸자는 에세이를 냈고, 그 내용은 한 시간 앞서 올린 글에 정리했습니다.
앤트로픽은 8월 14일(미국 시각) 두 번째 위험 보고서에서 사내 AI 활용으로 연구가 의미 있게 빨라졌지만, 책임 있는 확장 정책이 위험 기준으로 둔 진전 속도 2배에는 못 미친다고 결론 냈습니다. 자사 엔지니어가 실제로 풀었던 사내 문제 449개로 만든 시험 CoBench v2에서 사내 전용 모델 Model 2는 62.8%를 받았고, 연구진을 온전히 대신하려면 85%는 필요하다고 봤습니다.

재는 방식이 다릅니다. 오픈AI는 토큰과 근무일, 코드 줄, 실험 수, 과제 성공률처럼 투입과 산출을 셌고, 앤트로픽은 여러 벤치마크를 묶은 사내 능력 지표의 추세가 얼마나 빨라졌는지를 기준선과 비교했습니다. 에이전트가 사람의 3.1배를 일한다는 숫자에서 연구가 3.1배 빨라졌다는 결론이 나오지 않는 이유가 여기 있고, 오픈AI도 글에서 같은 단서를 달았습니다. 두 회사의 숫자 모두 스스로 정의하고 스스로 잰 값이며 외부 검증은 아직 없습니다.
우리가 낸 블로그 글 가운데 가장 흥미로운 글 하나입니다. 저는 이 추세가 이어질 것으로 봅니다.— 노엄 브라운, 오픈AI 연구원
자동화된 AI 연구자 목표까지는 18개월이 남았습니다. 다음 공개에서 같은 차트가 다시 나온다면, 결정과 설계 단계 토큰이 코드처럼 늘기 시작했는지와 16시간 넘는 과제의 무개입 성공률(1~7월 13~23%)이 얼마나 올라왔는지가 거리를 재는 숫자가 됩니다. 케빈 리우의 요청대로 다른 연구소가 같은 형식의 데이터를 내놓는다면, 그때부터는 한 회사의 자기 보고를 넘어 업계의 속도를 견줄 수 있습니다.
국내에서 Codex에 몇 시간짜리 작업을 맡기는 개발 조직에도 이번 숫자는 기준점이 됩니다. 오픈AI 연구 조직은 자사 인프라와 최신 사내 모델을 쓰고도 2~4시간 과제의 57%를 개입 없이 끝냈고, 하루 이상 걸리는 과제에서는 성공한 경우 대부분 사람이 중간에 방향을 고쳤습니다. 오픈AI는 측정 방법이 아직 초기 단계라고 적으면서, 방법을 다듬어 재귀적 자기개선의 진척을 계속 공개하겠다고 밝혔습니다.
읽어 주셔서 고맙습니다.
초이 드림