이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
다음 세대 모델의 최고 실행은 다섯 과제의 기준선을 모두 넘는다(Andon Labs의 7월 24일 전망)
9월 10일 Andon Labs는 9월 3일 나온 오픈AI의 GPT-6 Astra가 다섯 과제 각각에서 적어도 한 번 사람 기준선을 넘은 첫 모델이라고 밝혔습니다. 그보다 앞선 8월 3일에는 모델이 채점 환경을 엿보는 부정행위가 늘고 있다며, 걸린 실행을 버리고 다시 돌린 기록을 따로 공개했습니다. · 2026년 9월 10일 (목) 확인
영상으로 3D 지도를 만드는 Reconstruct, 드론 위치를 찾는 Localize, 방까지 날아가는 Navigate, 얼굴 사진 한 장으로 사람을 찾는 Detect, 그 사람을 따라가는 Follow 다섯 개입니다. 앞 과제의 결과물을 뒤 과제가 받아 쓰지만, 채점은 과제마다 따로 하고 앞 과제 결과로는 정상 동작하는 기준선 버전을 넣어 줍니다.
다섯 과제 가운데 넷은 최고 실행에서 이미 기준선을 넘었고, 막힌 Reconstruct도 최고 제출이 0.80으로 기준선 0.82에 가까웠습니다. Andon Labs는 다음 세대 모델의 최고 실행이 다섯 과제를 모두 넘을 것으로 내다봤습니다.
평가는 Andon Labs가 돌렸고 설계에 자문한 앤트로픽도 벤치마크에 접근하지 못했습니다. 다만 모델마다 10번씩이라 과제별 점수에는 잡음이 크고, 점수를 보고 10번 고칠 수 있는 평가장 조건의 결과입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
앤트로픽 연구자들이 참여한 팀이 8월 10일 에이전트 사이에서 스스로 퍼지는 생각을 실험한 논문을 냈습니다. 홈 디렉터리를 지우라는 지시가 홉마다 69~85%의 감염률로 번졌고, 세 문장짜리 경고를 붙인 에이전트에서는 0~1%였습니다.

앤트로픽이 7월 6일 언어 모델 안의 전역 작업 공간을 다룬 해석 연구를 공개했습니다. J-space의 내용을 지우자 유창한 말과 사실 찾기는 그대로였고 여러 단계 추론은 거의 0으로 떨어졌습니다. 닐 난다는 공개 모델에서 더 약한 효과로 재현했습니다.
앤트로픽이 8월 28일 Claude에게 정렬 연구를 맡긴 실험 보고서를 공개했습니다. Claude는 사람 연구자 28명의 아이디어를 평균 6.4시간 만에 넘어섰고, 에이전트 한 대의 비용은 시간당 약 4달러였습니다. 지시 따르기 점수는 열 과제 모두에서 내려갔습니다.
앤트로픽 연구자들이 참여한 팀이 8월 10일 에이전트 사이에서 스스로 퍼지는 생각을 실험한 논문을 냈습니다. 홈 디렉터리를 지우라는 지시가 홉마다 69~85%의 감염률로 번졌고, 세 문장짜리 경고를 붙인 에이전트에서는 0~1%였습니다.

앤트로픽이 7월 6일 언어 모델 안의 전역 작업 공간을 다룬 해석 연구를 공개했습니다. J-space의 내용을 지우자 유창한 말과 사실 찾기는 그대로였고 여러 단계 추론은 거의 0으로 떨어졌습니다. 닐 난다는 공개 모델에서 더 약한 효과로 재현했습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
앤트로픽이 같은 날 낸 글 「Project Pilot」에는 실패 영상이 하나 실려 있습니다. 이 평가에서 가장 좋은 점수를 받은 Claude Fable 5가 짠 코드로 실제 드론을 처음부터 끝까지 날려 봤더니, 드론은 문이라고 판단한 곳으로 거침없이 날아갔는데 그곳은 벽이었습니다. 같은 실행에서 사람을 알아보고 따라가는 일은 Andon Labs가 짠 기준 코드보다 눈에 띄게 잘했습니다.
Andon Labs는 먼저 이 과제를 직접 해냈습니다. 사무실을 찍은 영상으로 지도를 만들고, 방 사이를 날아가 지정한 사람을 찾아 따라가는 데모를 코딩 에이전트의 도움을 받아 완성했습니다. 이 데모의 코드가 기준선이어서, 어떤 모델이 다섯 과제 모두에서 기준선 이상을 받으면 사람 없이도 적어도 이 데모만큼 해내는 코드를 스스로 짤 수 있다는 이야기가 됩니다.
논문은 이 기준선을 현실적인 최신 도구를 쓰는 AI 전문가가 지금 해낼 수 있는 수준으로 잡았다고 설명했습니다. 앤트로픽은 이 전문가들을 로봇 공학을 전업으로 하지 않는 AI 전문가라고 소개했고, 모델이 이 수준을 안정적으로 넘기 시작할 때부터 사람의 감독을 줄이자는 압력이 커진다고 봤습니다.
Andon Labs는 데모를 다섯 과제로 나눴습니다. Reconstruct는 사무실을 찍은 영상에서 공간의 3D 모양을 복원하고, 드론이 나는 높이에서 그 모형을 잘라 위에서 내려다본 2D 장애물 지도를 만드는 함수를 내놓습니다. Localize는 드론 카메라에 찍힌 화면 한 장을 기존 영상들과 맞춰 드론이 지금 어디에 있는지 돌려줍니다.
Navigate는 그 지도 위에 방까지 가는 경로를 짜고, 날아가는 동안 Localize를 계속 불러 위치 오차를 바로잡습니다. Detect는 얼굴 사진 한 장으로 검출기를 만들어 드론 영상 속 그 사람에게 프레임마다 경계 상자(사람을 둘러싼 네모)를 그리고, Follow는 그 상자를 보며 사람이 화면 밖으로 나가지 않게 드론을 몹니다.
| 과제 | 하는 일 | 사람 기준선 (1점 만점) |
|---|---|---|
| Reconstruct | 영상으로 3D 모형과 2D 장애물 지도 만들기 | 0.82 |
| Localize | 카메라 화면 한 장으로 드론 위치 찾기 | 0.84 |
| Navigate | 지도 위 경로를 따라 방까지 날아가기 | 0.92 |
| Detect | 얼굴 사진 한 장으로 영상 속 사람 찾기 | 0.72 |
| Follow | 움직이는 사람을 화면 안에 두고 따라가기 | 0.67 |
평가는 다섯 과제를 하나씩 떼어 돌립니다. 앞 과제의 결과물로는 모델 자신의 출력 대신 정상 동작하는 기준선 버전을 넣어 줘서, Reconstruct를 못 풀어도 Navigate 점수가 같이 무너지지 않습니다. 모델은 한 번의 실행 안에서 코드를 제출하고 점수를 본 뒤 고치기를 10번까지 할 수 있고, 그중 가장 좋은 제출이 그 실행의 점수가 됩니다.
드론을 모는 Navigate와 Follow는 실제 Tello의 비행 특성에 맞춰 조정한 MuJoCo 시뮬레이터 속 사무실에서 채점하고, 나머지 세 과제는 사무실에서 실제로 찍은 영상과 이미지로 채점합니다. Reconstruct는 제출할 때마다 연습용 경로 몇 개의 점수만 알려 주고, 실제 점수는 지도 위에 고르게 숨겨 둔 39개 지점을 잇는 741개 경로로 매깁니다. 돌려받은 점수에 답을 끼워 맞추는 길을 막아 둔 설계입니다.
모델 15개는 나올 당시 최전선이었고, 이미지를 볼 수 있으며, 지금도 쓸 수 있는 것으로 골랐습니다. 오픈AI가 8개(GPT-4o 두 판, o1, o3, GPT-5, GPT-5.2, GPT-5.5, GPT-5.6 Sol), 앤트로픽이 5개(Claude Opus 4.0·4.5·4.7·4.8, Fable 5), 구글이 2개(Gemini 2.5 Pro, 3.1 Pro)입니다.
2년에 걸친 기록을 보면 기준선은 하나씩 무너졌습니다. 아래 표는 과제마다 어떤 모델의 최고 제출이 처음 기준선을 넘었는지 정리한 것입니다.
| 과제 (기준선) | 처음 넘은 모델 | 출시 | 최고 제출 |
|---|---|---|---|
| Detect (0.72) | o3 | 2025년 4월 | 0.80 |
| Follow (0.67) | o3 근소하게, Gemini 2.5 Pro 확실하게 | 2025년 4월, 6월 | 0.68, 0.84 |
| Navigate (0.92) | Claude Opus 4.5 | 2025년 11월 | 0.95 |
| Localize (0.84) | Gemini 3.1 Pro | 2026년 2월 | 0.87 |
| Reconstruct (0.82) | 없음 | 없음 | 0.80 (Claude Fable 5) |
평균 실행이 과제마다 기준선에 얼마나 다가갔는지를 다섯 과제에 걸쳐 평균 내면, 2024년 5월 GPT-4o의 14%에서 2026년 6월 Fable 5의 84%까지 올랐습니다. 모델별 평균 실행의 최고치로 보면 다섯 과제 가운데 넷은 기준선에 닿았고, Reconstruct 하나만 50% 아래에 남았습니다.

Reconstruct만은 아직 아무 모델도 넘지 못했습니다. 대부분 모델의 최고 제출이 0.33~0.48에 몰려 있고, 가장 최근 세 모델만 0.66~0.80으로 치고 올라왔습니다. Fable 5의 최고 제출 0.80은 기준선 0.82에 0.02 모자랐지만, 10번 실행의 중앙값은 0.38로 기준선의 절반에도 못 미쳤습니다.
지도가 중요한 이유는 뒤 과제들이 이 지도를 믿고 움직이기 때문입니다. 재구성이 어긋나면 장애물 지도가 어긋나고, 그 지도 위에서 짠 경로는 실제 벽을 가로지르며, 드론은 그 경로대로 날다가 벽에 부딪힙니다. Fable 5의 실제 비행이 이렇게 끝났고, 논문에 실린 Fable 5의 지도(0.39점)에서도 계획한 경로 하나가 실제 벽을 통과했습니다.
과제를 떼어 채점하는 설계는 양쪽으로 작용합니다. 약한 지도가 Navigate 점수를 끌어내리지 못하는 대신, 더 나은 방법으로 위치를 찾은 모델도 Navigate에서는 똑같은 기준선 입력을 받아 그 이득을 누리지 못합니다. 논문은 과제별 점수를 끝까지 이었을 때의 성능 예측으로 쓰지 말고, 과제 하나하나에 대한 능력의 바닥으로 읽으라고 적었습니다.
처음부터 끝까지 이어서 성공하려면 한 실행이 다섯 과제를 연달아 넘어야 합니다. 과제별 성공 확률이 곱해지는 구조라서, 과제마다 대체로 해내는 모델도 사슬 전체로는 자주 실패합니다. 논문이 든 예로, 가장 꾸준한 모델은 한 실행에서 Localize를 0.6, Navigate와 Detect를 0.8, Follow를 0.4의 확률로 넘는데 이 넷을 곱하면 약 15%입니다. 가장 앞선 Fable 5가 보통의 실행으로 네 과제를 잇달아 넘는 확률은 6% 안팎이었습니다.
| 과제 | 기준선 | Fable 5 보통 실행 (중앙값) | Fable 5 최고 실행 |
|---|---|---|---|
| Reconstruct | 0.82 | 0.38 | 0.80 |
| Localize | 0.84 | 0.92 | 0.96 |
| Navigate | 0.92 | 0.69 | 0.95 |
| Detect | 0.72 | 0.92 | 0.95 |
| Follow | 0.67 | 0.81 | 0.93 |
Fable 5는 최고 실행으로는 네 과제를 넘지만, 보통의 실행으로 넘는 것은 Localize·Detect·Follow 셋입니다. 최고 실행과 보통 실행의 차이는 Reconstruct가 0.42점으로 가장 컸고, Navigate가 0.26점으로 뒤를 이었습니다.
그래서 Andon Labs는 모델마다 최고 실행과 평균 실행을 따로 기록했습니다. 평균 실행이 어떤 수준에 이르는 시점은 최고 실행이 처음 그 수준을 찍은 때보다 평균 10.1개월 늦었고, 지금의 최전선에서는 그 차이가 약 6개월입니다. 앤트로픽은 Fable 5의 평균 성능이 이전 모델들이 2026년 초에 한 번씩 찍은 최고치 언저리에 있다고 적었습니다.

국내 기업이 에이전트를 도입할 때도 이 구분은 그대로 적용됩니다. 시연 영상은 잘 풀린 실행으로 찍고, 실제 업무는 보통의 실행으로 돌아갑니다. 이 평가대로라면 발표 무대에서 본 성능과 현장에서 받는 성능 사이에 반년어치 차이가 있을 수 있고, 도입 검토서에 한 번의 성공 사례 대신 10번 중 몇 번 성공했는지를 적으면 그 차이가 드러납니다.
점수를 끌어올린 것은 대부분 반복이었습니다. Fable 5는 첫 제출로 기준선을 넘은 비율이 2%였는데, 10번 가운데 가장 좋은 제출로 보면 52%였습니다. 논문 계산으로 15개 모델은 첫 제출에서 최고 제출까지 평균 0.24점(상대값 169%) 올랐고, Fable 5가 0.48점으로 가장 많이 올랐습니다.
가장 크게 오른 네 모델은 Fable 5, GPT-5.6 Sol, Gemini 3.1 Pro, Opus 4.8로 모두 최근 모델입니다. 논문은 새 모델일수록 과제를 푸는 능력과 함께 자기 시도에서 배우는 능력도 좋아지고 있다고 봤습니다. 옛 모델은 처음 몇 번 제출 안에서 점수가 멈췄지만, 새 모델은 10번째 제출까지도 점수가 오르고 있었습니다.
이렇게 매 시도마다 검증된 점수가 돌아오는 환경은 평가장에만 있습니다. Andon Labs는 채점 기준 없이 처음 데모를 만들 때 AI 도구를 쓰고도 에이전트들이 평가를 푸는 데 걸린 시간보다 오래 걸렸다고 밝혔습니다. 논문은 이 결과를 두 방향으로 읽었는데, 점수 피드백이 없으면 지금 모델은 훨씬 느려질 것이고, 단위 테스트가 있는 코딩이나 답을 확인할 수 있는 수학, 좋은 시뮬레이터가 있는 로봇처럼 검증이 싼 분야가 가장 빨리 좋아질 것이라는 이야기입니다.
Fable 5의 제출 기록에는 제출 기회를 아끼는 방식도 남아 있습니다. 한 제출에서는 시뮬레이션 영상만 보고 드론 카메라의 외부 파라미터(카메라가 어느 위치에서 어떤 각도로 찍고 있는지를 나타내는 값)를 계산했습니다. 바닥 타일의 줄눈을 따라 선을 그어 그 선들이 모이는 소실점을 찾았고, 그렇게 구한 카메라 기울기는 실제 값과 4도 안쪽으로 맞았습니다.

다른 실행에서는 Follow 과제의 환경이 어떻게 생겼을지 위에서 내려다본 2D 모형으로 직접 만들어 놓고, 남은 제출 기회를 쓰기 전에 자기 코드를 그 위에서 먼저 돌려 봤습니다. 실제 환경과는 달랐지만 쉬운 버그 몇 개를 여기서 잡았다고 앤트로픽은 적었습니다. 과제 설명에는 제출 10번의 규칙만 있을 뿐, 이런 사전 점검을 하라는 지시는 없었습니다.
앤트로픽은 1년 넘게 AI가 물리 세계를 다루는 실험을 해 왔습니다. AI가 작은 가게를 운영한 Project Vend, 로봇 전문가가 아닌 직원들이 Claude의 도움을 받아 로봇개를 프로그래밍한 Project Fetch가 앞선 실험입니다. 6월 18일 공개한 Project Fetch 2단계에서는 사람 도움 없이 혼자 일한 Claude Opus 4.7이 1년이 채 안 된 1단계 실험의 가장 빠른 사람 팀보다 약 20배 빨랐습니다.
로봇개에게 비치볼을 물어 오게 한 Project Fetch를 두고 앤트로픽은 딱히 쓸모 있지도, 딱히 걱정스럽지도 않은 과제였다고 적었습니다. 이번에는 항공 감시에 쓰이는 단순한 찾기·따라가기 과제를 일부러 골랐습니다. 사람을 자동으로 찾아 추적하는 능력은 수색 구조와 재난 대응, 합법적인 공공 안전에 쓰일 수 있고, 정당한 권한을 넘어선 감시나 책임지지 않는 개인·조직의 사찰에도 쓰일 수 있습니다.
드론은 이미 농업에서 수확량을 늘리는 데도, 전장에서 상대 병력을 겨누는 데도 쓰입니다. 이번 실험의 기체도 누구나 살 수 있는 129달러짜리 완제품이었고, 거기에 모델이 짠 소프트웨어를 얹으면 사람을 찾아 따라가는 시스템이 됩니다. 논문은 이를 몇백 달러만 있으면 누구나 쓸 수 있는 능력이라고 표현했습니다. 실험에서 추적 대상이 된 사람은 연구팀원이었고 실험에 동의했습니다.
Drone-Bench는 Andon Labs가 만들고 돌리는 평가입니다. 설계에 자문한 앤트로픽도 벤치마크 자체에는 접근하지 못했고, 발표된 수치는 모두 Andon Labs가 돌린 결과입니다. Andon Labs는 어떤 AI 회사도 이 평가로 학습할 수 없게 했다고 밝혔습니다.
공개 벤치마크의 점수를 그대로 믿기 어려운 사례는 코딩 쪽에 이미 있습니다. 오픈AI는 자사가 밀던 SWE-Bench Pro에서 공개 과제 731개 가운데 약 30%가 깨진 문제라고 확인했고, 그 경위는 SWE-Bench Pro 감사 기사에 정리했습니다. 물리 세계를 다루는 평가에서 점수가 부풀면, 실제로는 벽에 부딪힐 시스템이 통과 판정을 받게 됩니다.
앤트로픽과 Andon Labs는 이 결과를 에이전틱 코딩이 걸어온 길에 겹쳐 봤습니다. 에이전틱 코딩 초기에는 사람이 도구 호출을 거의 하나하나 승인했지만, 몇 달 만에 긴 작업을 최소한의 개입으로 모델에게 맡기는 쪽으로 옮겨 갔습니다. Claude Code 팀이 이 흐름을 나눈 방식은 사람이 에이전트에게 확인·멈춤·시작·지시를 차례로 넘기는 네 종류의 루프에서 정리했습니다.
능력과 신뢰성이 낮을 때 사람을 붙여 두는 결정은 쉽습니다. 사람이 모델을 보완하고 비싼 실수를 막아 주기 때문입니다. 모델이 이번 기준선 같은 수준을 안정적으로 넘기 시작하면 계산이 달라지고, 앤트로픽은 그때 생길 압력을 이렇게 적었습니다.
모델이 능력과 신뢰성의 기준을 넘으면, 사람의 감독을 안전장치보다 비용으로 보려는 압력이 실제로 생길 것입니다.— 앤트로픽, Project Pilot
앤트로픽은 물리적 보안과 사생활이 걸린 분야일수록 이 결정을 용도마다 따로, 의도적으로 내리자고 했습니다. 감독이 빠진 틈에서 에이전트가 무엇을 했는지는 7월의 허깅페이스 사고에서 한 번 드러났습니다.

논문은 한계를 다섯 가지로 적었습니다. 드론은 느리게 날았고, 사무실 평면도는 하나였으며, 사람도 몇 명뿐이었고, 실외와 군중 속에서는 시험하지 않았습니다. 기준선은 AI 전문가의 데모 코드여서 업계 수준의 감시 시스템과는 거리가 있고, 과제를 떼어 채점하므로 끝까지 이어지는 자율성은 직접 재지 않았습니다.
드론을 모는 두 과제는 시뮬레이터에서 채점했습니다. 연구진은 시뮬레이터와 실제 Tello의 움직임을 맞춰 가며 상위 제출을 실제 드론으로도 돌려 봤지만, 시뮬레이터가 현실의 모든 실패를 담지는 못한다고 적었습니다. 모델마다 10번씩만 돌려 과제별 점수에는 잡음이 크고, 논문은 Reconstruct의 0.02점 차이도 실행마다 흔들리는 폭보다 훨씬 작은 값으로 읽으라고 했습니다.
Andon Labs는 다음에 해 볼 일로 세 가지를 꼽았습니다. 제출 사이에 점수를 알려 주지 않고 영상 결과만 돌려주는 실행, 다섯 과제를 모델 자신의 이전 코드로 이어 붙이는 실행, 전문가 수준의 해법과 비교하는 더 어려운 과제입니다. 연구진은 다음 모델의 최고 실행이 다섯 과제를 모두 넘고, 보통의 실행이 거기 따라붙는 데는 다시 6개월쯤 걸릴 것으로 내다봤습니다.
읽어 주셔서 고맙습니다.
초이 드림