
처음 보는 규칙을 몇 개 예시만으로 알아내는 능력을 재는 평가입니다. 학습 데이터 암기로는 풀리지 않도록 설계돼서, 일반화 능력을 논할 때 기준으로 쓰입니다.
용어 자세히 보기
ARC-AGI-3는 규칙을 알려주지 않은 채 직접 부딪히며 알아내야 하는 시험입니다.
지난 3월만 해도 최상위 모델조차 1%를 넘기지 못했습니다.
AVO가 사용한 모델은 Claude Opus 5입니다.
모델만 단독으로 돌리면 30% 수준이지만, 자체 하네스를 붙이자 만점까지 올라갔습니다.
AVO는 원래 엔비디아가 자사 GPU 커널을 최적화하기 위해 만든 내부 도구입니다.
모델은 다른 회사 것을 가져다 써도, 에이전트를 더 오래, 더 깊게 움직이는 실행 도구를 쥐면 어떤 모델이 이기든 GPU 수요는 엔비디아로 흐를 수밖에 없습니다.
아티클AI
모델의 Nemotron, 서빙의 Dynamo에 이어 이제 하네스까지, 엔비디아는 칩 위에서 도는 소프트웨어를 하나씩 직접 만들어 왔습니다.
Choi
같은 Opus 5가 단독으로는 30% 수준이었고 엔비디아 하네스를 붙이자 만점이 나와, 점수 차이는 모델 밖의 실행 도구에서 나왔습니다.
Impossible Research의 하네스 [schema]가 Opus 4.8과 Fable 5 조합으로 98.98%를 기록했습니다.
공식 리더보드 최고는 13.33%입니다.
일하는 방식은 물리학자와 닮았습니다.
모델은 화면만 보고 추측한 게임 규칙을 코드로 적고, 기록된 모든 실제 화면과 대조해 검증합니다.
예측이 어긋나면 계획을 버리고 이론부터 고칩니다.
검증된 코드는 시뮬레이터가 되어, 실제 행동 없이 그 안에서 답을 찾습니다.
사람이 500번 움직인 레벨을 42번에 끝낸 배경입니다.
하네스로 벤치마크만 뚫는다는 회의도 나오지만, 같은 조합을 Claude Code로 돌리면 42.83%, schema로 돌리면 98.98%입니다.
다만 둘 다 자체 보고에 공개 세트 기준이라, 비공개 세트 성적은 아직 알 수 없습니다.
한동안 성능 도약의 상당 부분은 모델 밖 설계에서 나올 것 같습니다.
Choi
같은 Opus 4.8·Fable 5 조합이 Claude Code에서는 42.83%, schema에서는 98.98%를 냈습니다. 점수 차이가 모델 밖 하네스 설계에서 나왔습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.