리더보드
leaderboard · 순위표
여러 모델의 점수를 같은 조건에서 줄 세워 공개하는 표입니다. 과제당 비용을 함께 적는 곳이 늘면서 성능과 가격을 한 줄에서 비교하게 됐습니다. Datacurve의 8월 26일 집계에서 Opus 5는 과제 하나에 평균 11.84달러, GPT-5.6 Sol은 73%에 6.46달러였습니다.
‘리더보드’ 이 나오는 글6
Exa Agent Ultra가 WANDR에서 81.4%, 채점은 Exa가 했습니다
Exa가 9월 25일 리서치 에이전트의 최고 노력 단계 Agent Ultra를 공개했습니다. 회사 표에서 WANDR 81.4%로 Opus 5.5의 72.3%를 앞섰고, 수집 도구와 판정 모델을 바꾼 자체 채점 틀에서 나온 숫자입니다.

AI 예산을 4개월 만에 바닥낸 우버, 세션당 비용을 절반으로 줄였습니다
폭이 넓은 테이블 조회 한 번이 143만 토큰에서 900토큰이 됐습니다. 같은 질문에 지식 그래프를 쓴 에이전트는 38초 만에 맞혔고, 그래프 없는 에이전트는 20분을 쓰고 틀렸습니다.
함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 벤치마크모델 실력을 재는 표준 시험입니다. 수학(GSM8K·MATH), 코딩(HumanEval·SWE-bench) 같은 문제집 점수로 모델을 비교합니다.
- 프런티어 모델그 시점에 공개된 모델 가운데 능력이 가장 앞선 등급을 가리킵니다. 각국 안전연구소의 평가 대상과 수출통제 논의가 이 등급을 기준으로 짜입니다.
- 오픈 웨이트학습된 가중치 파일을 공개해 누구나 내려받아 돌릴 수 있는 모델입니다. 학습 데이터·코드까지 다 여는 '오픈 소스'와는 구분합니다.




