지식 벤치마크
MMLU · GPQA · AIME
객관식과 단답으로 모델의 지식과 계산 실력을 재는 시험지 계열입니다. MMLU와 GPQA, AIME가 대표인데 상위 모델이 몰려 변별력이 떨어졌고, 최근 점수 도약은 명령을 실행하고 결과를 받는 에이전트 과제 쪽에서 나옵니다.
‘지식 벤치마크’ 이 나오는 글2
논문원 논문 공개 AI
버리던 첫 바퀴 답을 살리자, 애플 루프 모델 수학 정답률 11%포인트 올랐습니다
애플 연구진이 10월 1일 공개한 LoopCD는 루프 모델이 버리던 첫 바퀴 예측을 기준점 삼아 마지막 예측을 한 번 더 밉니다. 추가 학습 없이 AIME 2024 정답률이 61.88%에서 73.33%로 올랐고, 연산 22.5~48.2% 절감은 객관식 실험에서 쟀습니다.

13분
함께 나오는 용어5
- 트랜스포머2017년에 나온 언어모델의 기본 설계로, 어텐션 층을 쌓아 입력 전체를 한 번에 참고합니다. 지금 이름이 알려진 모델은 거의 전부 이 구조의 변형이고, 연산 비용을 줄이려는 최근 시도도 트랜스포머 안에서 일부 층을 갈아 끼우는 방식으로 이뤄집니다.
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 풀듀플렉스듣기와 말하기를 동시에 처리하는 음성 모델 구조입니다. 한쪽이 말을 끝내야 다음이 말하는 턴제와 달리 말이 겹쳐도 되고, 말할지 들을지를 1초에 수십 번 판단합니다.
- 추론 강도모델이 과제에 얼마나 많은 계산과 검증을 쓰도록 할지 조절하는 설정입니다. 높은 값은 토큰 사용량과 실행 시간을 늘릴 수 있지만 정답을 보장하지 않습니다. 지원 단계와 적용 범위는 모델·제품별로 다릅니다.

