트랜스포머
Transformer · 트랜스포머 구조
2017년에 나온 언어모델의 기본 설계로, 어텐션 층을 쌓아 입력 전체를 한 번에 참고합니다. 지금 이름이 알려진 모델은 거의 전부 이 구조의 변형이고, 연산 비용을 줄이려는 최근 시도도 트랜스포머 안에서 일부 층을 갈아 끼우는 방식으로 이뤄집니다.
‘트랜스포머’ 이 나오는 글6
버리던 첫 바퀴 답을 살리자, 애플 루프 모델 수학 정답률 11%포인트 올랐습니다
애플 연구진이 10월 1일 공개한 LoopCD는 루프 모델이 버리던 첫 바퀴 예측을 기준점 삼아 마지막 예측을 한 번 더 밉니다. 추가 학습 없이 AIME 2024 정답률이 61.88%에서 73.33%로 올랐고, 연산 22.5~48.2% 절감은 객관식 실험에서 쟀습니다.

함께 나오는 용어5
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- AGI사람이 하는 지적 작업 대부분을 사람 수준 이상으로 해내는 AI를 가리킵니다. 정의가 기관마다 달라서 같은 단어로 다른 시점을 말하는 경우가 많고, 이 뉴스레터에서는 특정 벤치마크 통과 시점보다 자동화된 연구 능력을 기준으로 다룹니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 지식 벤치마크객관식과 단답으로 모델의 지식과 계산 실력을 재는 시험지 계열입니다. MMLU와 GPQA, AIME가 대표인데 상위 모델이 몰려 변별력이 떨어졌고, 최근 점수 도약은 명령을 실행하고 결과를 받는 에이전트 과제 쪽에서 나옵니다.





