선형 어텐션
linear attention · 하이브리드 어텐션 · Gated DeltaNet
입력이 길어져도 계산량이 제곱으로 늘지 않도록 고친 어텐션 계열입니다. 전체 어텐션 층과 섞어 쓰는 하이브리드 구성이 표준이 됐고, Qwen3.8은 층 대부분을 Gated DeltaNet으로 두고 16개 층만 전체 어텐션으로 남겨 멀리 떨어진 정보를 다시 연결합니다.
‘선형 어텐션’ 이 나오는 글4
GLM이 자기를 돌릴 시스템을 짰다, 13일 만에 처리량 3.22배
첫 구동 13일 뒤 처리량은 처음의 3.22배가 됐습니다. 파이썬 GIL 하나 때문에 20% 넘게 벌어지던 성능 차이를 1% 아래로 줄였고, 에이전트가 찾은 정밀도 문제의 수정은 오픈소스 라이브러리 Flash Linear Attention에 병합됐습니다.

함께 나오는 용어5
- 어텐션입력의 어느 부분을 얼마나 참고할지 정하는 트랜스포머의 계산 구조입니다. 길이가 늘수록 비용이 빠르게 커져서, 긴 컨텍스트 처리 비용의 대부분이 여기서 나옵니다.
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 재귀적 자기개선AI가 다음 세대 AI를 만드는 일을 스스로 맡아, 개선 속도가 사람 손을 떠나 점점 빨라지는 상태입니다. 아직 일어나지 않았지만 여러 연구소가 이걸 기준으로 안전 정책을 세웁니다.



