글을 모델이 읽는 토큰 단위로 쪼개는 규칙과 어휘 사전입니다. 같은 문장이라도 토크나이저에 따라 토큰 수가 달라져서 요금과 컨텍스트 소모가 함께 바뀝니다. 제작사를 숨긴 익명 모델의 정체를 어휘 일치 검사로 밝혀내는 데 쓰이기도 합니다.
용어 자세히 보기
온디바이스 MoE인 LFM2.5-8B-A1B의 어휘를 65K에서 128K로 키웠는데, 태국어는 토큰이 4배 줄고 폰에서 글자당 디코딩이 최대 3.7배 빨라졌습니다.
토크나이저가 언어를 잘게 쪼개면 단어 하나가 여러 토큰이 되어 느리고 비싸집니다.
그동안 비영어권, 특히 아시아 언어가 이 '토큰세'를 물어 왔는데, 사전학습을 처음부터 다시 돌리는 대신 기존 어휘를 넓히고 짧게 추가 학습만 시켜 깎았습니다.
다만 대가도 따릅니다.
어휘가 커지면 매 토큰마다 읽어들일 행렬도 같이 커져 토큰당 7~10% 느려지고, 그래서 128K에서 멈췄습니다.
소식14분AI
소식AI
256K까지 밀면 폰에서 최대 37%를 손해 보기 때문입니다.
한국어처럼 잘게 쪼개지는 언어에도 그대로 쓸 수 있어, 이런 개조가 더 늘 것 같습니다.
Choi
사전학습을 다시 돌리지 않고 어휘를 넓힌 뒤 짧게 추가 학습해 태국어 토큰을 4배 줄였습니다. 어휘가 커질수록 토큰당 7~10% 느려져 128K에서 멈췄습니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.