앨런 AI 연구소(Ai2)와 케임브리지대, 워싱턴대 등의 연구진이 이미 학습된 서브워드(단어 조각) 언어 모델을 바이트 단위로 글을 읽고 쓰는 모델로 바꾸는 「바이트화(byteification)」 논문을 네이처에 실었고, Ai2는 한국 시각 10월 8일 새벽 1시께 X에서 게재를 알렸습니다.
일반적인 사전학습 예산의 1%가 안 되는 491억 토큰만 더 학습하는 2단계 방법으로, Olmo 3 7B를 바꾼 Bolmo 7B는 처음부터 학습한 바이트 모델 BLT 7B보다 STEM 과제에서 16.5%포인트 높았습니다.
Ai2는 같은 방법을 Qwen3 8B와 Llama 3 8B에 적용한 Bwen 8B와 Blama 8B 체크포인트도 허깅페이스에 공개했습니다.
Choi
논문은 서브워드 모델이 글자 단위 정보를 가려 코드나 생물 서열처럼 글자 하나가 뜻을 바꾸는 데이터에 약하고, 바이트 모델은 그동안 처음부터 새로 학습해야 해 성능을 따라가지 못했다고 설명합니다. 바꾼 모델은 원본보다 글자 이해 과제에서 크게 앞섰고, 원본의 후속 학습 가중치 차이를 더하는 방식으로 지시 수행 능력도 추가 학습 없이 옮겨 받았습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.