
서버를 거치지 않고 노트북이나 휴대폰에서 모델을 직접 돌리는 방식입니다. 양자화와 소형 MoE가 발전하면서 24GB 메모리에서 도는 에이전트급 모델이 나왔습니다.
용어 자세히 보기

Husky는 Woof 모델 하나에 맞춰 설계한 MSI(모델 전용 추론) 방식 엔진입니다.
모델 구조를 미리 알기 때문에 정규화, 4비트 압축 해제, 행렬 연산을 GPU 작업 하나로 묶어 CPU와 GPU가 오가는 비용을 줄였습니다.
맥북에서 Woof를 최대 초당 730토큰으로 돌리고, 인터넷 연결 없이 맥과 아이폰에서 구동합니다.
Choi
공식 페이지 기준으로 최대 4.5배는 학습된 초안 모델 Flash를 켠 값이고, 편집 작업은 1.8~3.9배, 첫 단어가 나오기까지는 3.6~5.5배 빨랐습니다.
대화를 만드는 대신 사용자의 요청을 보고 필요한 기능을 고르고 실행에 필요한 값을 채웁니다.
Raspberry Pi 5에서도 초당 최대 4,000토큰으로 돌아갑니다.
Cactus 자체 평가에서 모바일 명령 정확도 86.0을 기록해 LFM2.5 1.2B의 82.4를 앞섰고, 특정 작업에 파인튜닝한 29M 모델은 DroidCall에서 DeepSeek V4 Flash를 넘어섰다고 밝혔습니다.
다만 별도 Jev 비교에서는 성능과 속도 모두 Jev보다 낮았습니다.
Choi
8~29MB 크기라 스마트폰·워치·로봇에서 서버 없이 돌고, 사용자 자료가 기기 밖으로 나가지 않습니다.
Edge0가 대형 AI 모델을 클라우드 없이 기기 안에서 실행하는 프레임워크를 오픈소스로 공개했습니다.
35B 모델도 전체 모델을 메모리에 올리지 않고 필요한 부분만 저장장치에서 불러오는 방식으로 최대 메모리 사용량을 1~2.5GB 수준으로 낮췄습니다.
게임 코드 생성, 3D 공간 제작, 웹페이지 개발까지 스마트폰에서 처리할 수 있고 데이터도 외부 서버로 보내지 않습니다.
Choi
모델 전체를 메모리에 올리지 않고 필요한 부분만 저장장치에서 읽어 오기 때문에, 메모리 대신 저장장치 읽기 속도가 응답 속도를 좌우합니다.
Q4 기준 1.7GB 안팎으로 스마트폰에서도 돌아가며, 128K 컨텍스트와 34조 토큰 사전학습을 적용했습니다.
2.5GB 미만 메모리에서 M5 Max 초당 220토큰, 폰에서도 초당 30토큰으로 도구를 부르며 다단계 작업을 처리합니다.
학습은 OpenClaw·Hermes Agent·Pi 같은 실제 하네스 안에서 멀티턴 강화학습으로 진행했고, 그 결과 도구 사용과 지시 이행에서는 최대 네 배 큰 모델을 앞섰습니다.
다만 코딩은 큰 모델이 여전히 낫습니다.
모델과 하네스를 따로 연결하던 방식에서, 실제 에이전트 환경 자체를 학습시키는 방식으로 넘어가고 있습니다.
Choi
폰 위에서 도구를 부르기 시작하면 왕복 지연과 토큰 청구가 함께 사라집니다. 코딩을 뺀 작업부터 옮겨갈 여지가 큽니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.