저정밀 포맷
FP8 · NVFP4 · BF16 · 4비트
가중치와 계산을 몇 비트로 표현할지 정하는 숫자 형식입니다. BF16에서 FP8, FP4로 내려갈수록 메모리와 전력이 줄어드는 대신 오차가 커집니다. 엔비디아가 미는 NVFP4처럼 특정 하드웨어에 묶인 포맷도 있어서, 공개 모델이 어떤 포맷으로 배포되는지가 실행 장비 선택으로 이어집니다.
‘저정밀 포맷’ 이 나오는 글6
24GB 그래픽카드에 들어가는 'Opus급', 알리바바 Qwen3.8-27B
알리바바가 8월 14일 Qwen3.8-27B 가중치를 Apache 2.0으로 공개했습니다. 파라미터 수와 구조가 4월 Qwen3.6-27B와 똑같은데 DeepSWE는 13.3에서 42.2로 올랐고, 4비트 판은 24GB 그래픽카드에 들어갑니다.
그래픽카드 한 장에 도는 30B, 메타가 16개월 만에 가중치를 풀었습니다
메타가 8월 10일 30B 오픈웨이트 모델 Muse Glimmer를 Apache 2.0으로 공개했습니다. 도구 호출 평가 MCP Atlas에서 75.5점으로 Gemma 4 31B와 Qwen 3.6 27B를 앞섰고, 화면 조작 평가 OSWorld에서는 65.9점으로 Qwen에 뒤졌습니다.

청출어람 Inkling-Small, 4분의 1 크기로 선생 넘고 사실 질문은 절반
씽킹머신즈랩이 7월 30일 Inkling의 4분의 1 크기인 Inkling-Small(276B, 활성 12B)을 공개했습니다. HLE 31.6%로 선생의 29.7%를 넘었지만 사실 질문 시험 SimpleQA Verified는 43.9%에서 20.6%로 내려갔습니다.

국내 최대 688B 모델은 무료, SK는 메모리와 데이터센터로 돈을 법니다
A.X K2는 토큰마다 330억 개만 계산하는 MoE 모델로 수학과 한국어 시험에서 비교 모델 중 1위였지만, 웹 검색 과제 BrowseComp는 9.3점이었습니다. FP8 가중치만 약 647GiB라 80GB 카드 12장 이상이 필요합니다.
작은 고추가 맵다, 118B Laguna가 1.6조 딥시크를 코딩에서 앞섰습니다
Poolside가 7월 21일 공개한 Laguna S 2.1은 DeepSWE에서 40.4%를 받아 13배 큰 딥시크 V4-Pro-Max(9.0%)를 크게 앞섰습니다. DGX Spark 한 대에서 추측 디코딩 없이 초당 13~14토큰, 붙이면 최대 24토큰이 나옵니다.

"AI를 알아야 칩을 만든다" 엔비디아가 550B 모델을 무료로 푸는 이유
엔비디아 Nemotron을 이끄는 브라이언 카탄자로가 7월 2일 MAD Podcast에서 칩 회사가 모델을 만드는 이유로 칩 설계와 생태계를 꼽았습니다. 한 달 전 공개한 550B 모델 Nemotron 3 Ultra는 20조 토큰을 4비트로 학습했습니다.

함께 나오는 용어5
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 오픈소스 라이선스공개된 가중치를 누가 어떤 조건으로 쓸 수 있는지 정하는 약관입니다. MIT와 아파치 2.0은 조건 없이 고치고 팔 수 있게 열어 두는 반면, 사용 지역이나 상업 이용에 제한을 붙인 자체 라이선스도 흔합니다. 텐센트 커뮤니티 라이선스는 EU와 영국, 한국을 사용 가능 지역에서 빼 두었다가 아파치 2.0 전환으로 그 조항을 없앴습니다.
- 오픈웨이트학습이 끝난 모델의 가중치 파일을 내려받아 직접 돌릴 수 있게 푼 것입니다. 소스 전체를 여는 오픈소스와 다르고, 내려받을 수 있다는 말과 상업적으로 써도 된다는 말도 다릅니다. 라이선스를 따로 봐야 합니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
