이 글 어땠어요?
Pro, Flash, 9B 증류 모델 모두 MIT 라이선스라 저작권 고지를 지키면 내려받아 고치고 상업 서비스에 넣을 수 있습니다. 텐센트가 4월까지 쓰던 라이선스처럼 한국을 적용 지역에서 빼는 조항은 없습니다.
Pro 가중치는 573.5GB이고 모델 카드의 실행 예시는 서버 2대에 GPU 16장을 씁니다. Flash는 3,090억 파라미터에 177.8GB라 규모가 Pro의 3분의 1 남짓입니다.
AA 지능 지수 46점과 과제당 0.13달러는 AA가 잰 값입니다. 에이전트 비교표의 경쟁 모델 점수는 샤오미가 최대 추론 설정으로 평가했고, 그 가운데 세 가지는 샤오미 내부 평가입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
오픈AI가 10월 7일 아침(한국 시각) 내부 모델이 쓴 수학 원고 722편을 깃허브에 공개했습니다. 약 4,000문제에서 나온 결과 묶음 372개로 준리만 가설 증명 주장까지 담겼고, 162편은 주 결과를 Lean으로 형식화했습니다.
미스트랄이 10월 6일 1조 파라미터 Mistral Large 4 프리뷰를 공개했습니다. 아티피셜애널리시스 지수 38점으로 중국 밖 오픈 모델 1위이고, 사이버 방어를 앞세워 가중치는 레드팀 시험 뒤 10월 말 풉니다.
알리바바가 8월 3일 Qwen3.8-Max를 공개하고 다음 주 가중치를 풀겠다고 밝혔습니다. 사람이 고르는 아레나 프런트엔드 코드 순위에서 1,668점으로 4위에 올랐지만, 자체 비교표에는 그보다 위에 있는 Opus 5와 Kimi K3가 빠져 있습니다.

오픈AI가 10월 7일 아침(한국 시각) 내부 모델이 쓴 수학 원고 722편을 깃허브에 공개했습니다. 약 4,000문제에서 나온 결과 묶음 372개로 준리만 가설 증명 주장까지 담겼고, 162편은 주 결과를 Lean으로 형식화했습니다.

미스트랄이 10월 6일 1조 파라미터 Mistral Large 4 프리뷰를 공개했습니다. 아티피셜애널리시스 지수 38점으로 중국 밖 오픈 모델 1위이고, 사이버 방어를 앞세워 가중치는 레드팀 시험 뒤 10월 말 풉니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@XiaomiMiMoX 게시물 · 원문 보기
발표는 샤오미 MiMo 공식 X 계정에 「최전선 지능, 모든 입력 방식, 공개적으로 만든 모델」이라는 문장과 함께 올라왔습니다. 두 모델은 텍스트와 이미지, 음성, 영상을 한 모델에서 받는 옴니모달 모델이고, 샤오미는 Pro가 대부분의 에이전트 평가에서 Claude Opus 5, GPT-5.6 Sol과 대등하다고 적었습니다. 이어진 글에는 Pro와 Flash, 9B 크기의 증류 모델, 기술 보고서, 강화학습 과제 환경 7,000개 이상, 학습 프레임워크, 조립해 쓰는 작은 하네스까지 공개 목록이 붙었습니다.
AA는 9월 22일 새벽 1시 38분(한국 시각) SpaceXAI의 Grok 4.7이 지능 지수 46점을 받았다고 올렸습니다. 직전 판보다 2점 높았고, 가장 높은 추론 설정(xhigh)에서 과제 하나에 출력 토큰을 약 8만 1,000개 쓴 결과였습니다. 3시간 반 뒤 AA는 MiMo-V2.6-Pro가 같은 46점으로 오픈웨이트 모델 1위에 올랐고, 과제당 0.13달러로 지능 대비 비용의 효율 곡선 위에 놓였다고 알렸습니다.
@ArtificialAnlysX 게시물 · 원문 보기
AA 지능 지수(v4.3)는 전문 업무 과제와 GDPval-AA, 터미널 작업, 과학 코딩, Humanity's Last Exam 같은 평가 10개를 묶은 점수입니다. 같은 표에서 Claude Fable 5.1과 GPT-6 Astra가 53점, Claude Opus 5가 51점, GPT-5.6 Sol이 47점이고, 직전 모델 MiMo-V2.5-Pro는 26점이었습니다. 한 세대 만에 20점이 올랐고, 최상위와의 차이는 7점입니다. Grok 4.7이 같은 점수에 이르기까지의 과정은 Grok 4.7 공개를 다룬 글에 있습니다.
점수가 같다고 모든 항목이 같지는 않습니다. AA는 Grok 4.7이 전문 업무 평가 GDPval-AA에서 1,695점을 받았다고 적었고, 샤오미 표의 MiMo-V2.6-Pro는 1,673점입니다. 두 모델이 갈리는 지점은 공개 방식과 값입니다. Grok 4.7은 문맥 50만 토큰에 가중치를 공개하지 않은 모델이고, MiMo-V2.6-Pro는 문맥 100만 토큰에 가중치를 MIT로 풀었습니다.
샤오미는 V2.6의 API 가격을 V2.5와 같게 뒀습니다. Pro는 100만 토큰당 입력 0.435달러, 출력 0.87달러이고, 앞서 보낸 내용과 겹치는 부분을 다시 읽는 캐시 적중 입력은 0.0036달러입니다. Flash는 각각 0.14달러, 0.28달러, 0.0028달러이고, 같은 품질에 출력 속도를 최대 20배로 높인 Pro UltraSpeed는 값이 10배입니다.
| 100만 토큰당 | MiMo-V2.6-Pro | Grok 4.7 |
|---|---|---|
| 입력 | 0.435달러 | 2달러 |
| 캐시 적중 입력 | 0.0036달러 | 0.50달러 |
| 출력 | 0.87달러 | 6달러 |
| AA 과제당 비용 | 0.13달러 | 3.74달러(xhigh) |
출력값 차이는 6.9배인데 과제당 비용 차이는 29배 가까이 됩니다. 에이전트 과제는 도구를 부를 때마다 앞의 대화와 파일 내용을 모델에 다시 넣기 때문에 캐시에서 읽는 토큰이 많고, 이 값에서 두 모델은 139배 차이가 납니다. AA는 Grok 4.7이 과제 하나에 쓴 출력 토큰이 직전 판보다 125% 늘었다고도 적었습니다.
이 가격은 반년 전부터 준비됐습니다. 샤오미는 4월 말 1조 파라미터의 MiMo-V2.5-Pro와 3,100억 파라미터의 V2.5를 오픈웨이트로 내면서 개발자들에게 100조 토큰을 무료로 풀었고, 5월 27일에는 V2.5 API 요금을 최대 99% 영구 인하했습니다. 6월에는 1조 파라미터 모델에서 초당 1,000토큰 넘게 출력하는 UltraSpeed를 내놨습니다.
캐시 값이 이렇게 낮은 이유는 샤오미 쪽이 이미 설명했습니다. MiMo를 만드는 뤄푸리(기술 보고서 교신저자)는 5월 요금 인하 때, 슬라이딩 윈도 어텐션(가까운 토큰만 보는 어텐션)의 KV 캐시를 여러 저장 단계에 나눠 담는 최적화를 추론 엔진에 넣어 캐시에 담을 수 있는 토큰이 5배로 늘었다고 밝혔습니다. 전체를 보는 어텐션과 가까운 토큰만 보는 어텐션을 1 대 7로 섞은 구조 덕에, 레이어 70개짜리 V2.5-Pro가 입력을 처리하는 데 드는 연산이 일반적인 어텐션을 쓰는 레이어 10개짜리 모델과 비슷하다고도 적었습니다. 뤄푸리는 내린 가격으로 추론 엔진을 거의 가득 돌려도 대체로 손익분기를 맞춘다고 했습니다.

학습 과정은 발표 전부터 밖에 공개돼 있었습니다. 딥시크에서 일하다 MiMo 개발에 합류한 뤄푸리는 9월 17일 새벽 X에 반년 가까이 조용했던 이유가 강화학습을 어디까지 키울 수 있는지 하나를 연구했기 때문이라고 쓰고, 한창 진행 중인 V2.6의 강화학습을 웹으로 중계했습니다.
@_LuoFuliX 게시물 · 원문 보기
공식 발표에 적힌 최종 값은 이렇습니다. Pro와 Flash는 각각 6일이 채 안 되는 동안 강화학습 30단계를 돌며 궤적(과제를 푸는 과정 하나) 약 75만 개를 만들었고, 비용은 Pro가 약 262만 달러, Flash가 약 85만 달러였습니다. 한 단계마다 과제 1,568개를 16번씩 풀게 했고, 단계당 35억~37억 토큰을 썼으며, 문맥은 최대 100만 토큰까지 늘렸습니다. 제가 나눠 보면 Pro는 한 단계에 약 8만 7,000달러, 궤적 하나에 3.5달러꼴입니다.
학습 방식은 과제 하나를 16번 풀게 한 뒤 그 16개 풀이를 서로 견줘 나은 쪽에 점수를 더 주는 GRPO입니다. 통과·실패만으로는 통과한 풀이들 사이의 우열을 가릴 수 없어서, 샤오미는 같은 묶음 안의 풀이를 비교해 채점 기준을 만들고 통과한 풀이끼리도 순위를 매기는 에이전트 채점기를 따로 붙였습니다. 코딩과 일반 에이전트, 시각, 사이버보안 과제는 따로 나누지 않고 한 번의 강화학습에 섞어 돌렸습니다.
효과도 숫자로 나왔습니다. 학습 과제의 평균 통과율은 Pro가 12%, Flash가 25%(상대 비율) 올랐고, 학습에 쓰지 않은 소프트웨어 개발 평가 DeepSWE v1.1에서 Pro는 58.4점에서 72.57점으로, Flash는 48.8점에서 65.68점으로 올랐습니다. 기술 보고서는 점수가 오르는 동안 모델이 쓰는 토큰 수도 함께 늘었다고 적었습니다.
262만 달러의 크기는 2년 가까이 전의 기록과 견주면 드러납니다. 딥시크는 2024년 12월 V3 기술 보고서에 전체 학습비를 GPU 한 시간 2달러 기준 557만 6,000달러로 적었고, 그 가운데 사후학습은 1만 달러였습니다. 계산 기준은 다를 수 있지만, 샤오미가 강화학습 한 구간에 쓴 돈은 V3의 사후학습비의 260배를 넘고 V3 전체 학습비의 절반에 가깝습니다. 모델의 기본 능력을 만드는 사전학습 비용은 이번에도 공개하지 않았습니다.
에 올라온 가중치는 Pro와 Flash, 그리고 알리바바의 Qwen3.5-9B를 MiMo가 만든 데이터 774억 토큰으로 미세 조정한 9B 증류 모델입니다. 세 모델 모두 MIT 라이선스라, 저작권 고지만 지키면 내려받아 고치고 상업 서비스에 넣을 수 있습니다.
강화학습 환경은 과제 약 7,000개를 네 묶음으로 나눴습니다. 실행 테스트로 채점하는 소프트웨어 개발 3,000개, 규칙으로 채점하는 취약점 재현 1,000개, 채점 기준표로 판정하는 지식 업무 1,000개, 화면으로 채점하는 웹 개발 2,000개이고, 음악 생성 과제 약 1,000개가 따로 있습니다. 긴 에이전트를 학습시키는 프레임워크 uni-agent와 강화학습 프레임워크 verl 수정판, 100줄짜리 에이전트 mimoagent는 GitHub에 올라왔습니다.

9B 모델은 샤오미가 에이전트 강화학습 연구의 공동 출발점으로 내놓은 모델입니다. 샤오미는 이 모델에 공개한 환경으로 강화학습을 돌렸더니 평가 11개가 모두 올랐다고 보고서에 적었고, SWE-bench Verified는 61.1점에서 66.2점으로, Terminal Bench 2.1은 37.1점에서 52.8점으로 올랐습니다. 다만 이 표의 평가 넷은 학습 과제와 같은 분포에서 뽑은 샤오미 내부 평가입니다.
중국 오픈웨이트 모델의 라이선스는 올해 들어 제각각이었습니다. 텐센트는 4월 Hy3 프리뷰까지 한국과 EU, 영국을 적용 지역에서 뺀 라이선스를 쓰다가 7월 Hy3 정식판부터 아파치 2.0을 달았고, 알리바바는 9월 20일 공개한 Qwen-Image-2.1의 상업 이용에 별도 라이선스를 받도록 했습니다. 딥시크는 9월 10일 V4.1-Flash를 MIT로 공개했고, 샤오미도 같은 쪽을 택했습니다.
샤오미는 모델 카드와 기술 보고서에 같은 비교표를 실었습니다. 이 가운데 오픈웨이트와 폐쇄형의 거리를 보여 주는 항목을 옮기면 이렇습니다.
| 평가 | MiMo-V2.6-Pro | Claude Opus 5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 74.0 | 73.0 | 70.0 |
| ProgramBench | 26.5 | 37.0 | 25.0 | 33.0 |
| AutomationBench v1.0.6 | 53.1 | 50.3 | 45.8 | 46.2 |
| GDPval-AA 2.1 | 1,673 | 1,708 | 1,588 | 1,595 |
| Terminal Bench 4.0 | 34.9 | 49.0 | 39.9 | 42.4 |
| OSWorld-Verified | 82.0 | 83.4 | 83.0 | 86.0 |
| JobBench | 62.0 | 65.7 | 45.4 | 57.4 |
| ExploitBench | 47.9 | 70.0 | 78.5 | 78.0 |
저는 대부분의 에이전트 평가에서 대등하다는 문장을 표로 세어 봤습니다. 두 모델 모두 점수가 있는 항목만 보면 Pro는 Opus 5에게 14개 가운데 3개에서 앞서고 1개에서 같으며 10개에서 뒤졌고, Sol과는 15개 가운데 8개를 앞서고 7개를 뒤졌습니다. 대등하다는 말은 Sol과 견줄 때 들어맞고, Opus 5와는 아직 차이가 있습니다.
표의 조건도 보고서에 적혀 있습니다. 비교 모델은 추론 강도를 지원하는 가장 높은 단계(max)로 맞춰 평가했다고 적었고, MiMo Code Bench와 MiMo Cyber Bench, MiMo Visual Coding 세 가지는 샤오미가 만든 내부 평가입니다. 사이버보안 평가 CyberGym에는 샤오미가 결함이 있다고 본 평가 환경을 고쳐서 쟀다는 각주가 달렸고, GDPval-AA는 AA가 발표하는 Elo 점수입니다.
사이버보안 항목에서는 결과가 둘로 갈렸습니다. 취약점을 재현하는 CyberGym에서 Pro는 94.0점, Flash는 95.1점을 받았지만, 공격 단계를 끝까지 밟아 나가는 ExploitBench에서 Pro(47.9점)는 Opus 5(70.0점)와 Sol(78.5점)보다 20~30점 낮았습니다. 공개한 강화학습 환경에도 취약점 재현 과제 1,000개가 들어 있습니다.
같은 날 올린 공식 블로그의 부록 표는 조금 다릅니다. 딥시크 V4.1 Flash와 Kimi K3, GPT-6 Astra, Claude Fable 5.1이 더해졌고, DeepSWE에서는 V4.1 Flash(74.2점)와 Astra(74.0점)가 Pro보다 높으며, GDPval-AA 최고점은 Fable 5.1의 1,735점입니다. 부록 표에는 Sol의 DeepSWE 점수가 빠져 있고, MiMo Cyber Bench의 Pro 점수도 모델 카드의 80.2점과 달리 81.7점으로 적혀 있습니다.
Pro는 전체 파라미터 1조 200억 개 가운데 토큰마다 420억 개만 쓰는 MoE(전문가 혼합) 모델입니다. 전문가 384개 가운데 8개를 골라 쓰니 한 번에 쓰는 파라미터는 전체의 4% 남짓이고, 계산량은 그만큼 줄지만 어떤 전문가가 불릴지 모르니 가중치 전체를 메모리에 올려 둬야 합니다. 허깅페이스에 올라온 Pro 가중치 파일은 573.5GB이고, 모델 카드의 SGLang 실행 예시는 서버 2대에 걸쳐 GPU 16장으로 모델을 나눠 올립니다.
Flash는 3,090억 개 가운데 150억 개를 쓰고 가중치는 177.8GB로 Pro의 3분의 1 남짓입니다. 두 모델 모두 100만 토큰 문맥을 받고, 6억 8,100만 파라미터의 시각 인코더와 음성 인코더가 붙습니다. 모델 카드 예시대로라면 Pro를 직접 돌리는 데는 GPU 16장 규모의 구성이 전제되고, 사내 장비가 그보다 작은 팀은 Flash부터 재 보게 됩니다.
샤오미는 코딩 능력이 소프트웨어 밖으로 넓어졌다며 시연을 여럿 실었습니다. 이미지나 영상, 문장을 받아 여러 에이전트에게 일을 나눠 3D 공간과 상호작용 규칙을 짓고 렌더링 결과를 보며 고치는 게임 개발, 문장이나 참고 이미지로 Blender에서 3D 물체를 만드는 모델링, 여러 방향의 카메라 화면을 보며 프랭카 판다 로봇팔로 물체를 집고 색을 맞춰 놓는 시뮬레이션 제어가 들어 있습니다. 슬라이드와 영상, 악기 열 개 남짓을 위한 관현악곡을 악보부터 MIDI 파일까지 만든 사례도 있고, 샤오미는 이런 쓰임을 「바이브 월드」라고 불렀습니다.
샤오미는 연구 사례 두 가지도 공개했습니다. Pro는 연구진이 짠 탐색 전략에 따라 하위 에이전트를 나눠 써 가며 리와 요크의 고전 논문 「Period Three Implies Chaos」의 주정리를 증명 검증 언어 Lean 4로 옮기는 작업을 도왔습니다. 연구진의 수정과 통합을 거친 결과는 6,000줄이 넘는 코드이고, Lean의 커널 검증을 통과했으며 증명을 비워 둔 곳(sorry)이 없습니다. 샤오미는 이 모델이 Lean 전용 사후학습을 받지 않았다고 밝혔고, 코드 전체를 내려받을 수 있게 했습니다.
소재 쪽에서는 샤오미 소재 전문가들이 여러 차례 지시를 주며, 잘 분해되지 않는 PFAS 화합물을 붙잡는 금속유기골격체(MOF)를 새로 설계하게 했습니다. Pro는 논문과 특허를 조사하고 가설을 세운 뒤 계산 도구로 결합 세기를 따져 후보 세 가지를 골랐습니다. 후보는 실제 합성 실험으로 넘길 단계까지 왔고, 실험 결과는 아직 없습니다.
MIT 라이선스라 국내 기업도 Pro와 Flash를 내려받아 고치고 제품에 넣어 팔 수 있고, 사내 서버에서 돌리면 데이터가 밖으로 나가지 않습니다. API는 샤오미 플랫폼과 OpenRouter에서 쓸 수 있고, 가격은 달러로 매깁니다.
같은 시각 AA는 한국과 관련된 글도 하나 올렸습니다. 엔비디아가 과학기술정보통신부 산하 정보통신산업진흥원(NIPA), AA와 함께 한국의 독자 AI 파운데이션 모델 사업을 위한 3자 회의를 열었고, NIPA와 AA가 AA를 이 사업의 독립 평가기관으로 정하는 업무협약을 맺었다는 내용입니다. MiMo를 오픈웨이트 1위로 매긴 평가기관이 국내 독자 모델들의 성적도 매기게 됩니다. 정부가 이 사업에 내건 목표는 6개월 안에 나온 최신 글로벌 모델 대비 95% 성능이고, 그 목표와 재는 방식은 정부의 독자 AI 목표를 다룬 글에 정리했습니다.
샤오미는 발표문에서 이번 출시를 스스로 개선하는 AI로 가는 길의 한 걸음이라고 불렀고, 뤄푸리는 학습의 세부 내용을 앞으로 몇 주에 걸쳐 차례로 공개하겠다고 밝혔습니다. 스스로 개선하는 AI 연구가 어디까지 왔는지는 자기개선 연구 491편을 분류한 글에 정리했습니다. 공개된 환경과 코드로 외부 연구자들이 DeepSWE 58.4점에서 72.57점까지의 상승을 다시 재현할 수 있는지가 다음 확인 대상입니다.
읽어 주셔서 고맙습니다.
초이 드림