# 리플렉션 첫 모델 Beam "GLM-5.2급 점수를 3~4배 적은 연산으로"
_엔비디아가 투자한 리플렉션이 전체 5,010억·활성 230억 파라미터 오픈웨이트 모델 Beam을 공개했습니다. 가중치와 기술 보고서는 10월 안에 Apache 2.0으로 풀고, 지금은 대기자 신청을 받아 일부 사용자에게만 엽니다._
- 매체: 초이의 뉴스레터 · 소식
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-10-06T23:40
- 링크: https://choi-newsletter.com/post/news-reflection-beam-open-weights
- 답하는 질문: 리플렉션 Beam 성능과 가중치 공개 일정
- 직답: Beam은 전체 5,010억·활성 230억 파라미터 모델로, 가중치는 10월 안에 Apache 2.0으로 공개됩니다.
- 출처: Reflection, Introducing Beam (10월 5일) (https://reflection.ai/blog/introducing-beam), Reflection X 발표 (10월 6일 04:11 KST) (https://x.com/reflection_ai/status/2107186849370247235), TechCrunch, Reflection debuts Beam (10월 5일) (https://techcrunch.com/2026/10/05/reflection-debuts-beam-a-open-weight-ai-model-to-rival-chinese-models-at-lower-compute-cost/), Axios, 리플렉션 첫 오픈웨이트 모델 예고 (10월 4일) (https://www.axios.com/2026/10/04/reflection-open-weight-ai), 미샤 라스킨 CNBC 인터뷰 (리플렉션 유튜브) (https://www.youtube.com/watch?v=bzABiUVkUY0), Reflection·신세계그룹 보도자료 (2026년 3월 16일) (https://www.prnewswire.com/news-releases/reflection-and-shinsegae-group-to-build-korean-sovereign-ai-factory-302715111.html), 뉴시스, 신세계 국내 최대 AI데이터센터 (3월 17일) (https://www.newsis.com/view/NISX20260316_0003549785), 네이버 하이퍼클로바 공개 보도자료 (2021년 5월 25일) (https://navercorp.com/media/pressReleasesDetail?seq=30449), Mistral, Introducing Mistral Large 4 (https://mistral.ai/news/mistral-large-4/), Artificial Analysis, Mistral Large 4 Preview (https://artificialanalysis.ai/models/mistral-large-4), Aleph Alpha Kolibri 1 모델 카드 (https://huggingface.co/Aleph-Alpha/Kolibri-1)
> 리플렉션 AI가 10월 5일(미국 시각) 첫 모델 Beam을 공개했습니다. GLM-5.2급 추론 점수를 3~4배 적은 연산으로 냈다고 밝혔지만, 자사 비교표에서도 GLM-5.3과 DeepSeek V4.1-Flash가 더 높습니다.

미국 AI 스타트업 리플렉션 AI가 10월 5일(미국 시각) 첫 자체 모델 Beam을 공개했습니다. 전체 5,010억 개 파라미터 가운데 토큰마다 230억 개만 계산에 쓰는 전문가 혼합(MoE) 모델로, 리플렉션은 자체 비교에서 중국 Z.ai의 GLM-5.2와 비슷한 추론 점수를 3~4배 적은 연산으로 냈다고 밝혔습니다. 가중치와 기술 보고서는 이달 안에 Apache 2.0 라이선스로 공개하고, 지금은 대기자 신청을 받은 일부 사용자만 쓸 수 있습니다.

발표는 한국 시각 6일 새벽 4시 11분 리플렉션 공식 X 계정에 올라왔습니다. 첫 줄에서 Beam을 매우 효율적인 에이전트용 오픈 모델이라고 소개했고, 이어 최전선급 추론 효율, 코딩·에이전트 작업에서 서구 오픈 모델의 최고 성능 경신, 처음부터 끝까지 자체 학습을 세 줄로 꼽았습니다. 함께 올린 그림은 서구 오픈 모델(씽킹머신즈 Inkling, 엔비디아 Nemotron Ultra)과 중국 오픈 모델(알리바바 Qwen 3.8 Max, Z.ai GLM 5.2)을 색으로 나눠 Beam과 견준 표입니다.

## 창업 2년, 47억 달러를 모은 회사의 첫 모델

리플렉션은 2024년 구글 딥마인드 출신 두 사람, 제미나이 개발에 참여한 미샤 라스킨(CEO)과 알파고를 함께 만든 이오아니스 안토노글루(CTO)가 세운 회사입니다. 2025년 10월 엔비디아가 이끈 20억 달러 투자에서 기업가치 80억 달러를 인정받았고, TechCrunch가 인용한 PitchBook 집계로 지금까지 모은 돈은 약 47억 달러입니다. 가장 최근 투자는 투자 전 기업가치 250억 달러에서 이뤄졌습니다.

그사이 내놓은 모델은 없었습니다. 4월 CNBC 인터뷰에서 진행자가 모델이 아직 나오지 않았다고 짚자, 라스킨은 이런 모델은 만들기 어렵다며 로켓에 빗댔습니다.

> 작은 로켓은 만들 수 있지만 그걸로는 아무도 감탄하지 않습니다. 큰 로켓을 만들려면 시간이 걸립니다.
> — 미샤 라스킨, 리플렉션 CEO (CNBC, 4월)

연산은 모델보다 먼저 확보했습니다. 6월에는 SpaceX와 7월부터 2029년까지 매달 1억 5,000만 달러를 내는 GPU 임대 계약을 맺었고, 7월에는 네비우스와 10억 달러 규모 계약을 맺었습니다. TechCrunch는 두 계약을 합치면 70억 달러가 넘고, 2029년까지 엔비디아 GB300 칩을 쓰는 조건이라고 전했습니다. SpaceX 쪽 계약 조건은 [머스크의 AI 매출 전망](/post/review-musk-spacex-ai-99-percent)을 다룬 글에 정리해 두었습니다.

발표 하루 전인 4일에는 미국 매체 액시오스가 리플렉션이 곧 첫 오픈웨이트 모델을 낸다고 보도했습니다. 처음에는 미국 최전선 모델보다 뒤처지겠지만 중국 최고 수준의 오픈웨이트 모델과는 겨룰 만하다는 내용이었고, 이달 안에 다른 서구 회사들의 오픈웨이트 모델도 잇따라 나온다고 덧붙였습니다.

## 5,010억 개 가운데 230억 개만 켜는 구조

MoE는 작은 신경망 여러 개를 전문가로 두고, 토큰마다 그중 몇 개만 골라 계산하는 구조입니다. 모델 파일에는 5,010억 개가 모두 들어 있어야 하지만 토큰 하나를 만들 때 실제로 계산하는 파라미터는 230억 개, 전체의 약 4.6%입니다. Beam은 레이어 52개에 잘게 나눈 전문가를 두고, 가까운 문맥만 보는 어텐션과 문맥 전체를 보는 어텐션을 번갈아 배치했습니다. 리플렉션은 사전학습이 끝났을 때 가장 바쁜 전문가의 부하가 평균의 1.04배였다며 전문가들이 고르게 쓰였다고 밝혔습니다.

사전학습에는 웹과 공개 자료, 라이선스를 산 데이터에서 고른 23조 8,000억 토큰을 썼습니다. 원래 인터넷 토큰의 약 95%를 파싱과 중복 제거, 선별 단계에서 걸러냈고, 흔히 쓰는 웹 필터라면 버렸을 고품질 토큰 약 1조 8,000억 개를 자체 분류기로 살렸다고 적었습니다. 학습은 엔비디아 GB300 NVL72 시스템의 GPU 6,144개로 4주가 채 걸리지 않았고, 기울기가 갑자기 튀거나 칩이 계산 결과를 조용히 틀리게 낸 것으로 의심되는 문제로 9번 되감았습니다. 문맥 길이는 중간 학습 단계에서 100만 토큰까지 늘렸고, 입력은 텍스트만 받습니다.

## '3~4배 적은 연산'을 센 방법

리플렉션이 발표문에서 가장 앞에 세운 숫자는 점수보다 그 점수를 내는 데 든 계산량입니다. 고급 추론 평가에서 GLM-5.2와 비슷한 점수를 내면서 추론 연산은 3~4배 적게 썼다는 주장이고, 계산 방법도 함께 밝혔습니다. 답 한 번에 드는 연산을 2 × 토큰당 활성 파라미터 × 평균 생성 토큰 수로 어림했습니다. 활성 파라미터가 적을수록, 같은 문제를 적은 토큰으로 풀수록 값이 작아집니다. TechCrunch에 따르면 GLM-5.2는 전체 약 7,440억 개, 활성 400억 개라서 토큰 하나를 만드는 계산부터 Beam(230억 개)의 1.7배입니다.

![DeepSWE v1.1, HLE, Terminal Bench 2.1 세 평가에서 가로축을 답 한 번의 생성 연산(PFLOP), 세로축을 점수로 놓은 산점도. Beam의 점들은 가로축 0~2 사이 왼쪽에 모여 있고 GLM-5.2와 Qwen3.8은 오른쪽에 떨어져 있습니다.](https://cdn.sanity.io/images/sp40emik/production/04c464d0bf944b2cc60f788e7bb8bcb1a8df0bb9-2400x1350.png?w=1600)

그림의 가로축이 답 한 번을 만드는 데 든 연산입니다. Beam의 점들은 왼쪽 끝에 모여 있고 GLM-5.2와 알리바바 Qwen3.8은 오른쪽으로 떨어져 있습니다. 리플렉션 스스로 적은 대로 이 값은 입력 문맥을 읽는 연산과 어텐션 계산, 서비스 운영 부담을 뺀 어림값이고, 다른 모델의 점수와 토큰 수는 아티피셜애널리시스와 DataCurve 자료에서 가져왔습니다. 실제 서비스 요금이나 서버 비용을 잰 숫자는 발표에 없습니다.

사용자가 고르는 추론 강도 설정도 이 효율과 이어집니다. 리플렉션은 강화학습 중에 불필요한 토큰을 줄이도록 길이에 벌점을 주는 보상을 넣었고, 학습 초반에는 답이 짧아지면서 점수가 올랐다가 에이전트 능력이 붙은 뒤에는 답이 다시 길어지며 점수가 더 올랐다고 설명했습니다. 사용자는 짧게 답하는 낮은 강도부터 오래 생각하는 높은 강도까지 과제와 예산에 맞춰 정할 수 있습니다.

## 4주 동안 1억 번 넘게 풀게 했습니다

리플렉션은 Beam의 실력이 대부분 강화학습에서 나왔다고 설명합니다. 강화학습은 모델에게 과제를 실제로 풀게 하고 결과에 점수를 매겨 행동을 고치는 학습입니다. 리플렉션은 GB300 GPU 1만 500개를 4주 동안 돌려 롤아웃(모델이 과제 하나를 처음부터 끝까지 푼 기록)을 1억 건 넘게 만들었고, 풀이 하나가 최대 25만 6,000 토큰까지 이어지도록 허용했습니다. 코딩·에이전트·과학 과제 환경 약 100만 개를 마련했고, 학습과 채점에 격리된 실행 환경(샌드박스)을 약 13억 개 썼습니다.

![가로축은 강화학습 롤아웃 수(백만 건), 세로축은 점수인 꺾은선 그래프 세 개. DeepSWE는 약 5%에서 41%로, HLE는 약 20%에서 36%로, Terminal Bench 2.1은 약 53%에서 78%로 오릅니다.](https://cdn.sanity.io/images/sp40emik/production/fd3b739222992f2567c8a849718ba1f08e19ebc5-1200x675.png)

그림은 추론 담당 모델의 학습에 쓴 롤아웃 8,000만 건까지의 점수입니다. 롤아웃이 늘어나는 동안 코딩 에이전트 평가 DeepSWE 점수는 약 5%에서 41%까지 올랐고, 리플렉션은 학습이 끝날 때까지 점수가 포화하는 기미가 없었다고 적었습니다. 견줄 숫자도 함께 냈습니다. 씽킹머신즈의 Inkling은 롤아웃 3,000만 건, 샤오미 MiMo는 75만 3,000건으로 학습했다는 것입니다. 이 규모를 버티려고 평균 11만 개의 롤아웃을 동시에 돌렸고, 하루 전에 만든 풀이 기록까지 학습에 넣으면서도 수치가 안정적이었다고 밝혔습니다.

가르치지 않은 일로 번진 능력도 소개했습니다. 추론·소프트웨어·터미널 과제만 학습한 구간에서도 웹 검색 성능이 함께 올랐고, 웹 접근을 주자 다른 언어 모델에 질문을 보내고 문서를 읽으려 OCR API를 찾아 쓰는 법을 스스로 익혔다는 설명입니다. 시연으로는 공개 데이터로 만든 뉴욕 지하철 실시간 지도와 구글의 가장 작은 Gemma 4 모델을 Text2SQL 과제로 파인튜닝하는 노트북을 공개했습니다. 파인튜닝한 Gemma는 따로 떼어 둔 시험 문제에서 정확도가 66.5% 올랐습니다.

## 같은 표에 GLM-5.3과 V4.1-Flash를 놓으면

X에 올린 그림에 든 중국 모델은 6월에 나온 GLM-5.2와 알리바바 Qwen 3.8 Max 둘입니다. 블로그의 전체 표에는 8월에 나온 [GLM-5.3](/post/news-glm-53-posttraining-openweight)과 7월의 [Kimi K3](/post/news-kimi-k3-open-weight-frontier), 9월에 MIT 라이선스로 풀린 [DeepSeek V4.1-Flash](/post/news-deepseek-v41-flash-mit-license)까지 들어 있습니다. 세 모델을 함께 놓으면 표의 순서가 달라집니다.

| 평가 (리플렉션 발표 표) | Beam | GLM-5.3 | Kimi K3 | DeepSeek V4.1-Flash | Inkling | Nemotron 3 Ultra |
| --- | --- | --- | --- | --- | --- | --- |
| DeepSWE v1.1 | 44.4 | 61.0 | 68.0 | 74.2 | 미보고 | 미보고 |
| Terminal Bench 2.1 | 80.1 | 88.2 | 88.3 | 90.6 | 63.8 | 56.4 |
| HLE (도구 없이) | 36.2 | 42.3 | 46.9 | 39.1 | 29.7 | 26.7 |
| SciCode | 49.7 | 59.0 | 58.7 | 52.0 | 46.1 | 44.6 |
| GPQA Diamond | 90.5 | 91.7 | 93.5 | 90.9 | 87.2 | 87.0 |
| AutomationBench | 37.0 | 48.2 | 46.7 | 54.8 | 미보고 | 미보고 |

리플렉션이 직접 낸 표에서 GLM-5.3은 함께 보고된 모든 항목에서 Beam보다 높고, Kimi K3는 은행 업무 에이전트 평가(tau3 banking) 하나를 빼면 모두 앞섭니다. DeepSeek V4.1-Flash는 전체 5,520억 파라미터로 Beam과 몸집이 비슷한데 표의 대부분 항목에서 앞서고, 가중치는 9월 10일부터 누구나 내려받을 수 있습니다. Beam이 V4.1-Flash를 앞선 항목은 물리 연구 문제 평가 CritPt(16.3 대 14.3)와 사실 질문에서 틀린 답을 감점하는 아티피셜애널리시스 Omniscience 공개 문항(13.0 대 6.6) 정도입니다. 효율 그림에는 이 세 모델이 없습니다.

리플렉션도 이 차이를 발표문에 적었습니다. Kimi K3 같은 최전선 오픈 모델이 순수한 능력에서는 아직 앞서 있고, Beam의 강점은 추론할 때의 효율이라는 문장입니다. 비교의 기준을 미국과 유럽 오픈 모델로 옮기면 결과가 다릅니다. 같은 표에서 Beam은 Inkling과 Nemotron 3 Ultra를 대부분 항목에서 앞섭니다. 지시 따르기 평가 IFBench에서는 두 모델이 근소하게 높고, Inkling은 Omniscience 공개 문항에서도 앞섭니다. 아티피셜애널리시스 같은 외부 기관의 측정은 6일 밤까지 나오지 않았고, 지금 있는 숫자는 모두 리플렉션이 재거나 옮겨 적은 값입니다.

## 같은 날 밤, 미스트랄은 1조 파라미터

액시오스가 예고한 다른 서구 회사들의 모델은 곧바로 나왔습니다. 3일에는 독일 알레프 알파가 781억 파라미터 [Kolibri](/post/news-aleph-alpha-kolibri-open-weights)를 Apache 2.0으로 풀었고, Beam 발표 18시간 뒤인 6일 밤 10시(한국 시각)에는 프랑스 미스트랄이 Mistral Large 4 프리뷰를 공개했습니다. 아티피셜애널리시스는 미스트랄 모델을 공개 당일 측정해 지능 지수 38점을 매겼는데, 미국과 유럽 회사가 낸 오픈웨이트 모델(공개 예정 포함) 가운데 가장 높은 점수입니다.

| 항목 | Beam (리플렉션) | Mistral Large 4 (미스트랄) |
| --- | --- | --- |
| 발표 (한국 시각) | 10월 6일 04:11 | 10월 6일 22:06 |
| 전체 / 토큰당 활성 파라미터 | 5,010억 / 230억 | 약 1조 / 490억 |
| 입력 | 텍스트 | 텍스트·이미지 |
| 최대 문맥 | 100만 토큰 | 100만 토큰 (문서 기준) |
| 학습 장비 | GB300 6,144개 (사전학습), 1만 500개 (강화학습) | 그레이스 블랙웰 GPU 3,800개 |
| 지금 쓰는 방법 | 대기자 신청, 일부 사용자 | API 프리뷰 |
| 가중치 공개 | 10월 중 | 10월 말 |
| 라이선스 | Apache 2.0 | 발표 안 함 |
| 외부 측정 | 없음 | 아티피셜애널리시스 지수 38 |

두 회사가 내세운 강점도 갈립니다. 리플렉션은 텍스트만 읽는 모델로 계산 효율과 코딩·에이전트 작업을 앞세웠고, 미스트랄은 이미지까지 읽는 모델로 사이버 보안과 금융·제조 업무 성능을 앞세웠습니다. 활성 파라미터는 Beam이 Mistral Large 4의 절반이 안 되고, 라이선스는 Beam이 먼저 밝혔습니다.

## 라스킨이 말한 트로이의 목마

리플렉션이 오픈웨이트에 거는 이유는 라스킨이 같은 CNBC 인터뷰에서 설명했습니다. 지금 가장 좋은 오픈 모델은 중국에서 나오고, 국가와 기업이 오픈 모델을 고르면 그 모델에 맞춘 칩과 소프트웨어까지 함께 따라 들어간다는 것입니다.

> 오픈 모델은 자기와 함께 들어오는 인프라를 실어 나르는 트로이의 목마입니다.
> — 미샤 라스킨, 리플렉션 CEO (CNBC, 4월)

라스킨 CEO가 CNBC에서 투자 유치와 중국 오픈 모델과의 경쟁, 안전 문제를 설명한 인터뷰입니다(리플렉션 유튜브 채널).

라스킨은 각국 정부와 맺는 소버린 AI 계약에서 리플렉션이 부딪히는 상대가 폐쇄형 모델 회사보다 중국 오픈 모델이라고 말했습니다. 남의 모델을 빌려 쓰면 언제든 끊길 수 있어서, 모델을 자기 자산으로 갖고 싶은 나라와 기업에는 오픈 모델이 필수 조건이 됐다는 설명입니다. 액시오스도 은행이나 미 국방부처럼 큰 서구 사용자들이 보안 문제로 중국 모델을 꺼린다고 전했습니다.

엔비디아가 리플렉션에 투자한 이유도 이 계산과 이어집니다. 리플렉션이 파는 AI 공장은 기관이 자기 데이터로 리플렉션 모델을 고쳐 학습하고 자기 연산 위에서 돌리는 묶음 상품이고, 젠슨 황 엔비디아 CEO가 여러 해 동안 내세운 개념입니다. 리플렉션이 SpaceX·네비우스와 맺은 연산 계약도, 한국에 지을 공장 계획도 모두 엔비디아 GPU를 씁니다. 7월 젠슨 황이 첫 X 게시물로 올린 [오픈웨이트 공동 서한](/post/review-nvidia-open-letter-plural-frontier)에도 리플렉션은 처음 서명한 25곳 가운데 하나로 이름을 올렸습니다.

## 한국에서는 신세계와 250MW

리플렉션이 이 구상을 처음 시험하는 상대가 한국 신세계그룹입니다. 두 회사는 3월 16일(미국 시각) 샌프란시스코에서 한국 소버린 AI 팩토리 건립을 위한 전략적 파트너십 양해각서를 맺었습니다. 한국에 전력 용량 250MW 규모의 AI 데이터센터를 단계적으로 짓고, 리플렉션의 오픈웨이트 모델과 엔비디아 GPU로 한국 정부 기관과 기업에 AI를 공급한다는 계획입니다. 리플렉션은 칩과 모델, 엔지니어링을 맡고 신세계는 부지와 전력, 인허가, 자금을 맡습니다.

2025년 7월 트럼프 대통령 행정명령으로 시작한 미국 AI 수출 프로그램의 1호 사업이라, 하워드 러트닉 상무장관이 서명식에 직접 나왔습니다. 양사는 연내 합작법인 설립을 목표로 잡았고, 발표 당시 부지와 투자 금액은 정해지지 않았습니다.

5년 전 한국 회사가 말한 AI 주권은 다른 모습이었습니다. 2021년 5월 네이버는 하이퍼클로바를 공개하며 GPT-3(1,750억 개)보다 많은 2,040억 개 파라미터와 한국어 비중 97%의 학습 데이터 5,600억 토큰을 내세웠고, 영어 중심 모델에 기대지 않는 이 선택을 AI 주권 확보라고 불렀습니다. 신세계가 서명한 주권 AI 공장은 미국 회사의 오픈웨이트 모델과 미국 칩을 한국 땅에 두는 계획입니다. 리플렉션 보도자료는 오픈웨이트 모델을 쓰기 때문에 한국이 가장 중요한 시스템을 움직이는 기술을 들여다볼 수 있다고 설명합니다.

## 한국에서 언제, 어떻게 쓸 수 있나

한국어 성능은 공개되지 않았습니다. 발표문의 평가는 코딩과 추론, 도구 사용 중심이고, 리플렉션 표의 SWE-bench Multilingual은 여러 프로그래밍 언어로 된 과제를 푸는 평가입니다. 사전학습 데이터의 언어별 비중도 밝히지 않았습니다.

상업 이용은 가중치가 나오는 대로 가능합니다. 리플렉션은 Apache 2.0으로 공개하겠다고 밝혔는데, 이 라이선스는 상업적 사용과 수정, 재배포를 허용합니다. 7월 Apache 2.0으로 나온 [Inkling](/post/news-thinking-machines-inkling-open-weights)과 같은 조건입니다. 중국 모델 가운데 DeepSeek V4.1-Flash는 MIT 라이선스로 풀렸고, GLM-5.3과 Kimi K3는 회사가 따로 만든 라이선스를 씁니다.

받을 수 있는 시점은 이달 안입니다. 리플렉션은 가중치와 기술 보고서, 모델 카드를 내면서 모델을 실행하고 평가하고 파인튜닝하는 데 필요한 도구까지 함께 공개하고, 대형 클라우드와 GPU 임대 전문 클라우드를 통해 배포하겠다고 했습니다. 지금은 리플렉션 플랫폼에서 대기자 신청을 받습니다. 돌리는 데 필요한 장비는 아직 밝히지 않았습니다. 알레프 알파는 781억 파라미터 Kolibri를 8비트로 담으면 약 78GB라 B200 한 장에 올라간다고 모델 카드에 적었는데, Beam은 파라미터가 그 6배를 넘습니다.

## 기술 보고서로 미룬 것들

안전 평가 결과도 기술 보고서로 미뤘습니다. 리플렉션은 대규모 강화학습 모델과 안전·정렬 전용 모델을 따로 학습한 뒤 두 모델의 능력을 하나로 증류했고, 안전 정책을 추론 과정 안에 넣는 숙의적 정렬(deliberative alignment) 기법을 썼다고 적었습니다. 결과는 기술 보고서에 싣고, 내부에서 만든 안전 평가 도구도 오픈소스로 풀겠다고 약속했습니다.

6월의 GLM-5.2를 기준으로 한 효율 비교가 8월의 GLM-5.3이나 9월의 V4.1-Flash 앞에서도 유지되는지는 외부 측정이 나와야 확인됩니다. 리플렉션은 Beam이 시리즈의 첫 모델이고 다음 모델을 이미 학습하고 있다고 밝혔습니다. 가중치와 보고서가 나오면 다시 전하겠습니다.

읽어 주셔서 고맙습니다.

초이 드림
