이 글 어땠어요?
7월 23일 기준으로 FLUX 3 Video만 얼리 액세스 신청을 받아 열려 있습니다. FLUX 3 Image는 몇 주 안에 얼리 액세스를 열 예정이고, 오픈 웨이트 FLUX 3 Dev는 시점이 발표되지 않았습니다.
BFL의 초기 비교에서 FLUX 3를 고른 비율은 Seedance 2.0·Gemini Omni Flash 대비 52%, Kling v3 Pro 대비 60%, Luma Ray 3.2 대비 93%였습니다. 초기 후보 모델을 BFL이 직접 평가한 10초짜리 720p 영상 기준입니다.
mimic robotics가 FLUX 3를 뼈대로 만든 로봇 제어 모델입니다. 영상 모델이 예측한 미래의 내부 표현에서 로봇 동작을 뽑아내고, 아우디와 실제 생산 과제에서 시험하고 있습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
알리바바 Qwen 팀이 9월 20일 생성부 7B의 이미지 생성·편집 모델 Qwen-Image-2.1 가중치를 공개했습니다. 자체 채점표 29개 모델 가운데 7위로 Nano Banana 2.0보다 0.46점 높았고, 상업 이용에는 별도 라이선스가 필요합니다.

매주 30억 장 넘는 ChatGPT 이미지 생성에 9월 8일 새 기본 모델 Images 2.5가 들어왔습니다. Arena에서 GPT-Image-2보다 텍스트→이미지는 40점, 다중 이미지 편집은 81점 올랐고, 세 부문 1~3위가 모두 오픈AI 모델입니다.
arXiv가 10월 1일부터 제출자 한 사람당 한 달 2편, 동시 심사 3편으로 제출을 제한했습니다. 9월 제출은 4만 363편으로 2년 전 9월의 두 배였고, 지원 요청은 9,000건 가까이 쌓였습니다.

알리바바 Qwen 팀이 9월 20일 생성부 7B의 이미지 생성·편집 모델 Qwen-Image-2.1 가중치를 공개했습니다. 자체 채점표 29개 모델 가운데 7위로 Nano Banana 2.0보다 0.46점 높았고, 상업 이용에는 별도 라이선스가 필요합니다.

매주 30억 장 넘는 ChatGPT 이미지 생성에 9월 8일 새 기본 모델 Images 2.5가 들어왔습니다. Arena에서 GPT-Image-2보다 텍스트→이미지는 40점, 다중 이미지 편집은 81점 올랐고, 세 부문 1~3위가 모두 오픈AI 모델입니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@bfl_aiX 게시물 · 원문 보기
BFL은 한국 시각 24일 0시 8분 공식 X 계정에 이 영상을 올리며 FLUX 3를 이미지·영상·오디오·행동 예측을 하나로 묶은 멀티모달 모델이라고 소개했습니다. 이어지는 글에 FLUX 3 Video 얼리 액세스 신청 주소와 앞으로의 공개 순서, 로봇 회사 mimic과 함께 만든 FLUX-mimic 소식을 차례로 붙였습니다. AI 소식을 전하는 앤드루 커런은 40여 분 뒤 전날 돈 소문이 모두 사실이었다며 완전한 멀티모달에 20초 생성이 된다고 적었습니다.
BFL은 이미지 생성 모델 스테이블 디퓨전의 바탕이 된 연구를 한 로빈 롬바흐, 안드레아스 블라트만, 파트리크 에서가 스태빌리티 AI를 나와 2024년 독일 프라이부르크에 세운 회사입니다. 그해 8월 낸 첫 모델 FLUX.1은 가장 빠른 [schnell]을 Apache 2.0으로, 중간 등급 [dev]를 비상업 라이선스로 가중치까지 풀었고, 2025년 5월에는 글과 이미지를 함께 넣어 그림을 고치는 Kontext, 11월에는 FLUX.2를 내놓았습니다.
회사 규모도 이 사이에 커졌습니다. BFL은 2025년 12월 1일 기업가치 32억 5,000만 달러로 3억 달러 시리즈 B 투자를 받았다고 발표하면서, 자사 오픈 모델이 허깅페이스에서 가장 인기 있는 이미지 모델이고 어도비와 캔바, 메타, 마이크로소프트가 FLUX 위에 제품을 만들고 있다고 적었습니다. 본사는 프라이부르크와 샌프란시스코 두 곳입니다.
여기까지 BFL의 모델은 모두 그림을 만드는 모델이었습니다. BFL은 FLUX-mimic 소개 글에서 FLUX 1과 FLUX 2는 이미지를 만들고, FLUX 3는 소리와 영상을 함께 만들면서 동시에 로봇 모델의 바탕이 된다고 정리했습니다.
BFL이 내세운 논리는 이렇습니다. 이미지는 한 순간의 공간 구조를, 영상은 시간에 따른 움직임과 물리 법칙을, 소리는 눈으로는 알 수 없는 충돌과 소리의 인과를 담고 있어서 어느 하나도 세상을 온전히 설명하지 못한다는 겁니다. 셋을 함께 배우면 소리는 부딪힘과 맞아야 하고 움직임은 질량을 따라야 한다는 제약이 서로를 가르치고, 모델은 세 가지 신호를 하나의 현실에 대한 증거로 쓰게 된다고 설명했습니다.

학습에 드는 연산은 영상이 거의 다 차지합니다. BFL에 따르면 영상 예측이 전체 학습 연산의 95%를 넘고, 소리는 720p 영상에 오디오를 붙였을 때 토큰의 0.5%도 되지 않습니다. 영상에서 접촉과 움직임, 원인과 결과를 배우고 나면 입 모양에 맞는 말소리와 물체가 부딪히는 순간의 효과음은 그 위에 비교적 쉽게 얹힌다는 것이 BFL의 설명입니다.
바탕 기술은 BFL이 앞서 공개한 Self-Flow입니다. 생성 능력과 이해 능력을 한 학습 틀 안에서 함께 키우는 방법으로, 기존 방식(플로 매칭)보다 생성 오차가 영상에서 9.1%, 이미지에서 8.5%, 오디오에서 2.1% 줄었고, 시뮬레이션 속 로봇 조작 성공률은 35%에서 47%로 올랐다고 BFL은 밝혔습니다. FLUX 3는 이 방법에 연산과 데이터를 크게 늘려 영상·이미지·오디오를 동시에 학습시킨 모델입니다.

FLUX 3 Video는 글이나 이미지, 기준 영상을 받아 소리가 붙은 영상을 만듭니다. BFL이 꼽은 기능은 글로 영상 만들기, 첫 프레임 이미지나 참고 이미지로 영상 만들기, 기준 영상의 인물을 새 배경과 상황으로 옮기기, 이미 있는 영상과 소리 이어 만들기, 키프레임 사이 연결, 여러 언어 대사, 짧은 클립을 에이전트처럼 이어 붙여 여러 컷짜리 영상 만들기입니다. 모든 결과물에 소리가 함께 나옵니다.
BFL은 FLUX 3 Video가 특히 사람의 표정, 물리적 사건과 소리의 짝 맞추기, 여러 언어에 강하다고 적었습니다. 시각 참고 자료를 함께 쓰면 컷이 바뀌어도 같은 인물을 유지하면서 몇 분짜리 이야기로 이어 붙일 수 있다고도 했습니다.
소리가 붙은 영상 자체는 처음 나온 기능이 아닙니다. 구글은 2025년 5월 Veo 3를 내놓으며 처음으로 도시의 소음과 새소리, 인물 사이의 대사까지 영상과 함께 만든다고 밝혔습니다. FLUX 3의 다른 점은 이미지와 영상, 오디오에 로봇 행동 예측까지 모델 하나에 묶었다는 데 있습니다.
@venturetwinsX 게시물 · 원문 보기
미리 써 본 사람들의 반응도 발표 직후부터 올라왔습니다. 벤처캐피털 a16z의 저스틴 무어는 공개 39분 뒤 지난 몇 주 동안 FLUX 3를 써 왔다며, 프롬프트 하나로 여러 컷에 걸친 20초 영상을 만든다고 적고 마음에 든 결과물을 묶어 올렸습니다. 영상이 진짜처럼 보이게 하는 작은 디테일에 특히 강하다는 평이었습니다. a16z는 BFL의 시리즈 B 발표에 기존 투자사로 이름이 올라 있습니다. 이런 첫날 결과물은 잘 나온 것을 골라 올리는 경우가 많아, GPT-5.6 첫날 사례 15건을 셀 때도 비용을 밝힌 사례는 한 건도 없었습니다.
이미지 기능은 아직 열리지 않았습니다. BFL은 학습 중간 평가에서 FLUX 3가 복잡한 프롬프트와 여러 언어의 글자 표현에서 이전 FLUX보다 크게 나아졌다고 밝히고, FLUX 3 Image 얼리 액세스는 몇 주 안에 열겠다고 했습니다.

BFL은 소리가 붙은 10초짜리 720p 영상을 글로 만들게 해 경쟁 모델과 나란히 보여 주고 사람들이 어느 쪽을 고르는지 셌습니다. FLUX 3를 고른 비율은 루마 Ray 3.2와 견줄 때 93%, 런웨이 Gen-4.5와는 77%, Grok Imagine Video와는 69%였습니다. 콰이쇼우의 Kling v3 Pro와는 60%였습니다.
한데 가장 강한 상대 둘과는 거의 반반이었습니다. 바이트댄스의 Seedance 2.0, 구글의 Gemini Omni Flash와 견준 비율은 각각 52%로, 50%가 정확히 반반입니다. BFL은 이 평가가 개발 중인 초기 후보 모델로 한 예비 결과이고 얼리 액세스 기간에 더 나아질 것으로 본다고 적었습니다. 평가에 쓴 프롬프트와 평가자 수, 외부 기관의 비교는 발표문에 없습니다.
FLUX 3의 네 번째 축은 행동 예측입니다. BFL은 두 갈래로 접근한다고 밝혔습니다. 하나는 FLUX 3 자체에 행동 예측을 넣는 길이고, 다른 하나는 미리 학습된 영상 뼈대를 바탕으로 과제별 데이터를 조금만 써서 전문 로봇 모델을 만드는 길입니다. 두 번째 길의 첫 결과가 FLUX-mimic입니다.
mimic robotics는 2024년 취리히 연방공대(ETH) 연구자들이 세운 회사로 취리히와 샌프란시스코에 50명 넘게 일합니다. 지난해 말 논문 mimic-video에서 영상 생성 모델 위에 로봇 행동 예측을 얹는 영상-행동 모델(VAM)을 제안했습니다. 지금 로봇 업계에 널리 퍼진 시각-언어-행동 모델(VLA)은 정지 이미지와 글로 학습한 언어 모델 위에 만들어, 물체가 어떻게 움직이고 부딪히는지를 비싼 로봇 동작 데이터로 처음부터 배워야 합니다. VAM은 영상 모델이 이미 배운 물리 감각을 가져다 쓰는 쪽입니다.
mimic은 이 차이를 데이터 피라미드로 설명합니다. 가장 많은 것은 사람이 일하는 영상인데 로봇 동작 기록이 붙어 있지 않습니다. 그 위에 착용형 장비로 찍은 사람 손동작 시연이, 맨 위에 가장 귀한 로봇 원격 조종과 실제 배치 기록이 있습니다. VLA는 동작 기록이 있는 위쪽 두 종류로만 학습할 수 있고, VAM은 맨 아래의 방대한 영상까지 쓸 수 있다는 것이 mimic의 주장입니다. mimic-video에서는 같은 성공률에 이르는 데 VLA 방식보다 데이터가 10분의 1, 학습 기간이 절반이면 됐다고 밝혔습니다.
@mimicroboticsX 게시물 · 원문 보기

작동 방식은 이 그림과 같습니다. FLUX 백본이 작업 지시와 지금까지의 영상을 보고 화면 속 상황이 앞으로 어떻게 바뀔지 예측하면, 가벼운 행동 디코더가 그 예측의 내부 표현을 읽어 로봇 동작을 만듭니다. 픽셀로 영상을 실제로 그려 내지 않고 내부 표현만 읽기 때문에 동작 한 묶음에 백본을 한 번만 돌리면 됩니다. mimic은 미래 영상의 정답을 백본에 넣어 주자 행동 디코더가 거의 완벽하게 작동했다며, 로봇 제어가 시각 예측 문제로 좁혀진다고 설명했습니다.
FLUX 3가 배운 세상의 모델에 mimic의 로봇 학습·배치 경험을 더한 FLUX-mimic은 로봇이 새 작업에 더 쉽게 적응하게 해 줍니다.— 로빈 롬바흐, Black Forest Labs 공동창업자·CEO
BFL은 FLUX 3에 행동 예측을 추가로 학습시켰을 때 영상 품질이 어떻게 되는지도 공개했습니다. 사람들이 매긴 영상 품질이 처음에는 최대 10% 떨어졌다가 3,500스텝 뒤에는 원래 수준으로 돌아왔습니다. 같은 뼈대가 영상 생성과 행동 예측을 함께 지고 갈 수 있다는 근거로 BFL이 든 결과입니다.

mimic은 실제 로봇으로 연질 부품을 정해진 트레이에 담는 키팅 과제를 모델마다 20번씩 시켰습니다. FLUX-mimic 미리보기판은 이 과제만을 위한 추가 학습 없이 성공률 95%를 냈습니다. 같은 데이터로 맞춘 피지컬 인텔리전스의 π0.5는 55%, 이 과제 하나로 집중 학습한 플로 매칭 정책은 70%였습니다. 뼈대를 얼린 채 행동 디코더만 학습했을 때 FLUX-mimic은 65%를 유지했지만 π0.5는 0%로 떨어졌습니다.

데이터와 하드웨어 조건도 숫자로 나왔습니다. mimic은 보도자료에서 새 조작 과제에 맞추는 데 로봇 데이터 30분이면 되고, 이전 방식은 30시간 넘게 필요했다고 밝혔습니다. 학습에는 일반 영상 수천만 시간과 사람·로봇의 조작 영상 수십만 시간이 들어갔고, mimic이 원격 조종과 착용형 장비로 모은 실제 공장 과제 100여 종의 데이터가 더해졌습니다.
현장에서는 로봇에 붙은 엔비디아 RTX 5090 한 장에서 돌아갑니다. BFL에 따르면 백본이 입력을 받아 내부 표현을 만들기까지 80밀리초가 걸리지 않아 사람의 시각 반응 시간과 같은 자릿수이고, 센서부터 모터까지 합친 로봇 전체의 반응 시간은 101밀리초입니다. BFL은 Self-Flow로 학습한 모델이 다른 학습 방식(REPA)의 28개 레이어 최고 점수를 18개 레이어로 냈다며, 표현을 잘 배운 모델일수록 더 작고 빠른 백본으로 같은 성능을 낸다고 설명했습니다. 집기에 실패하면 스스로 다시 집어 과제를 마치는 동작도 보였는데, BFL은 시연 데이터에 없는 이런 복구가 세상이 어떻게 움직이는지 아는 모델에서 나온다고 설명했습니다.
이 로봇들이 기존 로봇 기술로는 그야말로 불가능했을 복잡한 연질 소재 조작 작업을 해내는 것을 봤습니다.— 크리스토프 슈나이더, 아우디 프로덕션 랩
mimic이 공장에서 시험한 작업은 부품을 트레이에 정리하는 키팅, 꽉 끼는 지그에 전자제어장치(ECU)를 끼우는 일, 부품 조립, 실링과 케이블처럼 휘는 소재 다루기이고, 아우디와는 차 문 조립 같은 실제 생산 과제를 시험하고 있습니다. BFL은 고급차 생산은 차종과 사양의 가짓수가 많아, 경우마다 프로그램을 다시 짜야 하는 기존 로봇 셀로는 수지가 맞지 않았다고 적었습니다. mimic은 새 작업을 배치하는 데 몇 시간이면 된다고 밝혔습니다.
지금 쓸 수 있는 것은 FLUX 3 Video 얼리 액세스뿐입니다. BFL이 밝힌 순서는 영상과 오디오 생성·편집(API와 비공개 가중치 제공), 선별한 파트너를 통한 행동 예측(FLUX-mimic과 FLUX 3 Action), 이미지 생성과 편집(FLUX 3 Image), 그리고 콘텐츠 생성과 행동 예측을 함께 담은 오픈 웨이트 멀티모달 뼈대(FLUX 3 Dev)입니다. 단계마다 얼리 액세스와 안전성 시험을 거친다고 했고, 가격과 FLUX 3 Dev의 공개 시점, 라이선스 조건은 발표문에 없습니다.
| 이름 | 내용 | 7월 23일 기준 상태 |
|---|---|---|
| FLUX 3 Video | 소리가 붙은 영상 생성·편집 | 얼리 액세스 |
| FLUX-mimic·FLUX 3 Action | 로봇 행동 예측 | 선별 파트너(mimic부터) |
| FLUX 3 Image | 이미지 생성·편집 | 몇 주 안에 얼리 액세스 |
| FLUX 3 Dev | 오픈 웨이트 멀티모달 뼈대 | 시점 미정 |
숫자에도 조건이 붙어 있습니다. 영상 선호도는 BFL이 직접 잰 초기 후보의 예비 결과이고, 로봇 성공률은 mimic이 자기 로봇으로 한 과제를 20번씩 시킨 결과입니다. 아우디 쪽에서는 시험과 배치를 하고 있다는 말과 작업 종류가 나왔을 뿐, 생산 라인에서의 처리 속도나 불량률 같은 결과는 공개되지 않았습니다.
한국 사용자에게 걸리는 대목도 있습니다. BFL은 여러 언어 대사를 지원한다고 적었지만 7월 23일 발표문에는 지원 언어 목록이 없어, 한국어 대사가 어느 수준인지는 얼리 액세스 사용자의 결과가 나와야 알 수 있습니다. FLUX.1 때처럼 일부 가중치를 비상업 조건으로 풀지, 더 넓게 풀지에 따라 국내 개발자가 이 모델을 직접 내려받아 고쳐 쓸 수 있는 범위도 달라집니다.
BFL은 발표문 끝에 다음 목표로 지각과 행동, 언어 예측을 한 모델로 합치는 일을 적었고, 기반 기술의 세부 내용도 따로 공개하겠다고 했습니다. 몇 주 안에 열릴 FLUX 3 Image가 한 모델로 합친 구조의 두 번째 결과물입니다.
읽어 주셔서 고맙습니다.
초이 드림