# Seedance 3분의 1 값에 편집 1위, MiniMax H3가 가중치도 풉니다
_글과 이미지, 영상, 음성을 한꺼번에 받아 스테레오 소리를 담은 최대 15초 2K 영상을 만드는 모델입니다. 아티피셜애널리시스 영상 편집 순위에서 구글 Gemini Omni Flash를 제치고 1위에 올랐고, MiniMax는 며칠 안에 가중치를 풀겠다고 밝혔습니다._
- 매체: 초이의 뉴스레터 · 소식
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-08-02T12:00
- 링크: https://choi-newsletter.com/post/news-minimax-h3-open-weight-multimodal
- 답하는 질문: MiniMax H3 가격과 오픈웨이트 공개 조건
- 직답: MiniMax H3는 2K 영상 1분에 7.80달러로 영상 편집 1위에 올랐고, 며칠 안에 커뮤니티 라이선스로 가중치를 풀 예정입니다.
- 출처: MiniMax, MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities (2026-07-31) (https://www.minimax.io/blog/minimax-h3), MiniMax X, H3 공개 (2026-07-31) (https://x.com/MiniMax_AI/status/2083006198828417501), Artificial Analysis X, MiniMax H3 영상 편집 1위와 가격 (2026-07-31) (https://x.com/ArtificialAnlys/status/2083042088338538594), Artificial Analysis X, Gemini Omni Flash 영상 편집 1위 데뷔 (2026-07-31) (https://x.com/ArtificialAnlys/status/2082991648703930561), MiniMax X, 며칠 안에 가중치 공개 (2026-08-01) (https://x.com/MiniMax_AI/status/2083373860796153869), ComfyUI X, MiniMax H3 파트너 노드 (2026-07-31) (https://x.com/ComfyUI/status/2083071877891682784), MiniMax-M3 라이선스 원문 (MiniMax Community License) (https://huggingface.co/MiniMaxAI/MiniMax-M3/blob/main/LICENSE), Artificial Analysis 영상 편집 순위 (https://artificialanalysis.ai/video/leaderboard/video-editing)
> MiniMax가 7월 31일 공개한 영상 모델 H3는 아티피셜애널리시스 영상 편집 1위에 올랐고, 2K 영상 1분에 7.80달러로 Seedance 2.0의 3분의 1 수준입니다. MiniMax는 며칠 안에 커뮤니티 라이선스로 가중치를 공개하겠다고 밝혔습니다.

중국 AI 회사 MiniMax가 7월 31일 영상 생성 모델 MiniMax H3를 자사 영상 앱 하이루오(Hailuo)와 API로 공개했습니다. 글과 이미지, 영상, 음성을 한꺼번에 입력받아 스테레오 소리까지 담은 최대 15초짜리 2K 영상을 만들고, 독립 평가 기관 아티피셜애널리시스의 영상 편집 순위에서 1위에 올랐습니다. MiniMax는 며칠 안에 모델 가중치도 공개하겠다고 밝혔습니다.

발표 게시물은 H3를 네 가지 문구로 소개했습니다. 여러 참고 자료를 한 번에 넣는 옴니 레퍼런스, 상업용 수준의 생성 품질, 가격 대비 성능, 그리고 오픈웨이트입니다. MiniMax는 공식 블로그에서 광고와 브랜딩, 전자상거래, 제품 디자인, UI·UX, 게임 영상을 H3의 쓰임새로 꼽았고, 2K 기준 초당 가격이 주류 모델의 3분의 1이 안 된다고 적었습니다.

## 과제별 모델을 하나로 합친 세 번째 세대

MiniMax의 영상 모델은 H3가 세 번째입니다. 블로그 설명으로는 하이루오 01이 시스템을 처음부터 세웠고, 하이루오 02는 구조의 효율과 데이터 품질, 규모를 끌어올렸습니다. 6월 공개한 언어 모델 MiniMax-M3는 7월 15일 [아티피셜애널리시스 지능 지수](/post/news-thinking-machines-inkling-open-weights)에서 오픈웨이트 모델 가운데 GLM-5.2(51점) 다음인 44점을 받았습니다.

H3를 설계하며 MiniMax가 문제로 꼽은 것은 과제마다 모델이 따로 있던 구조입니다. 이미지는 글로 그리기와 편집, 인물 참고, 동작 참고, 화풍 참고가 각각 다른 전문 모델이었고, 음성과 효과음, 음악도 따로 연구됐으며, 영상은 글로 만들기와 이미지로 만들기, 첫 프레임과 끝 프레임 지정, 편집 등으로 잘게 나뉘어 있었습니다. H3는 이 과제를 한 모델에서 사전학습 단계부터 함께 배웁니다. 영상을 만들 때 소리를 함께 만들고, 여러 컷을 한 번에 구성하며, 음성과 효과음, 음악을 구분하지 않고 같이 다룹니다.

참고와 편집의 관계는 정해진 메뉴 대신 문장으로 지시합니다. 블로그에 실린 예시 지시문은 「영상 1의 히치콕식 카메라 움직임을 참고하고, 이미지 2의 인물이 노래하게 하되, 목소리는 오디오 3에 맞춰라」였습니다. 영상과 이미지, 음성 세 가지 참고 자료의 관계를 글로 설명하면 나머지는 모델이 풀어낸다는 설명입니다.

![야외 카페에서 곱슬머리 여성이 커피잔을 들고 있는 사진. MiniMax가 H3 예시에서 노래하는 인물의 참고 이미지로 넣은 입력입니다](https://filecdn.minimax.chat/public/h3-en-v2-image-000-1785473644038.png)

## 네 가지 기술

MiniMax는 H3를 받치는 기술로 네 가지를 들었습니다. 기술 보고서는 곧 내겠다고 했고, 블로그에는 요약만 실렸습니다.

| 기술 | 하는 일 | 공개된 숫자 |
| --- | --- | --- |
| Contextual Omni Representation | 참고 자료와 결과 영상의 관계까지 글로 풀어 쓰는 캡션 | 원본 하나에 추론 약 10만 토큰, 캡션은 평균 약 4,000토큰 |
| H3-VAE | 영상을 압축해 모델이 다루는 표현으로 바꾸는 토크나이저 | 유효 시퀀스 길이 4배, 네이티브 2K의 바탕 |
| H3-Omni Transformer | 이해와 생성 연산을 나눠 돌리는 학습 구조 | 학습 처리량 약 30% 향상 |
| In-context Regeneration | 저해상도 결과를 기본 모델이 다시 생성해 2K로 올리는 방식 | 별도 초해상도 모듈 없음 |

가장 공을 들였다는 것은 캡션입니다. 참고 자료가 여럿 들어오면 결과 영상만 묘사해서는 부족하고, 자료와 결과의 관계, 자료끼리의 관계, 여러 컷에 걸친 소리와 화면의 관계까지 글로 적어야 합니다. MiniMax는 이를 위해 전용 모델과 이해 파이프라인을 따로 만들었고, 원본 대부분에 약 10만 토큰의 추론을 들여 평균 약 4,000토큰의 설명으로 줄였다고 밝혔습니다. H3가 지시를 잘 따르는 이유를 회사는 이 캡션에서 찾았습니다.

2K 영상을 만드는 방식도 다릅니다. 보통은 낮은 해상도로 만든 뒤 초해상도 모듈로 키우는데, H3는 기본 모델이 자기 저해상도 결과를 원래의 참고 자료와 함께 다시 생성합니다. 작은 글씨나 세부 묘사처럼 초해상도 모듈이 짐작만 하던 부분을 참고 자료에서 다시 가져올 수 있다는 설명입니다. 하이루오 02에서 쓰던 구조는 과제를 합치는 데 불필요하게 복잡하다며 내려놓았다고도 적었습니다.

## 구글 모델을 3시간 만에 밀어낸 영상 편집 1위

아티피셜애널리시스는 이용자들이 두 모델의 결과를 이름을 가린 채 비교해 고르는 투표로 영상 모델 순위를 매깁니다. 7월 31일 오전 9시 48분(한국 시각) 구글의 Gemini Omni Flash가 영상 편집 순위 1위로 데뷔했다는 글이 올라왔고, 3시간 20분 뒤 같은 계정에 H3가 영상 편집 1위, 글로 영상 만들기 2위, 이미지로 영상 만들기 3위라는 글이 올라왔습니다. 아티피셜애널리시스는 그보다 앞선 글에서 Gemini Omni Flash가 자사 영상 순위표를 거의 휩쓸었다고 적었습니다.

H3가 영상 편집에서 순위에 오를 수 있었던 것은 영상을 입력으로 받기 때문입니다. 아티피셜애널리시스는 H3가 지시문으로 영상을 고치는 편집을 할 수 있는 몇 안 되는 모델이라고 적었습니다. 가중치가 공개되면 이전 오픈웨이트 1위였던 LTX-2.3보다 크게 앞서는 가장 강한 오픈웨이트 영상 모델이 된다는 평가도 붙였습니다. 같은 날 아티피셜애널리시스는 엔비디아가 7월 20일 공개한 Cosmos3-Super의 4단계 증류판을 이미지로 영상 만들기 부문 오픈웨이트 1위로 소개하기도 했습니다.

영상 생성은 언어 모델보다 가중치 공개가 늦은 분야였습니다. MiniMax는 블로그에서 폐쇄형 모델이 영상 생성을 오래 지배해 왔고, 언어 모델 분야보다 발전 속도가 느리고 생태계도 덜 열려 있었다고 적었습니다. 8월 1일 X에는 이렇게 썼습니다.

> 처음으로 오픈 영상 모델이 폐쇄형 프런티어와 같은 테이블에 앉았습니다.
> — MiniMax 공식 계정, 8월 1일

## 2K 1분에 7.80달러

가격은 아티피셜애널리시스가 소리를 포함한 1분 분량으로 환산해 비교했고, 순위 평가도 2K 요금제로 진행했다고 밝혔습니다. 768p 요금제는 MiniMax 문서에 출시 예정으로 올라 있었습니다.

| 모델 | 해상도 | 1분당 가격 |
| --- | --- | --- |
| Gemini Omni Flash (구글) | - | 6.00달러 |
| **MiniMax H3** | **768p (출시 예정)** | **5.40달러** |
| **MiniMax H3** | **2K** | **7.80달러** |
| HappyHorse-1.1 | - | 9.90달러 |
| Kling 3.0 | 1080p | 20.16달러 |
| Dreamina Seedance 2.0 | 1080p | 22.45달러 |

출처: 아티피셜애널리시스(7월 31일). H3는 초당 2K 0.13달러, 768p 0.09달러입니다.

2K로 만든 H3가 1080p인 Seedance 2.0과 Kling 3.0의 절반보다도 쌉니다. 참고 이미지는 다섯 장까지 무료이고 그 뒤로는 한 장에 0.04달러, 참고 음성은 무료입니다. 구글 Gemini Omni Flash만 H3 2K보다 1분에 1.80달러 쌉니다. MiniMax는 768p 요금이 주류 모델 720p 요금의 절반이 안 된다고 밝혔습니다. 블로그는 가격 대비 성능의 바탕으로 네 가지 기술을 모두 들었고, 그 가운데 H3-VAE는 높은 압축률로 유효 시퀀스 길이를 4배로 늘려 학습과 추론 비용을 크게 줄였다고 설명했습니다.

## 먼저 써 본 사람들의 영상

공개 전후로 X에는 H3로 만든 영상이 쏟아졌습니다. 공개 10시간 전 이 모델을 먼저 써 본 한 제작자는 프롬프트 하나로 하드 컷 24개가 이어지는 영상을 한 번에 만들었다며, 편집하지 않은 원본이라고 적었습니다.

| 사례 | 내용 | 올린 사람 |
| --- | --- | --- |
| [게임 UI 영상, Seedance 2.0과 비교](https://x.com/ShamsAmin56/status/2083090308666163365) | 같은 프롬프트와 참고 이미지 8장으로 비교, 8개 프레임의 작은 글씨와 배경음악까지 생성 | @ShamsAmin56 |
| [30초 예고편](https://x.com/aripratama293/status/2083172533168492549) | 약 6,900자짜리 프롬프트 2개로 15초씩 생성, 제목 글자 애니메이션까지 모델이 생성 | @aripratama293 |
| [참고 자료 7개와 음성을 넣은 인트로](https://x.com/altphotos_pl/status/2083244369079840826) | 긴 영상은 짧은 클립으로 나눠 만들라고 권함 | @altphotos_pl |

모두 만든 사람이 직접 올린 결과물이라 몇 번 만에 건진 영상인지는 나와 있지 않습니다. 긴 인트로를 한 번에 만들려던 제작자는 짧은 클립으로 나눠야 모델이 인물과 대상을 정확히 유지한다고 적었습니다. 결과를 다시 뽑을 때마다 초당 요금이 새로 붙으므로, 실제 비용은 표의 1분당 가격에 다시 뽑은 횟수를 곱한 값이 됩니다.

## 가중치는 며칠 뒤, 조건은 커뮤니티 라이선스

MiniMax는 블로그에서 적용되는 법과 규정의 범위 안에서 앞으로 며칠 안에 가중치를 공개할 계획이라고 적었습니다. 이유로는 오픈소스 커뮤니티 지원과 더 많은 AI 하드웨어와의 호환, 사용자가 자기만의 버전을 만들기 쉽게 하는 것을 들었고, 하드웨어 호환성은 설계 초기부터 고려했다고 밝혔습니다. 8월 1일 X에는 며칠 안에 누구나 H3 위에서 만들 수 있게 된다고 다시 적었고, 2일에도 가중치가 곧 나온다는 짧은 글을 올렸습니다.

아티피셜애널리시스에 따르면 가중치에는 MiniMax 커뮤니티 라이선스가 붙습니다. 아티피셜애널리시스는 이 라이선스가 매출 2,000만 달러 미만 조직의 상업적 이용을 허락하고, 눈에 띄는 출처 표기를 요구한다고 설명했습니다. 같은 이름의 라이선스를 단 6월 언어 모델 M3의 원문을 보면 비상업적 이용은 자유롭고, 상업적으로 쓰면 「Built with MiniMax M3」를 웹사이트나 제품 문서에 눈에 띄게 적은 뒤 MiniMax에 한 번 알려야 합니다. 연 매출이 2,000만 달러를 넘는 제품이나 서비스는 사전에 서면 승인을 받아야 하고, 군사 목적 이용은 금지 조항에 들어 있습니다.

H3 라이선스 원문은 8월 2일 현재 공개되지 않았습니다. 중국 회사의 영상 모델 라이선스에는 지역 조항이 붙은 전례가 있습니다. 텐센트가 2024년 12월 공개한 영상 모델 HunyuanVideo의 라이선스는 첫 문장에서 EU와 영국, 한국을 적용 지역에서 뺐습니다. 텐센트는 같은 조항을 달았던 언어 모델 Hy3를 7월 6일에야 [Apache 2.0으로 바꿨습니다](/post/news-tencent-hy3-apache-license).

발표를 먼저 하고 가중치를 나중에 푸는 순서는 지난달 문샷AI도 밟았습니다. 문샷은 7월 16일 Kimi K3를 발표하며 7월 27일 공개를 약속했고, 약속한 날 [가중치 파일 96개와 기술 보고서를 함께 풀었습니다](/post/review-kimi-k3-full-stack-release). 그사이 vLLM 같은 오픈소스 추론 엔진이 새 모델을 붙일 시간을 벌었습니다.

## 지금 쓸 수 있는 길과 아직 모르는 것

가중치가 나오기 전에도 H3는 여러 경로로 쓸 수 있습니다. 하이루오 웹 앱과 MiniMax API 말고도 fal과 OpenRouter, Runway, Krea, Leonardo, Vercel AI Gateway가 공개 직후 H3를 붙였고, 노드 기반 편집 도구 ComfyUI는 API로 부르는 파트너 노드를 먼저 내놓으며 오픈웨이트를 직접 돌리는 지원은 곧 붙이겠다고 밝혔습니다.

모르는 것도 많습니다. 모델 크기와 로컬에서 돌리는 데 필요한 GPU 메모리는 가중치가 나와야 알 수 있고, 한국어 대사와 지시문을 얼마나 안정적으로 다루는지도 8월 2일까지 나온 자료에는 없습니다. 이미지와 영상, 음성을 한 모델에 넣는 흐름은 H3만의 것도 아닙니다. 7월 하순 Black Forest Labs가 [이미지와 영상, 음성을 한 잠재 공간에서 처리하는 FLUX 3](/post/news-flux3-unified-image-video-audio)를 공개했고, 첫 영상 모델은 얼리 액세스로 내놓았습니다.

저는 H3 가중치가 약속대로 풀리고 라이선스에 지역 제한이 없다면, 광고와 커머스 영상을 만드는 국내 제작사가 클라우드 요금 대신 자체 GPU로 초안을 뽑는 계산을 해 볼 만한 조건이 처음 갖춰진다고 봅니다. MiniMax는 다음 H 시리즈에 언어 모델 M 시리즈의 이해 능력을 합치고 모델 규모를 키우겠다고 밝혔습니다. 가중치와 라이선스 원문이 나오면 다시 전하겠습니다.

읽어 주셔서 고맙습니다.

초이 드림
