# 초안은 초당 3센트, 구글 Omni 1.1이 영상을 40초까지 이어 붙입니다
_다음 구간을 만들 때 참고하는 앞부분이 1초에서 10초로 늘어 10초씩 최대 40초까지 이어 붙일 수 있습니다. 360p 초안은 720p보다 최대 60% 빠르고 값은 3분의 1이며, 1080p와 4K는 업스케일입니다._
- 매체: 초이의 뉴스레터 · 소식
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-08-28T10:00
- 링크: https://choi-newsletter.com/post/news-gemini-omni-11-flash
- 답하는 질문: 제미나이 Omni 1.1 Flash 영상 길이와 요금
- 직답: Omni 1.1 Flash는 10초씩 이어 붙여 최대 40초짜리 영상을 만들고, API 요금은 해상도별로 초당 0.03~0.30달러입니다.
- 출처: Google, Gemini Omni 1.1 Flash lets you build with more control (8월 27일) (https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/), Google AI Studio X 발표 (https://x.com/GoogleAIStudio/status/2093020771245346930), Gemini API, Omni 개발 문서 (https://ai.google.dev/gemini-api/docs/omni), Gemini API, Gemini Omni Flash 모델 페이지 (https://ai.google.dev/gemini-api/docs/models/gemini-omni-flash), Gemini API 요금 (https://ai.google.dev/gemini-api/docs/pricing), Google, I/O 2026 피차이 기조연설 (5월 19일) (https://blog.google/innovation-and-ai/sundar-pichai-io-2026/), Google, 2026년 2분기 실적 발표 CEO 발언 (https://blog.google/company-news/inside-google/message-ceo/alphabet-earnings-q2-2026/)
> 구글이 8월 27일 영상 생성·편집 모델 제미나이 Omni 1.1 Flash를 공개했습니다. 이어 붙이기, 첫·끝 프레임 지정, 360p 초안, 4K 업스케일, 참고 영상 입력이 붙었고, API 요금은 해상도별로 초당 0.03~0.30달러입니다.

구글이 8월 27일(미국 시각) 영상 생성·편집 모델 제미나이 Omni 1.1 Flash를 공개했습니다. 다음 구간을 만들 때 참고하는 앞부분이 직전 1초에서 10초로 늘어, 10초씩 이어 붙여 최대 40초짜리 영상을 만들 수 있습니다. 초안용 360p는 초당 0.03달러로 기본 720p(0.10달러)의 3분의 1이고, 720p 요금은 직전 판과 같습니다.

Omni는 구글이 5월 I/O에서 내놓은 모델입니다. 순다르 피차이 CEO는 AI가 글을 예측하는 데서 현실을 시뮬레이션하는 쪽으로 가고 있다며, 어떤 입력을 받아도 어떤 형태로든 결과를 내는 모델이라고 Omni를 소개했습니다. 출력은 영상부터 시작했고, 첫 모델 Omni Flash는 제미나이 앱과 영상 제작 도구 Google Flow, 유튜브 쇼츠에 들어갔습니다. 7월 실적 발표에서는 I/O 이후 제미나이 앱에서 영상을 만드는 일간 사용자가 40% 늘었다고 밝혔습니다.

발표문은 구글 딥마인드의 제품 매니저 아니시 난지아와 앨리사 포틴이 썼습니다. 구글 AI Studio가 X에 올린 글도 같은 내용으로, 1.1을 실제 제작 현장에서 쓸 수 있는 단계라고 소개하고 새 기능으로 이어 붙이기와 첫·끝 프레임 지정, 360p 초안, 4K 업스케일, 참고 영상 입력 다섯 가지를 꼽았습니다.

API에서는 이번 1.1이 첫 정식 버전입니다. 요금 문서에는 5월 모델이 미리보기 이름(gemini-omni-flash-preview)으로 남아 있고, 1.1은 유료 등급 개발자에게 정식 제공된다고 적혀 있습니다. 개발자는 Gemini API 유료 등급과 AI Studio, 기업용 Gemini Enterprise Agent Platform에서 바로 쓸 수 있고, 전 세계 구글 AI Plus·Pro·Ultra 구독자는 Google Flow에서 1.1을 씁니다. 제미나이 앱에서는 같은 구독자가 이어 붙이기를 쓸 수 있습니다.

## 앞 10초를 보고 다음 10초를 만든다

이어 붙이기는 이미 만든 영상의 끝에서 다음 구간을 새로 생성하는 기능입니다. 직전 모델은 마지막 1초만 참고했기 때문에, 끝부분 몇 프레임에 담기지 않은 인물의 얼굴이나 옷, 조명이 몇 초 뒤에 달라지는 일이 잦았습니다. 1.1은 앞선 영상을 최대 10초까지 분석해 다음 구간을 만들고, 10초씩 더해 누적 40초까지 늘릴 수 있습니다.

발표문 예시에서는 한 여성이 곱슬머리 남자와 이야기하는 컷 뒤에 「카메라가 천천히 빠지며 먼지 쌓인 지하 묘지」와 「카메라가 천천히 빠지며 책장과 책이 허공에 떠 있는 거대한 서재」라는 지시가 이어 붙습니다. 구글은 앞부분을 물려받은 채 이야기를 길게 끌고 가거나, 뒤쪽 지시만 달리해 새 방향으로 갈라 볼 수 있다고 설명했습니다.

개발 문서에는 조건도 붙어 있습니다. 한 번 생성하는 길이는 3~10초이고, 이어 붙이기는 영상 끝에만 붙일 수 있어 앞에 덧붙이거나 중간을 늘리지는 못합니다. 직접 올린 영상을 이어 붙이려면 그 영상이 10초 이하여야 하고, 유럽경제지역과 스위스, 영국에서는 올린 영상의 이어 붙이기와 편집이 막혀 있습니다.

긴 영상을 만드는 방식은 회사마다 다릅니다. 3주쯤 앞서 나온 바이트댄스의 [Seedance 2.5](/post/review-seedance-25-video-quality-jump)는 한 번 생성에 최대 30초를 480p나 720p로 만들고 참고 자료를 50개까지 받습니다. Omni 1.1은 한 번에 10초 이하를 만들어 이어 붙이는 대신, 참고 구간을 늘려 이음매의 어긋남을 줄이는 쪽을 골랐습니다.

## 말로 고치고, 초 단위로 지시한다

Omni가 처음부터 내세운 기능은 대화로 하는 편집입니다. 개발 문서의 예시는 바이올린을 켜는 영상을 만든 뒤 「바이올린을 투명하게 만들어 줘」라고 다시 지시하고, 직접 올린 영상에서는 사람이 거울을 만지는 순간 거울이 액체처럼 일렁이고 팔이 거울 재질로 변하게 합니다. 대화가 이어지는 동안 모델이 앞 턴의 영상을 이어받기 때문에, 조명을 바꾸거나 배경을 갈아 끼울 때 전체를 다시 설명하지 않아도 됩니다.

이 연결은 previous_interaction_id라는 값으로 이어집니다. 1.1의 이어 붙이기도 같은 방식이어서, 발표문 코드 예시는 앞선 영상의 대화 번호를 넘기고 「이어서 만들어」라고 지시한 뒤 해상도를 360p로 지정합니다. 생성한 영상을 서버에 저장하지 않도록 설정하면 다음 턴에서 그 영상을 편집할 수 없다고 문서는 적었습니다.

시간도 글로 지시합니다. 문서의 프롬프트 안내에는 「3초 뒤 여성이 들어온다」「5초에 배경 음악의 후렴이 시작된다」처럼 자연어로 쓰거나 [0-3s] 같은 타임코드로 구간을 나누는 예시가 있습니다. 출력은 초당 24프레임이고, 0.5초(12프레임)마다 장소를 바꾸는 빠른 편집도 예로 들었습니다.

## 시작 화면과 끝 화면을 먼저 정한다

첫 프레임과 끝 프레임으로 쓸 이미지 두 장을 넣고 전환을 글로 설명하면, 그 사이 움직임을 모델이 채웁니다. 구글은 카메라가 인물 주위를 도는 쇼트, 화면을 확대해 들어가는 전환, 끝이 처음으로 이어지는 반복 클립을 예로 들었습니다. 발표문 예시 가운데 하나는 드러머를 비추던 카메라가 옆으로 휙 돌아 색소폰 연주자와 발레리나를 보여 주는 한 컷이고, 다른 하나는 방 안의 TV 화면으로 파고들어 처음과 같은 여성이 나오는 반복 영상입니다.

참고 영상은 최대 3개, 개당 3초까지 넣을 수 있습니다. 공식 예시에서는 춤추는 사람 영상 세 개와 개, 문어, 곰 그림을 함께 넣어, 세 캐릭터가 한 공간에서 각자 다른 춤을 끊김 없이 추는 한 컷을 만들었습니다. 움직임은 영상에서, 생김새는 그림에서 가져오는 구성입니다.

개발 문서는 참고 영상이 사람의 생김새를 유지할 때 가장 잘 맞고, 참고 영상에 든 소리는 무시한다고 적었습니다. 알아볼 수 있는 특정 인물이 담긴 이미지를 올려 편집하는 기능은 지원하지 않고, 3초를 넘는 긴 동작은 한 번에 참고시킬 수 없습니다.

## 초안은 싸게, 마감은 비싸게

| 해상도(초당, 달러) | Omni 1.1 Flash | Omni Flash(직전 판) | Veo 3.1 Lite | Veo 3.1 Fast |
| --- | --- | --- | --- | --- |
| 360p | 0.03 | 없음 | 없음 | 없음 |
| 720p | 0.10 | 0.10 | 0.05 | 0.10 |
| 1080p | 0.15 | 없음 | 0.08 | 0.12 |
| 4K | 0.30 | 없음 | 없음 | 0.30 |

구글이 발표문에 붙인 가격표입니다. 직전 판에는 720p 한 가지만 있었고, 이번에 360p와 1080p, 4K가 더해졌습니다. 기존 방식대로 720p를 쓰는 이용자의 초당 요금은 그대로입니다. 구글의 다른 영상 모델인 Veo 3.1 Fast는 720p와 4K 요금이 Omni 1.1과 같고 1080p는 초당 0.12달러로 더 쌉니다. 저가형 Veo 3.1 Lite의 720p가 0.05달러였으니, 구글 영상 모델 가격표에서 초당 가장 싼 선택지는 이번에 생긴 Omni 1.1의 360p 초안입니다.

초당 요금 뒤에는 토큰 계산이 있습니다. Gemini API 요금 문서를 보면 Omni 1.1의 영상 출력은 100만 토큰당 17.50달러이고, 720p 영상 1초를 5,792토큰으로 셉니다. 둘을 곱하면 초당 약 0.10달러가 나옵니다. 텍스트와 이미지, 영상, 오디오 입력은 100만 토큰당 1.50달러가 따로 붙고, 무료 등급은 없습니다.

360p 초안은 720p보다 생성이 최대 60% 빠르고 값은 3분의 1입니다. 개발 문서에 따르면 1080p와 4K는 모델이 만든 영상을 업스케일(해상도를 끌어올리는 처리)한 결과이고, 요금은 720p의 1.5배와 3배입니다. 40초 한 편을 기준으로 출력 비용을 계산하면 아래와 같습니다.

| 해상도 | 40초 한 편 | 40초를 열 번 |
| --- | --- | --- |
| 360p | 1.20달러 | 12달러 |
| 720p | 4.00달러 | 40달러 |
| 1080p | 6.00달러 | 60달러 |
| 4K | 12.00달러 | 120달러 |

구글이 예로 든 앱 가운데 하나는 이 요금 차이를 작업 순서로 옮겼습니다. 「Draft Room」이라는 이름의 이 앱은 조건을 하나씩만 바꾼 360p 초안 서너 개를 나란히 만들어 비교하게 합니다. 구글은 제작자들이 원하는 영상 하나를 얻기까지 여러 개를 먼저 만든다며, 이 앱이 그 탐색을 싸고 체계적으로 만든다고 설명했습니다.

## 경쟁 도구도 Omni를 들여놓았다

발표문에는 Omni Flash를 이미 제품에 넣은 회사들이 나옵니다. 어도비는 영상 도구 Firefly에 Omni Flash를 붙였고, 생성형 영상 회사 Runway도 자기 서비스 안에서 Omni Flash를 고를 수 있게 했습니다. Runway의 제이미 엄퍼슨 최고크리에이티브책임자는 프롬프트나 이미지, 영상으로 시작해 생성하거나 편집하는 기존 사용 방식에 Omni Flash가 자연스럽게 들어맞는다고 말했습니다. 디자인 도구 Figma의 Weave와 클라우드 회사 GMI Cloud도 이름을 올렸습니다.

영상 모델이 다른 회사의 도구 안에서 쓰이는 흐름은 8월 내내 이어졌습니다. 어도비가 ChatGPT에 자사 도구 70개를 넣은 지 일주일 만인 8월 13일, Higgsfield가 ChatGPT 앱에 플러그인을 내 바이트댄스 Seedance 2.5와 Kling 3.0 같은 영상 모델을 대화창에서 바로 부르게 했습니다.

> 이어 붙이기와 더 풍부한 참고 자료, 4K 해상도 덕분에 팀은 영상을 생성하는 데서 나아가 실제로 연출하게 됩니다.
> — 이타이 쉬프, Figma Weave 크리에이티브 디렉터

GMI Cloud의 루이자 궈 마케팅 부사장은 교육·설명 영상처럼 내용이 정확해야 하는 고객에게는 기능 하나보다 세부가 맞는지가 중요하다고 말했습니다. 구글이 제시한 앱 아이디어에도 같은 방향이 보입니다. 부동산 매물 사진으로 방과 방 사이를 카메라가 도는 영상을 만들되, 실제로 없는 가구나 장식은 더하지 않는 앱입니다.

구글은 Veo에서 먼저 선보인 기능을 Omni로 계속 옮겨 오고 있고, 다음 Omni 업데이트에서도 기능을 더하겠다고 밝혔습니다. 가격표에서 Veo 3.1 두 모델은 소리가 있는 영상으로, Omni 1.1은 창작 제어 기능이 붙은 고품질 영상으로 소개됩니다.

## 발표에 없는 것

일관성이 좋아졌다는 설명은 구글이 낸 것이고, 40초까지 이어 붙였을 때 인물과 조명이 얼마나 유지되는지를 같은 조건에서 잰 독립 평가는 아직 나오지 않았습니다. 1080p와 4K 업스케일에서 작은 글자나 머리카락 같은 세부가 얼마나 살아나는지도 공개되지 않았습니다.

개발 문서에는 모든 생성 영상에 SynthID 워터마크가 들어간다고 적혀 있습니다. 눈에는 보이지 않지만 프로그램으로 찾아낼 수 있는 표식으로, 영상이 AI로 만들어졌는지 확인하는 데 씁니다. 콘텐츠 안전 필터는 입력 프롬프트와 생성 영상 모두에 걸리고, 필터 기준은 지역마다 다릅니다.

## 한국에서 쓰려면

구글 AI Pro 이상을 구독하는 국내 이용자는 Google Flow에서 1.1의 기능을, 제미나이 앱에서 이어 붙이기를 쓸 수 있습니다. 개발 문서상 세로 9:16 영상도 만들 수 있어, 구글이 I/O에서 Omni Flash를 넣겠다고 한 유튜브 쇼츠 같은 세로 영상 규격에 바로 맞출 수 있습니다. 유럽 일부 지역에 걸린 업로드 영상 이어 붙이기 제한 목록에 한국은 없습니다.

API로 영상 기능을 붙이려는 국내 개발사는 유료 등급으로 시작하게 되고, 요금은 해상도별 초당 단가로 나옵니다. 40초짜리 광고 시안을 여러 번 뽑는 서비스라면 360p와 720p의 3배 차이가 원가표에 그대로 찍힙니다. 다음 Omni 업데이트가 나오면 다시 전하겠습니다.

읽어 주셔서 고맙습니다.

초이 드림
