이 글 어땠어요?
소리를 포함한 영상을 한 번에 30초까지 만듭니다. 직전 모델 2.0은 15초였고, 결과물 끝에 30초씩 이어 붙이는 확장을 반복하면 몇 분짜리 영상도 만들 수 있다고 바이트댄스는 설명합니다.
한 번에 이미지 30장, 영상 10개, 음성 10개까지 넣을 수 있습니다. 질감 없는 흰색 3D 모델로 구도와 카메라 동선을 잡아 넘기는 참고 방식도 지원합니다.
바이트댄스는 특정 구간의 인물이나 동작, 줄거리만 골라 고치는 시간 단위 편집을 지원한다고 발표했습니다. 고친 구간 앞뒤가 얼마나 자연스럽게 이어지는지는 아직 이용자 사례로 충분히 확인되지 않았습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
문샷AI가 7월 27일 Kimi K3 가중치를 공개하며 FlashKDA·MoonEP·AgentENV를 함께 풀었고, 11분 뒤 서빙 업체 7곳의 검증 점수가 올라왔습니다. 지난해 K2는 vLLM에서 도구 호출 1,200여 건 중 218건만 제대로 처리될 만큼 흔들렸습니다.

딥시크 량원펑이 투자자들과 나눈 네 시간 회의록에는 하지 않을 일의 목록과 숫자가 함께 들어 있습니다. 미국의 20분의 1 컴퓨트, 6~18개월의 격차, 연구 인력 절반의 데이터 작업, 열 달 회수 가격을 따라가며 그 절제가 어떤 계산인지 풀었습니다.
첫 구동 13일 뒤 처리량은 처음의 3.22배가 됐습니다. 파이썬 GIL 하나 때문에 20% 넘게 벌어지던 성능 차이를 1% 아래로 줄였고, 에이전트가 찾은 정밀도 문제의 수정은 오픈소스 라이브러리 Flash Linear Attention에 병합됐습니다.

문샷AI가 7월 27일 Kimi K3 가중치를 공개하며 FlashKDA·MoonEP·AgentENV를 함께 풀었고, 11분 뒤 서빙 업체 7곳의 검증 점수가 올라왔습니다. 지난해 K2는 vLLM에서 도구 호출 1,200여 건 중 218건만 제대로 처리될 만큼 흔들렸습니다.

딥시크 량원펑이 투자자들과 나눈 네 시간 회의록에는 하지 않을 일의 목록과 숫자가 함께 들어 있습니다. 미국의 20분의 1 컴퓨트, 6~18개월의 격차, 연구 인력 절반의 데이터 작업, 열 달 회수 가격을 따라가며 그 절제가 어떤 계산인지 풀었습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
지금까지 AI 영상은 5~10초짜리 클립을 여러 번 뽑아 이어 붙이는 방식이었습니다. 컷이 넘어갈 때마다 인물 얼굴과 조명, 카메라 움직임이 조금씩 어긋났고, 편집자는 그 이음매를 맞추는 데 시간을 썼습니다. 바이트댄스의 직전 모델 Seedance 2.0도 한 번에 15초까지였습니다.
2.5는 소리까지 포함한 30초짜리 영상을 한 번에 만듭니다. 결과물 끝에 다음 30초를 이어 붙이는 확장을 여러 번 반복할 수 있어서, 같은 인물과 배경을 유지한 채 몇 분짜리 영상도 만들 수 있다는 것이 바이트댄스의 설명입니다. 광고 한 편 분량이 이음매 없는 한 컷에 들어옵니다. 국내 방송 광고는 15초와 30초가 기본 규격이라, 이제 한 번의 생성으로 방송 광고 한 편 길이를 채울 수 있습니다.
바이트댄스가 공개한 예시가 이 차이를 보여 줍니다. 핸드헬드 짐벌로 한 번에 따라가는 설정의 30초 영상에서 카메라는 붉은 커튼 틈으로 분장실에 들어가 이어폰을 고치는 가수를 비추고, 무대 뒤 복도에서 댄서들과 인사하는 모습을 따라간 뒤, 함께 무대에 올라 객석 전경까지 물러납니다. 바이트댄스는 30초 안에서 한순간을 늘이는 대신 도입과 전개, 전환과 마무리를 갖춘 여러 컷을 논리적으로 잇는 것이 목표라고 적었습니다.
@choi.openaiThreads 게시물 · 원문 보기
영화에도 비슷한 시도가 있었습니다. 2019년 영화 「1917」은 전편을 한 번에 찍은 것처럼 보이도록 컷을 숨겨 이어 붙였고, 관객은 이음매를 찾지 못했습니다. AI 영상은 그동안 이음매가 보이는 쪽이었습니다. 2.5는 이음매를 숨기는 대신 이음매가 생기는 횟수 자체를 줄였습니다.
바이트댄스는 AI 영상이 지나치게 인공적으로 보이는 문제를 따로 짚었습니다. 사물의 질감과 피부, 눈동자, 조명, 채도 같은 세부를 손봤고, AI 영상에서 자주 나오던 의도하지 않은 자막과 배경음악도 줄였다고 적었습니다. 지시하지 않았는데 화면에 글자가 박히거나 음악이 끼어드는 일은 그동안 생성 영상을 실무에 쓰기 어렵게 만든 대표적인 결함이었습니다.
물리적으로 그럴듯한 움직임도 예시로 내세웠습니다. 경극 무대를 한 번에 도는 예시에서 카메라는 주인공의 긴 소매를 따라 원을 그리고, 휘날리는 소매는 공중에서 자연스러운 호를 그립니다. 인물과 배경은 컷이 여러 번 넘어가는 동안에도 흔들리지 않습니다. 옷과 머리카락, 천의 움직임은 영상 생성 모델이 가장 자주 틀리던 영역이라, 바이트댄스가 이 예시를 앞에 둔 데에는 이유가 있습니다.
두 번째 변화는 참고 자료입니다. 한 번에 이미지 30장, 영상 10개, 음성 10개를 넣을 수 있고, 모델은 구도와 배경, 스타일, 인물, 소품을 각 자료에서 읽어 지시대로 영상에 반영합니다. 인물이 여럿 나오는 영상에서도 각자의 얼굴과 목소리를 유지한다는 설명입니다.
바이트댄스가 올린 오케스트라 공연 예시에는 참고 이미지가 18장 들어갔습니다. 공연장 1장, 피아니스트와 첼로, 바이올린, 주연 가수가 1장씩, 나머지 오케스트라 5장, 합창단 4장, 객석 4장입니다. 30초 동안 카메라가 공연장 전경에서 연주자들을 훑고, 합창이 들어오고, 박수로 끝나는 흐름을 지시문으로 적었습니다.
참고 자료가 이만큼 늘면 쓰는 방식도 달라집니다. 참고를 한두 장 넣는 것은 화풍을 지정하는 일이고, 수십 장을 넣는 것은 등장 요소를 등록하는 일에 가깝습니다. 브랜드 작업이라면 제품 색과 로고 위치, 모델 얼굴을 한 번 등록해 두고 여러 편에 다시 쓰게 되고, 팀이 쌓아 두는 자산도 프롬프트 문서에서 참고 자료 묶음 쪽으로 옮겨 갑니다.
질감 없는 흰색 3D 모델, 이른바 클레이 렌더를 참고로 받는 기능도 들어왔습니다. 마야나 블렌더 같은 3D 프로그램에서 공간 구조와 인물의 자세, 동선, 카메라 각도를 미리 잡아 넘기면, 모델이 그 구도를 따라 영상을 만들고 광원의 방향과 색온도, 그림자까지 공간에 맞춰 입힙니다. 바이트댄스는 흰색 3D 모델로 짠 조립 순서를 사실적인 자동차 조립 영상으로 바꾼 예시도 함께 공개했습니다.
세 번째는 편집입니다. 생성 단계에서는 지시문에 0~4초, 4~10초처럼 시간대를 적어 구간별 내용과 카메라를 정할 수 있고, 생성이 끝난 뒤에는 특정 구간의 인물이나 동작, 줄거리만 골라 고칠 수 있다고 바이트댄스는 설명합니다. 그린스크린 배경을 바꾸는 편집, 인물과 동작은 그대로 두고 카메라 움직임만 바꾸는 편집도 여기에 들어갑니다.
예시 가운데 하나에서는 그린스크린 앞에서 드리블하는 축구 선수 영상을 넣고, 0~4초는 바위와 벽돌, 타이어가 놓인 야외 훈련장으로, 4~10초는 친구들이 응원하는 라커룸으로, 10~15초는 수비수와 골키퍼를 제치고 골을 넣는 국제 경기로 바꾸라고 적었습니다. 배경이 바뀌어도 옷자락이 날리는 방향과 머리카락, 걸음 박자, 조명이 새 환경에 맞게 따라간다는 것이 바이트댄스의 설명입니다. 아침 식사를 차리는 영상에서는 인물과 동작은 그대로 두고, 프라이팬을 스치는 초소형 드론 시점과 위에서 내려다보는 부감, 손을 따라가는 핸드헬드 근접 촬영으로 카메라 계획만 15초 동안 네 번 바꿨습니다.
이 기능이 중요한 이유는 30초라는 길이가 양날이기 때문입니다. 한 번에 길게 만들면 이음매는 사라지지만, 22초 지점 하나가 무너졌을 때 30초를 통째로 다시 만들어야 한다면 실패 한 번의 비용도 그만큼 커집니다. 구간 편집이 발표대로 작동한다면 무너진 몇 초만 고쳐 이 비용을 줄일 수 있습니다.
다만 이 부분은 아직 발표 단계의 설명입니다. 고친 구간 앞뒤가 얼마나 자연스럽게 이어지는지, 몇 번까지 고쳐도 인물이 흔들리지 않는지는 이용자들의 사례로 확인된 것이 많지 않습니다.
공개 직후부터 제작 사례가 이어졌습니다. 제가 7월 31일과 8월 3일, 8월 9일에 모은 사례만 서른 건이 넘고, 종류도 넓습니다.
| 종류 | 사례 |
|---|---|
| 광고 | 애플풍 제품 광고, 키보드 광고, 언박싱 영상 |
| 영화·연출 | 실사 영화 스타일, 시간 정지 장면, 감정 연기 |
| 대규모 장면 | 군중 장면 생성 |
| 음악 | K팝 뮤직비디오 |
| 일상 | 브이로그, 사용자 제작 콘텐츠(UGC) 스타일 |
| 그림 | 애니메이션 |
@choi.openaiThreads 게시물 · 원문 보기
사례마다 반복해서 지목된 항목은 피부 질감과 조명, 카메라 움직임, 컷 전환 네 가지였습니다. 앞의 둘은 정지 화면 한 장에서도 드러나고, 뒤의 둘은 시간이 흘러야 드러납니다. 피부와 조명은 이미지 모델이 몇 해에 걸쳐 끌어올린 영역이라 프레임 한 장을 잘 만들면 해결되지만, 카메라와 컷은 여러 장의 순서를 맞춰야 합니다.
일반 촬영본과 구분하기 어렵다는 반응이 나온 사례는 대개 뒤의 둘까지 맞아떨어진 경우였습니다. 사람은 영상을 한 프레임씩 들여다보지 않고 흐름을 따라가다 걸리는 곳에서 멈춥니다. 그래서 흐름이 어긋나면 정지 화면이 아무리 좋아도 어색함이 바로 드러나고, 흐름이 맞으면 작은 결함은 잘 잡히지 않습니다. 촬영본과 섞어 쓰는 편집에서도 먼저 버려지는 것은 카메라가 어긋난 구간입니다. 피부가 조금 어색한 화면은 색보정으로 덮을 수 있지만, 카메라가 튄 화면은 덮을 방법이 없습니다.
Seedance는 2.0 때부터 개발자들의 작업 도구로 쓰이고 있었습니다. 7월에는 GPT Image 2로 아이소메트릭 그림을 그리고 Seedance로 그 그림을 훑는 카메라 이동 영상을 뽑은 뒤, 스크롤 위치에 맞춰 영상을 재생하는 웹사이트 제작 도구가 공개됐습니다. 구간을 잇는 연결 영상은 이웃 구간의 실제 프레임에서 뽑아 이음매 없이 한 번의 비행처럼 이어지게 했고, 만든 개발자는 사이트 하나에 10~15달러가 든다고 밝혔습니다.
2.5의 값은 아직 가볍지 않습니다. 출시 당일 720p 30초 한 편에 1,440크레딧이 나갔다는 이용자 보고가 올라왔습니다. 8월 9일 영상 생성 플랫폼 Higgsfield에도 Seedance 2.5가 들어왔는데, 해상도는 480p와 720p까지였고 신규 구독자에게 33일 동안 크레딧 차감 없이 쓰게 하는 출시 행사가 붙었습니다.
바이트댄스 안에서는 이미지·영상 생성 앱 지멍(Jimeng)과 도우바오 프로에서 먼저 쓸 수 있고, 기업용 API는 바이트댄스의 클라우드 사업 BytePlus를 통해 곧 열린다고 했습니다. API 가격이 나오기 전까지는 초당 비용을 다른 모델과 나란히 계산하기 어렵습니다.
바이트댄스는 발표문 끝에 개선할 점도 적었습니다. 복잡한 동작의 물리적 그럴듯함, 그리고 여러 인물이 서로 부딪히고 주고받는 영상의 안정성입니다. 공개된 사례가 대부분 인물 한두 명의 동작과 카메라 이동에 집중된 것도 이 한계와 맞물립니다.
사례 쪽에서 비어 있는 숫자도 있습니다. 서른 건 넘게 모인 사례 가운데 몇 번째 시도에서 나온 결과인지, 한 편에 비용이 얼마 들었는지를 적은 것은 거의 없습니다. 올라온 사례는 잘 나온 결과를 골라 올린 목록이라, 전체 시도의 평균 품질과는 다른 숫자입니다.
도입을 검토하는 쪽에 필요한 숫자는 품질 점수보다 재현율입니다. 같은 지시로 열 번 돌렸을 때 쓸 만한 결과가 몇 번 나오는지가 제작 일정을 정합니다. 이 숫자는 회사가 발표해야만 얻을 수 있는 것도 아니어서, 자기 소재로 지시를 고정해 두고 돌려 보면 쓰는 쪽이 직접 셀 수 있습니다. 사례를 올리는 쪽에는 이 숫자를 함께 올릴 이유가 없어서, 기다린다고 저절로 채워지지는 않습니다.
만드는 단위가 커지면 그 앞뒤의 일정도 움직입니다. 그림 콘티를 그려 승인을 받고 촬영하던 순서에서, 30초 완성본 여러 개를 만들어 놓고 고르는 순서로 갈 수 있습니다. 승인을 받는 대상이 설명 문서에서 화면으로 옮겨 가는 겁니다.
수정 요청의 단위도 달라집니다. 15초 지점의 손동작을 바꿔 달라는 요청이 들어오면, 구간 편집이 없던 방식에서는 30초 전체를 다시 만들어야 합니다. 수정 횟수를 정해 두고 계약하는 국내 광고 제작 관행에서는 같은 횟수를 적어 두고도 다시 만드는 양이 달라지니, 구간 편집이 실제로 얼마나 버티는지가 도구 선택만큼 중요해집니다.
영상 생성 모델들이 줄이려는 시간은 서로 조금씩 다릅니다. 7월 말 나온 FLUX 3는 이미지와 영상, 음성을 한 모델에서 처리해 도구 사이를 오가는 시간을 줄이는 쪽이고, 그 내용은 FLUX 3를 다룬 글에 있습니다. Seedance 2.5는 이어 붙인 뒤 어긋난 곳을 잡는 시간을 줄이는 쪽입니다. 한 사람이 처음부터 끝까지 만드는 작업에서는 앞쪽 시간이 크고, 분업하는 제작사에서는 뒤쪽 시간이 큽니다.
바이트댄스가 겨냥하는 곳은 광고와 영화에서 끝나지 않습니다. 교육용 예시로는 남송 시대 거리에서 신기질의 사 한 구절을 외치며 뛰어가는 아이들을 카메라가 따라가다 시인을 비추는 한 컷짜리 영상을 공개했고, 도우바오의 학습 앱에 이런 영상이 들어가고 있다고 했습니다. 발표문은 이와 함께 로봇의 인식과 조작을 학습시킬 합성 영상 데이터, 자율주행 시험에 쓸 악천후와 복잡한 교통 상황처럼 현실에서 좀처럼 만나기 어려운 상황의 시뮬레이션을 새 쓰임새로 꼽았습니다. 30초를 한 번에 일관되게 만드는 능력은 사람의 눈을 속이는 데서 그치지 않고, 기계가 배울 영상을 만드는 데도 쓰입니다.
결과물만으로 사람들을 설득하는 단계는 지났습니다. 이제 남은 일은 그 결과물이 몇 번째 시도였는지 세는 일이고, 30초 단위에서는 한 번 더 돌릴 때 버리는 길이도 그만큼 길어집니다. 발표문 전문과 예시 영상은 바이트댄스 Seed의 Seedance 2.5 소개 글에 있습니다.
읽어 주셔서 고맙습니다.
초이 드림