# 음성 한 시간에 1센트도 안 드는 모델, Qwen3.8-Omni-Flash
_알리바바가 음성 입력에 따로 받던 웃돈을 없애 음성 한 시간 입력값을 0.01달러 아래로, 음성이 든 영상 한 시간을 0.20달러로 내렸습니다. 도구 사용 평가와 화자 구분에서는 Gemini 3.8 Flash를 앞섰지만, 긴 영상 추론과 한국어가 든 다국어 받아쓰기에서는 뒤졌습니다._
- 매체: 초이의 뉴스레터 · 소식
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-09-18T13:00
- 링크: https://choi-newsletter.com/post/news-qwen38-omni-flash-price
- 답하는 질문: Qwen3.8-Omni-Flash 음성 입력 가격
- 직답: Qwen3.8-Omni-Flash는 모든 입력을 100만 토큰당 0.15달러로 받아, 회사 계산으로 음성 한 시간 입력이 0.01달러에 못 미칩니다.
- 출처: Qwen 블로그, Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery. (https://qwen.ai/blog?id=qwen3.8-omni-flash), Alibaba Qwen X, Qwen3.8-Omni-Flash 발표 (9월 18일) (https://x.com/Alibaba_Qwen/status/2100785962414702599), Alibaba Qwen X, 성능과 가격 도표 (https://x.com/Alibaba_Qwen/status/2100785967309496512), Alibaba Qwen X, 사례 영상 (https://x.com/Alibaba_Qwen/status/2100785971239534679), Alibaba Cloud Model Studio 가격표 (https://www.alibabacloud.com/help/en/model-studio/model-pricing), Qwen2.5-Omni-7B 모델 카드 (Hugging Face) (https://huggingface.co/Qwen/Qwen2.5-Omni-7B), Qwen3-Omni-30B-A3B-Instruct 모델 카드 (Hugging Face) (https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
> 9월 18일 공개된 Qwen3.8-Omni-Flash는 입력을 종류와 상관없이 100만 토큰당 0.15달러로 받아, 이전 세대가 11달러를 받던 음성 입력이 0.15달러가 됐습니다. 시간당 가격은 회사 추정치이고 출력 비용은 따로 붙습니다.

알리바바 Qwen 팀이 9월 18일(한국 시각) 음성과 영상을 이해하고 도구를 불러 결과물까지 만드는 모델 Qwen3.8-Omni-Flash를 API로 공개했습니다. 텍스트와 이미지, 음성, 영상을 한 번에 100만 토큰까지 받고, 회사 계산으로 음성 한 시간을 넣는 값은 0.01달러에 못 미칩니다. 이전 세대 Qwen3.5-Omni-Plus보다 음성 입력은 98%, 음성이 든 영상 입력은 93% 넘게 싸졌는데, 음성에 따로 붙던 웃돈을 없앤 결과입니다.

Qwen은 공식 X 계정에서 이 모델을 에이전트 능력을 중심에 놓고 만든 첫 옴니모달 모델이라고 소개했습니다. 내용을 이해하고, 할 일을 계획하고, 도구로 실행해 결과를 넘기는 과정을 한 모델이 맡는다는 설명입니다. 발표문은 29개 평가 평균이 Qwen3.5-Omni-Plus보다 25% 넘게 올랐고, 음성·영상 성능은 구글 Gemini 3.8 Flash에 가깝고 음성 성능 전체로는 앞선다고 적었습니다. 음성과 영상을 더 받게 되면서도 텍스트 성능은 같은 크기의 텍스트 전용 모델과 비슷한 수준을 지켰다는 설명도 붙였습니다.

Qwen의 옴니 모델은 반년마다 새로 나왔습니다. 처음 두 세대는 가중치까지 풀었지만 3.5 세대부터는 허깅페이스에 가중치가 없고, 이번 모델도 API로만 나왔습니다. 3주 전 [Qwen3.8-Flash-Next를 가중치로 푼 것](/post/news-china-two-releases-qwen-glm)과 달리, 이번 모델을 쓰려면 알리바바 API를 거쳐야 합니다.

| 공개 | 모델 | 공개 방식 |
| --- | --- | --- |
| 2025년 3월 | Qwen2.5-Omni | 가중치 공개(7B) |
| 2025년 9월 | Qwen3-Omni | 가중치 공개(30B, 활성 3B) |
| 2026년 3월 | Qwen3.5-Omni | API |
| 2026년 9월 | Qwen3.8-Omni-Flash | API |

## 음성값을 텍스트값에 맞췄습니다

음성과 영상도 모델 안에서는 토큰으로 쪼개져 들어가고, 요금은 그 토큰 수에 매겨집니다. 알리바바 가격표를 세대별로 놓고 보면 지금까지는 음성 토큰에 텍스트 토큰의 7~9배 값을 받아 왔고, 이번 모델에서 그 차이가 사라졌습니다.

| 모델 (국제 리전, 100만 토큰당) | 텍스트 입력 | 음성 입력 | 텍스트 출력 |
| --- | --- | --- | --- |
| Qwen3-Omni-Flash (2025년 9월) | 0.43달러 | 3.81달러 | 1.66~3.06달러 |
| Qwen3.5-Omni-Flash (2026년 3월) | 0.40달러 | 3.00달러 | 2.20달러 |
| Qwen3.5-Omni-Plus (2026년 3월) | 1.40달러 | 11.00달러 | 8.30달러 |
| Qwen3.8-Omni-Flash (2026년 9월) | 0.15달러 | 0.15달러 | 0.47달러 |

발표문의 98%와 93%는 윗급인 Qwen3.5-Omni-Plus와 견준 숫자입니다. 100만 토큰당 음성 입력값이 11달러에서 0.15달러로 70배 넘게 내려갔으니, 음성 한 시간의 입력값이 0.28달러에서 0.01달러 아래로 떨어진 계산이 맞아떨어집니다. 같은 Flash 등급인 Qwen3.5-Omni-Flash와 견주면 음성 입력은 3달러에서 0.15달러로 95%, 텍스트 입력은 62.5%, 출력은 79% 내렸습니다. 캐시에서 다시 읽는 입력은 0.016달러입니다.

알리바바는 X에 성능표와 함께 시간당 가격을 Gemini 3.8 Flash와 한 장에 올렸습니다. 도표 아래 각주에는 모든 가격이 달러 기준이고, Qwen 모델에는 국제 리전 가격을 썼다고 적혀 있습니다.

| 항목 | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
| --- | --- | --- | --- |
| 음성 포함 영상 입력 (시간당) | 0.20달러 | 3.27달러 | 0.84달러 |
| 음성 입력 (시간당) | 0.01달러 미만 | 0.28달러 | 0.09달러 |
| 텍스트 입력 (100만 토큰) | 0.15달러 | 1.40달러 | 0.75달러 |
| 텍스트 출력 (100만 토큰) | 0.47달러 | 8.30달러 | 3.75달러 |

표에는 조건이 붙어 있습니다. 시간당 값은 2분짜리 입력의 비용에 30을 곱한 추정치이고, 영상은 720p 해상도에서 초당 1프레임만 뽑아 넣은 경우입니다. 영상 한 시간 0.20달러를 입력 단가로 나누면 약 133만 토큰, 초당 370개 안팎이고 음성 한 시간은 0.01달러에도 못 미치니, 영상 값의 대부분은 프레임에서 나옵니다. 해상도를 올리거나 초당 프레임을 늘리면 들어가는 이미지가 늘어 토큰과 값도 함께 늘어납니다. Gemini 3.8 Flash는 영상 해상도를 높음으로 두고 쟀고, 그 가격은 [12월 31일까지 적용되는 도입 가격](/post/news-gemini-38-flash-launch)입니다. Qwen 쪽 값은 싱가포르 국제 리전 기준이며 지역마다 요금이 다릅니다.

시간당 값은 입력만 셌습니다. 받아쓴 글자나 요약문은 출력 토큰으로 따로 계산되고, 영상 생성이나 음성 복제 같은 제작 도구를 부르면 그 값도 더해집니다. 전용 받아쓰기 모델과 견줄 때 이 차이가 드러나는데, 8월 말 나온 [구글 제미나이 3.5 Transcribe](/post/news-gemini-35-transcribe)는 녹음 1분에 약 0.005달러, 9월 1일 나온 [메타 Muse Voice Transcribe](/post/news-meta-muse-voice-transcribe)는 1,000분에 3달러를 받고 그 안에 결과 글자값까지 들어 있습니다.

## 잘하는 일과 밀리는 일

알리바바 표에서 Qwen3.8-Omni-Flash가 가장 크게 앞선 곳은 이미지와 음성, 영상이 섞인 도구 사용 과제입니다. Claude Code에서 돌린 WildClawBench-MM은 71.0점으로 Gemini 3.8 Flash의 58.9점보다 12.1점 높았고, 이전 세대의 34.5점에서 두 배 넘게 올랐습니다.

| 평가 | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
| --- | --- | --- | --- |
| WildClawBench-MM (멀티모달 도구 사용) | 71.0 | 34.5 | 58.9 |
| AgenticVBench (영상 작업) | 36.8 | 14.5 | 45.0 |
| OmniGAIA (웹 검색) | 74.0 | 57.2 | 78.6 |
| Video-MME-v2 (음성·영상 추론) | 65.0 | 47.9 | 71.0 |
| LVOmniBench (긴 영상 추론) | 63.3 | 53.2 | 70.7 |
| FLEURS 60개 언어 받아쓰기 오류율 (낮을수록 좋음) | 9.3 | 7.2 | 7.9 |

반대편 숫자도 같은 표에 있습니다. 영상 작업 평가 AgenticVBench와 웹 검색 OmniGAIA, 영상 추론 Video-MME-v2와 긴 영상 추론 LVOmniBench에서는 Gemini 3.8 Flash가 앞섰습니다. 소리를 알아듣는 평가에서는 Qwen이 앞선 항목이 많았고, 차이가 가장 큰 곳은 소리가 난 위치를 찾는 SpotSoundBench(67.2점 대 39.7점)와 음악 이해 MuchoMusic(72.6점 대 53.7점)이었습니다. 모든 점수는 알리바바가 직접 잰 값입니다.

받아쓰기는 언어에 따라 갈렸습니다. 중국어 인터넷 음성과 회의 음성을 모은 WenetSpeech에서 단어 오류율은 4.8%와 4.6%로 Gemini 3.8 Flash(14.2%, 16.7%)의 3분의 1 수준이었습니다. 반면 한국어가 들어간 60개 언어 평가 FLEURS에서는 9.3%로 Gemini(7.9%)는 물론 이전 세대(7.2%)보다도 높았습니다.

긴 영상에서는 보는 방식을 바꿔 점수를 올렸습니다. 영상을 처음부터 끝까지 넣는 대신 질문에서 출발해 볼 구간을 스스로 고르고 여러 번 좁혀 들어가는 방식입니다. 공식 데모에서는 44분짜리 영상에서 답할 구간을 찾는 데 프레임 60장을 썼는데, 초당 1프레임으로 44분을 다 넣었다면 2,640장이었습니다.

알리바바의 코딩 에이전트 Qwen Code에 이 방식을 붙이자 OmniVideoBench 정확도는 63.4점에서 67.8점으로 오르고, 질문당 토큰은 14만 5,736개에서 7만 9,117개로 45.7% 줄었습니다. 같은 하네스(모델에 도구를 쥐여 주는 실행 틀)에 Gemini 3.8 Flash를 넣으면 70.1점으로 여전히 앞섰지만, 긴 영상 추론 LVOmniBench에서는 Qwen이 63.3점에서 73.6점으로 올라 Gemini(70.7점)를 넘었습니다.

## 화자 구분 오류율 3.4%

회의 녹음을 정리할 때는 받아쓰기만큼 누가 말했는지가 중요합니다. 화자 구분 오류율은 녹음에서 말한 사람을 잘못 가르거나 놓친 시간의 비율로, 낮을수록 좋습니다. 이 숫자가 틀리면 요약과 결정 사항에 붙는 이름이 통째로 어긋납니다.

| 평가 (화자 구분 오류율) | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
| --- | --- | --- | --- |
| AliMeeting | 3.4% | 88.1% | 72.6% |
| AISHELL-4 | 2.8% | 100.0% | 66.4% |
| MagicData-RAMC | 5.7% | 98.4% | 67.9% |
| MLC-SLM (영어) | 4.0% | 68.6% | 60.8% |

네 평가 모두에서 Qwen은 한 자릿수, Gemini 3.8 Flash는 60~70%대였습니다. 알리바바가 회의 평가의 대표로 내세운 AliMeeting에서는 화자와 글자를 함께 맞히는 지표(cpWER)도 17.2% 대 53.1%였습니다. 이전 세대가 한 평가에서 오류율 100%를 기록한 것을 보면, 이 과제는 세대 사이에 거의 새로 익힌 능력입니다.

넷 가운데 셋은 중국어 회의·대화 데이터이고, 영어는 MLC-SLM 하나입니다. 한국어 회의 녹음에서 같은 차이가 나는지는 발표에 없습니다.

발표문은 한 번에 넣을 수 있는 음성 포함 영상을 최대 1시간으로 적었습니다. 회의 영상과 요청을 함께 넣으면 참석자 관계와 회의록, 할 일, 프로젝트 위험을 정리하고, 도구를 붙이면 이메일을 보내거나 회의에서 나온 요구대로 코딩을 시작한다는 설명입니다. 데모에서는 회의 중 「여기」를 가리키며 한 말을 화면과 이어 결정 사항을 정리한 뒤 웹페이지 코드를 고치는 데까지 갔습니다.

![Qwen3.8-Omni-Flash 활용 개요도. 왼쪽에 주요 모듈과 평가 점수, 가운데에 도구 호출과 문맥 관리를 맡는 메인 에이전트, 오른쪽에 영화 해설, 자기 개선, 드라마 번역, 뮤직비디오 제작 흐름이 있습니다.](https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3.8-Omni-Flash/production-overview-v2.png)

## 녹화 파일에서 결과물까지

데모의 공통점은 한 문장 요청으로 여러 단계를 잇는다는 데 있습니다. 짧은 드라마 번역에서는 등장인물을 가려 대사를 옮기고, 인물마다 목소리를 복제해 더빙한 뒤 배경음과 다시 섞습니다. 번역한 문장이 길어지면 원래 컷의 길이와 어긋나는데, 받아쓰기와 번역, 더빙, 편집을 한 작업으로 묶으면 그 어긋남을 중간에 고칠 수 있습니다.

뮤직비디오 데모에서는 노래의 구조와 리듬, 분위기, 가사 타이밍을 읽어 컷별 대본과 촬영 구성을 짜고, 두세 시간짜리 영화로 해설 영상을 만드는 데모에서는 줄거리를 파악해 쓸 구간을 고른 뒤 해설과 음악을 붙여 렌더링합니다. 이때 모델이 직접 내놓는 것은 글입니다. 실제 영상과 음성은 모델이 불러낸 생성·편집 도구가 만들고, 모델은 쓸 구간을 고르고 단계를 지시하고 결과를 다시 보고 듣는 일을 맡습니다.

영상을 설명하는 방식도 요청에 맞춰 달라집니다. 사용자가 대상과 시간 구간, 자세한 정도, 출력 형식을 정하면 같은 영상에서 개요를 뽑거나 특정 구간의 인물 동작과 카메라, 조명, 소리까지 풀어 줍니다. 포토샵으로 머리카락을 딸 때 테두리에 색이 번진다는 질문에는 튜토리얼 단계를 나누고, 곱하기·스크린 혼합 모드의 원리를 찾아 다른 보정 기법과 견준 조사 보고서를 만드는 데모도 있습니다.

알리바바는 이런 작업을 개발 도구에 붙이는 Qwen-MM-Plugins도 공개했습니다. 강의나 사용법 영상을 대표 화면과 시간 정보가 담긴 PDF 노트로 만드는 Video2Note, 시연 영상에서 작업 순서와 판단 기준을 뽑아 다시 쓸 수 있는 에이전트 스킬로 만드는 Omni Skill Creator가 들어 있고, Claude Code와 Codex, Qwen Code에 연결됩니다.

가장 멀리 간 데모는 모델이 다른 모델을 고친 실험입니다. 알리바바는 Qwen3.8-Omni-Flash에게 작은 공개 모델 Qwen2.5-Omni-3B의 쓰촨 방언 인식을 12시간 안에 개선하라고 맡겼고, 모델은 스스로 평가셋과 기준을 정한 뒤 음성을 직접 들어 오류를 진단했습니다. 네 차례 실험에서 학습 예제 3,413개를 만들고 효과 없는 시도는 되돌린 끝에, 글자 오류율은 25.79%에서 15.30%로 40.7% 줄었습니다.

> 큰 모델이 연구개발을 이끌고 작은 모델이 사업의 필요에 답하는 새로운 방식을 탐색했습니다.
> — Qwen 팀, Qwen3.8-Omni-Flash 발표문

이 실험이 12시간 안에 끝난 데에는 채점 기준으로 쓸 WenetSpeech-Chuan 평가셋이 이미 있었던 사정도 있습니다. 모델이 한 일은 정해진 점수를 올리는 데까지였고, 무엇으로 채점할지는 공개된 데이터가 정해 줬습니다.

## 실시간 대화는 따로 팝니다

녹화 파일을 분석하는 기본 모델과 별도로, 대화 도중 보고 들으며 답하는 Qwen3.8-Omni-Flash-Realtime이 함께 나왔습니다. 발표문의 측정표를 보면 첫 음성이 나오기까지 음성 입력은 약 1초, 음성과 영상을 함께 넣으면 1.2~1.35초가 걸렸고, 입력이 길수록 조금씩 늘었습니다.

| 입력 | 첫 토큰까지 | 첫 음성까지 | 텍스트 출력 속도 |
| --- | --- | --- | --- |
| 음성 6초 | 591ms | 978ms | 초당 84.9토큰 |
| 음성 20초 | 618ms | 1,026ms | 초당 81.1토큰 |
| 음성·영상 6초 | 838ms | 1,215ms | 초당 84.9토큰 |
| 음성·영상 20초 | 981ms | 1,350ms | 초당 83.0토큰 |

데모에는 사용자의 발음과 억양을 듣고 고쳐 주는 말하기 연습, 소리가 나는 방향과 거리를 카메라 화면과 함께 읽어 로봇의 이동 도구를 부르는 시연이 실렸습니다. 고객 상담처럼 회사마다 말투와 업무 절차가 다른 곳에서는 브랜드 용어와 응대 규칙을 스킬로 실시간 주입해 쓰는 방식을 제시했습니다.

알리바바는 이 Realtime 모델을 에이전트로 쓰는 실행 틀 Qwen-Live Harness도 오픈소스로 풀었습니다. 음성 생성은 한국어를 포함한 29개 언어, 음성 인식은 74개 언어를 지원합니다.

![Qwen-Live Harness 상호작용 구조도. 가운데 메인 에이전트 Qwen3.8-Omni-Flash가 문맥 관리, 메모리, 하위 에이전트, 검색·코드 도구와 연결되고, 아래에 음성·영상 입력 전처리가 있습니다.](https://qianwen-res.oss-accelerate-overseas.aliyuncs.com/Qwen3.8-Omni-Flash/fig3.png?v=20260916-2053)

## 국내에서 먼저 따질 것

값은 한국 기업이 음성 자동화를 검토할 때 걸리던 가장 큰 항목을 거의 지웠습니다. 음성 입력만 놓고 보면 녹음 100시간을 넣어도 1달러가 들지 않고, 음성이 든 영상 100시간은 20달러입니다. 남는 비용은 출력과 반복 호출, 제작 도구이고, 에이전트가 같은 구간을 여러 번 다시 보면 입력 토큰도 그만큼 쌓입니다. 발표문은 추론 강도를 xhigh와 medium, low 가운데 고르게 해 비용을 조절하도록 했습니다.

값보다 먼저 걸리는 것은 데이터의 행선지입니다. 가격표 기준은 싱가포르 리전이고, 고객 상담 녹취나 사내 회의처럼 개인정보와 미공개 정보가 담긴 음성을 이 API로 보내면 해외 서버에서 처리됩니다. API는 OpenAI 호환 Chat Completions와 Responses 형식을 지원하고 엔드포인트는 베이징과 싱가포르 두 곳이며, 가중치가 공개되지 않아 사내 서버에 올려 돌리는 방법은 아직 없습니다.

품질은 아직 한국어로 확인되지 않았습니다. 발표된 화자 구분 점수는 중국어와 영어 데이터에서 나왔고, 한국어가 들어간 60개 언어 받아쓰기에서는 Gemini 3.8 Flash보다 오류가 많았습니다. 알리바바가 성능표와 가격표를 한 장에 올린 이번 발표에서, 한국 기업이 직접 채워야 할 숫자는 한국어 회의 녹음으로 잰 오류율입니다.

읽어 주셔서 고맙습니다.

초이 드림
