# 고쳐 말하면 고친 대로 적는 받아쓰기, 구글 제미나이 3.5 Transcribe
_구글 발표 기준 다국어 실시간 오류율은 5.50%로 전작 Chirp 3(7.32%)보다 낮고, 녹음 파일은 1분에 약 0.005달러로 Chirp 3의 3분의 1 아래입니다. 독립 순위표에서는 2.6%로 5위였고, 화자 구분을 켜면 한 번에 30분까지만 처리합니다._
- 매체: 초이의 뉴스레터 · 소식
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-08-27T13:00
- 링크: https://choi-newsletter.com/post/news-gemini-35-transcribe
- 답하는 질문: 제미나이 3.5 Transcribe 가격과 기능
- 직답: 제미나이 3.5 Transcribe는 녹음 파일 1분에 약 0.005달러, 실시간은 약 0.009달러이고, 말하다 고친 내용은 고친 쪽만 남깁니다.
- 출처: Google, Intelligent transcription with Gemini 3.5 Transcribe (8월 26일) (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/), Gemini API 문서, Gemini 3.5 Transcribe 모델 페이지 (https://ai.google.dev/gemini-api/docs/models/gemini-3.5-transcribe), Gemini API 문서, Audio transcription (https://ai.google.dev/gemini-api/docs/transcribe), Gemini API 문서, Live transcription (https://ai.google.dev/gemini-api/docs/live-api/live-transcribe), Gemini API 요금 안내 (https://ai.google.dev/gemini-api/docs/pricing), 순다르 피차이 X 발표 (https://x.com/sundarpichai/status/2092659467284517088), Google X 발표 (https://x.com/Google/status/2092659278632894576), Artificial Analysis X, 3.5 Transcribe 측정 (https://x.com/ArtificialAnlys/status/2092697329933643881), Artificial Analysis, Speech to Text (https://artificialanalysis.ai/speech-to-text), Google, Gemini for macOS 음성 기능 (7월 29일) (https://blog.google/innovation-and-ai/products/gemini-app/speak-naturally-gemini-app-mac-os/), Google, Gemini Intelligence와 Rambler (5월 12일) (https://blog.google/products-and-platforms/platforms/android/gemini-intelligence/), Gboard 도움말, Rambler voice input (https://support.google.com/gboard/answer/17468539?hl=en), GitHub, google-gemini/jot-gemini-transcribe-macOS (https://github.com/google-gemini/jot-gemini-transcribe-macOS), Google Cloud, Speech-to-Text 요금 (https://cloud.google.com/speech-to-text/pricing), Wispr Flow 요금 (https://wisprflow.ai/pricing), Superwhisper X, Cohere Transcribe 탑재 (7월 29일) (https://x.com/superwhisper/status/2082490678890697040), Artificial Analysis X, GPT Transcribe 측정 (7월 29일) (https://x.com/ArtificialAnlys/status/2082285338509418727), 초이 스레드, 메타 맥용 Meta AI 앱 (8월 20일) (https://www.threads.net/@choi.openai/post/DcQtnydik60)
> 구글이 8월 26일 음성 인식 전용 모델 제미나이 3.5 Transcribe를 공개했습니다. 말하다 고친 내용은 고친 쪽만 남기는 smart 모드가 붙었고, 제미나이 맥 앱의 음성 입력은 이미 이 모델로 돌고 있었습니다. 녹음 파일은 1분에 약 0.005달러입니다.

구글이 8월 26일(미국 시각) 음성을 글자로 옮기는 일만 하는 모델 제미나이 3.5 Transcribe를 공개했습니다. 마이크 소리를 1초 안에 받아 적는 실시간용과 저장된 녹음을 처리하는 파일용 두 가지이고, 값은 1분에 약 0.009달러와 0.005달러입니다. 구글은 이날 제미나이 맥 앱의 음성 입력과 안드로이드 Gboard의 Rambler가 이미 이 모델로 돌아가고 있었다는 사실도 함께 밝혔습니다.

순다르 피차이 CEO는 발표 직후 X에 이 모델로 할 수 있는 일을 세 가지로 적었습니다. 여러 사람이 말하는 음성에서도 사용자의 말과 의도를 알아듣는 앱을 만들 수 있고, 85개가 넘는 언어를 설정 없이 알아서 가려내며, 전문 용어는 사용자가 넣어 둔 단어장에 맞춰 적는다는 내용입니다. 끝에는 「들어 보니 좋다(sounds good to me)」를 줄인 영어 약어 SGTM을 붙였고, 함께 올린 영상의 미리보기 화면에는 단어장에 「NeuroWave」 같은 낯선 이름을 넣어 두는 창이 떠 있습니다.

발표문은 제미나이 오디오 팀이 냈습니다. 개발자는 발표 당일부터 구글 AI Studio와 Antigravity에서 Gemini API로, 기업은 Gemini Enterprise Agent Platform에서 공개 미리보기(프리뷰)로 쓸 수 있습니다. API에서 부르는 이름은 실시간용이 gemini-3.5-transcribe-live, 파일용이 gemini-3.5-transcribe입니다.

> 배경 소음과 복잡한 전문 용어, 더듬은 말 정리에 애를 먹는 기존 음성 인식 모델과 달리, 제미나이 3.5 Transcribe는 가공하지 않은 음성을 곧바로 정확하고 다듬어진 서식 있는 글로 옮깁니다.
> — 구글 제미나이 오디오 팀, 발표문

## 실시간용과 파일용은 무엇이 다른가

실시간용은 Live API라는 양방향 스트리밍 연결로 소리를 받으면서, 말하는 도중에는 임시 결과를, 말이 멈추면 확정 결과를 돌려줍니다. 구글은 이쪽을 음성 에이전트와 실시간 자막에 쓰라고 안내합니다. 파일용은 회의 녹음이나 통화 기록처럼 이미 저장된 음성을 한 번에 넘기는 방식이고, 누가 말했는지 가르는 화자 구분과 단어마다 시각을 붙이는 기능은 이쪽에만 있습니다. 개발자 문서에 적힌 두 모델의 차이를 표로 옮기면 아래와 같습니다.

| 항목 | 실시간용 (transcribe-live) | 파일용 (transcribe) |
| --- | --- | --- |
| 언어 자동 인식 | 85개 이상 | 85개 이상 |
| 사용자 단어장 | 최대 1,000개 (100개 이하 권장) | 최대 1,000개 (100개 이하 권장) |
| 읽기 좋게 다듬는 smart 모드 | 지원 | 지원 |
| 화자 구분 | 없음 | 최대 8명 (3명부터 실험 단계) |
| 단어별 시각 표시 | 없음 | 지원 |
| 한 번에 처리하는 길이 | 세션당 10분 | 1시간 (화자 구분·시각 표시를 켜면 30분) |
| 1분당 가격 | 약 0.009달러 | 약 0.005달러 |

전작 Chirp 3는 구글 클라우드 Speech-to-Text에서 파는 모델이고, 표준 인식 요금은 월 50만 분까지 1분에 0.016달러입니다. 이름에 제미나이를 단 새 모델은 Gemini API로 팔리고, 같은 1분의 값이 파일용으로는 3분의 1 아래, 실시간용으로는 절반 남짓입니다. 발표문에는 Live API로 음성 앱을 만드는 개발 플랫폼 일곱 곳(LiveKit, Pipecat, Vercel 등)이 소개됐고, 스마트폰 회사 vivo를 비롯한 기업 세 곳이 지연 시간과 정확도를 좋게 평가했다는 내용도 실렸습니다.

## 1분에 0.005달러가 나오는 계산

3.5 Transcribe의 요금은 제미나이 언어 모델처럼 토큰으로 매깁니다. 구글은 음성 1초를 토큰 25개로 세므로 1분이면 1,500개이고, 파일용 입력 단가인 100만 토큰당 2달러를 곱하면 약 0.003달러가 나옵니다. 받아 적은 글은 1분에 토큰 175개로 잡고 100만 토큰당 12달러를 매겨 약 0.002달러가 더해지니, 둘을 합쳐 1분에 약 0.005달러가 됩니다.

실시간용은 입력 3.5달러, 출력 21달러를 같은 방식으로 계산해 1분에 약 0.009달러입니다. 파일용으로 한 시간짜리 회의 녹음을 받아 적으면 약 0.3달러가 들고, 같은 한 시간을 실시간으로 흘려보내면 약 0.54달러가 듭니다. 두 모델 모두 무료 등급이 함께 열렸습니다.

## 고쳐 말하면 고친 쪽만 남는다

받아쓰기에서 들린 대로 적는 일과 읽을 글로 옮기는 일은 서로 다른 작업입니다. 사람은 말하면서 「음」과 「어」를 섞고, 같은 말을 되풀이하고, 도중에 말을 고칩니다. 3.5 Transcribe는 들린 대로 다 적는 verbatim을 기본값으로 두고, 읽기 좋게 다듬는 smart 모드를 따로 켜게 했습니다.

smart 모드는 군말과 더듬은 부분을 지우고, 고쳐 말한 대목은 고친 쪽만 남기며, 차례로 말한 항목은 번호 목록으로 묶습니다. 「이천육백만 달러」처럼 말로 한 숫자는 「$26M」 같은 표기로 옮겨 적습니다. 구글 개발자 문서의 예시를 우리말로 옮기면 이렇습니다.

| 말한 내용 | verbatim 결과 | smart 결과 |
| --- | --- | --- |
| 음, 그러니까 회의에는, 어, 앨리스랑, 아니 잠깐, 밥이랑 캐럴을 부르자 | 음 그러니까 회의에는 어 앨리스랑 아니 잠깐 밥이랑 캐럴을 부르자 | 회의에는 밥이랑 캐럴을 부르자 |
| 첫 번째 항목 예산 검토 두 번째 항목 일정 확정 세 번째 항목 요약 발송 | 들린 그대로 | 1. 예산 검토 2. 일정 확정 3. 요약 발송 |
| 화요일에, 아니 수요일 두 시에 보자 | 들린 그대로 | 수요일 오후 2시에 보자 |

구글 공식 계정도 이 기능을 앞세웠습니다. 발표 게시물은 이 모델을 지금까지 가장 정확한 음성 인식 모델이라고 소개한 뒤, 바로 다음 문장에 「음」과 「어」 같은 군말을 지우고 고쳐 말한 내용을 반영한다는 설명을 붙였습니다.

이 모드에는 조건이 붙습니다. smart 모드는 화자 구분이나 단어별 시각 표시와 함께 켤 수 없고, 사용자 단어장도 두 기능 가운데 하나와 같이 넣으면 API가 요청을 거절합니다. 누가 말했는지 붙은 회의록은 들린 대로 적는 verbatim으로만 받을 수 있고, 그때는 팀에서 쓰는 전문 용어 목록도 넣을 수 없습니다.

## 맥 앱과 Gboard에서 먼저 돌고 있었다

제미나이 맥 앱에는 7월 29일 음성 입력이 들어갔습니다. Fn 키를 길게 누른 채 말하면 어느 창에서든 군말을 뺀 문장이 커서 위치에 바로 입력되고, 설정에서 제미나이의 추론 기능을 켜면 화면에서 선택한 글을 말로 고쳐 쓰게 하거나 이미지를 만들게 할 수 있습니다. 구글은 이 기능을 영어로 먼저 전 세계에 풀었고 다른 언어는 곧 추가한다고 적었습니다.

![파란 배경 가운데에 취소 버튼, 음성 파형, 보내기 버튼이 가로로 놓인 알약 모양 입력 막대](https://storage.googleapis.com/gweb-uniblog-publish-prod/images/Gemini_for_macOS_language_capabilities_hero.width-1300.png)

8월 26일 발표문은 이 음성 입력을 돌리는 모델이 3.5 Transcribe였다고 밝히고, 한 가지를 덧붙였습니다. 받아 적은 말이 명령이면 이미지 생성이나 파일 분석 같은 무거운 작업을 함수 호출로 다른 제미나이 모델에 넘긴다는 설명입니다. 컴퓨터에 있는 파일을 요약하거나 커서 위치에 이미지를 만드는 일을 말 한마디로 시킬 수 있고, 이 연동은 지금 맥 앱에서만 됩니다.

안드로이드에서는 Gboard의 Rambler가 같은 모델로 돌아갑니다. 구글이 5월 12일 안드로이드용 Gemini Intelligence를 소개하며 처음 공개한 기능으로, 생각나는 대로 한 말을 정돈된 메시지로 옮기고 목소리로 문체를 바꾸거나 틀린 단어를 고칠 수 있습니다. 발표 당일의 Gboard 도움말을 보면 Rambler는 픽셀 11 시리즈에서만 쓸 수 있고, 지원 언어 목록에 한국어가 들어 있습니다.

에이전트 개발 도구 Antigravity에서는 사용자가 허락하면 화면 내용과 대화 기록을 함께 보고, 파일 이름이나 에이전트가 적어 둔 문장처럼 발음만으로는 알기 어려운 단어를 맞춰 적습니다. AI Studio의 Build 모드에서는 말로 앱을 만들 수 있고, 크롬에서 아무 웹 입력창에나 말로 쓰는 기능은 곧 나온다고 발표문에 적혀 있습니다.

## Fn 키를 누르고 말하는 앱이 한 달 새 셋

맥에서 Fn 키를 누른 채 말하는 방식은 구글만 쓰지 않습니다. 메타는 8월 20일 맥용 Meta AI 앱을 내면서, 앱을 열지 않아도 Fn 키를 꾹 누르고 말하면 커서가 있는 곳에 글이 들어가는 시스템 전역 받아쓰기를 넣었습니다. 구글 맥 앱의 음성 입력이 나온 지 3주 뒤입니다.

발표 당일에는 구글 AI Studio의 제품 리드 아마르 레시가 3.5 Transcribe로 만든 맥용 받아쓰기 앱 [Jot](https://github.com/google-gemini/jot-gemini-transcribe-macOS)의 코드를 구글 제미나이 깃허브에 Apache 2.0 라이선스로 열었습니다. Fn 키를 누른 채 말하고 손을 떼면 쓰던 앱에 정리된 문장이 들어가는 앱이고, 음성은 사용자 자신의 API 키로 Gemini API에 곧장 보내 중간 서버를 거치지 않습니다. 소개 글은 오후 1시로 하자고 했다가 2시로 고쳐 말하면 「2시에 만나자」만 남는다는 예시를 들고 「이것이 홍보 문구의 전부」라고 적었습니다. 구글이 공식 지원하는 제품은 아니라는 문구도 붙어 있습니다.

## 월 15달러 앱과 1분 0.005달러 API

받아쓰기 앱 시장에는 월 구독료를 받는 회사가 여럿 있습니다. Wispr Flow는 개인과 팀용 Pro 요금제를 월 15달러(연간 결제 시 월 12달러)에 팝니다. 같은 15달러면 3.5 Transcribe 파일용으로 3,000분, 실시간용으로 약 1,667분을 받아 적을 수 있고, Jot처럼 자기 API 키로 모델을 부르는 앱을 쓰면 앱 구독료 없이 받아 적은 분량만큼만 구글에 냅니다.

받아쓰기 앱은 모델을 골라 끼울 수 있습니다. 7월 29일 Superwhisper는 Cohere의 음성 인식 모델 Transcribe를 앱에 넣어 인터넷 연결 없이도 받아 적게 했습니다. 그 전날 오픈AI는 실시간용 GPT Live Transcribe와 파일용 GPT Transcribe를 따로 냈고, Artificial Analysis는 GPT Transcribe의 값이 전작보다 25% 내린 1,000분당 4.5달러라고 집계했습니다.

오픈AI가 두 모델을 실시간용과 파일용으로 나눈 방식은 구글이 한 달 뒤 내놓은 구성과 같습니다. 오픈AI는 7월 8일 [맞장구치며 듣는 음성 모델 GPT-Live](/post/news-openai-gpt-live-fullduplex)를 챗GPT에 넣은 뒤 받아쓰기 모델을 따로 내놨고, 구글은 맥 앱과 Gboard에 먼저 넣은 모델을 개발자에게 열었습니다.

## 구글 표에서는 1위, 외부 순위표에서는 5위

구글이 발표문에 실은 비교는 FLEURS라는 다국어 평가입니다. 여러 언어의 낭독 음성을 모은 자료로, 단어 오류율은 100단어 가운데 몇 개를 틀리게 적었는지를 나타내며 낮을수록 좋습니다. 구글 그래프는 한국어(ko-KR)를 포함한 25개 언어·지역을 합친 값이라, 한국어만의 오류율은 따로 나와 있지 않습니다.

| 모델 | 실시간 오류율 | 파일 오류율 |
| --- | --- | --- |
| 제미나이 3.5 Transcribe | 5.50% | 5.04% |
| 구글 Chirp 3 | 7.32% | 5.66% |
| 오픈AI GPT Live Transcribe | 8.97% | 7.47% |
| ElevenLabs Scribe v2 (실시간은 Realtime) | 9.70% | 7.12% |
| Deepgram Nova-3 | 15.77% | 11.35% |

![FLEURS 실시간 음성 인식 단어 오류율 막대그래프. 제미나이 3.5 Transcribe Live 5.50%, 구글 클라우드 Chirp 3 7.32%, ElevenLabs Scribe v2 Realtime 9.70%, OpenAI GPT Live Transcribe 8.97%, Deepgram Nova-3 15.77%](/figures/vault/news-gemini-35-transcribe/tr35-fleurs-streaming-wer.png)

독립 평가 기관 Artificial Analysis의 파일 전사 순위에서 3.5 Transcribe는 오류율 2.6%로 5위였습니다. 앞에는 알리바바의 Fun-Realtime-ASR-preview(1.7%), ElevenLabs Scribe v2(2.2%), 마이크로소프트 MAI-Transcribe-1.5(2.4%), Smallest AI Pulse Pro(2.4%)가 있었습니다. 실시간 순위에서는 오류율 4.0%에 말이 끝나고 0.40초 만에 확정 결과를 냈습니다.

두 표는 잰 음성부터 다릅니다. FLEURS는 25개 언어·지역의 낭독 음성이고, Artificial Analysis의 지수는 자체 구성한 대화 음성(AA-AgentTalk) 50%, 유럽의회 연설(VoxPopuli) 25%, 기업 실적 발표 통화(Earnings22) 25%로 만듭니다. 구글 표에서 3.5 Transcribe와 3.47%포인트 벌어졌던 GPT Live Transcribe는 Artificial Analysis 실시간 측정에서 오류율 3.9%로 거의 같았고, 대신 확정 결과까지 0.81초로 두 배쯤 걸렸습니다.

구글이 내세운 「최종 결과까지 걸리는 시간 70% 단축」도 Artificial Analysis의 측정입니다. 이 기관 자료에서 Chirp 3 실시간판은 확정 결과까지 1.28초, 3.5 Transcribe Live는 0.40초가 걸렸습니다. 가격까지 한 표에 놓으면 3.5 Transcribe는 전작보다 정확하고 싸졌지만, 오류율과 가격 모두에서 앞서는 모델도 있습니다.

| 모델 | 파일 오류율 (Artificial Analysis) | 1,000분당 가격 |
| --- | --- | --- |
| ElevenLabs Scribe v2 | 2.2% | 3.67달러 |
| 제미나이 3.5 Transcribe | 2.6% | 5.00달러 |
| 오픈AI GPT Transcribe | 3.3% | 4.50달러 |
| 구글 Chirp 3 | 4.3% | 16.00달러 |
| Deepgram Nova-3 | 5.2% | 4.30달러 |

시연 영상에도 조건이 붙어 있습니다. 구글 딥마인드와 피차이가 올린 영상 아래쪽에는 「시퀀스를 줄였고 화면은 모사했으며, 호환성과 제공 여부는 다를 수 있다」는 문구가 적혀 있습니다. 발표문이 내세운 우편번호나 주문 번호처럼 영문과 숫자가 섞인 말의 인식률도 따로 숫자로 나오지 않았습니다.

## 회의록에 쓰려면 걸리는 조건

한국어는 자동 인식 대상 85개 언어에 들어 있어 API에서는 발표 당일부터 쓸 수 있습니다. 소비자 제품은 사정이 다릅니다. 맥 앱의 음성 입력은 영어만 지원하고, 한국어를 지원하는 Rambler는 픽셀 11 시리즈에서만 돌아갑니다.

회의록을 만드는 국내 서비스라면 문서의 제약 세 가지가 설계에 그대로 들어갑니다. 한 시간짜리 주간 회의에 화자 구분을 켜면 한 번에 30분까지만 받으므로 두 번에 나눠 보내게 되고, 화자 구분을 켠 요청에는 사내 용어 단어장을 넣을 수 없으며, 읽기 좋게 다듬는 smart 모드도 쓸 수 없습니다. 상담 전화를 실시간으로 받아 적으려는 곳이라면 실시간용이 세션 하나에 10분까지만 받는다는 조건도 걸립니다.

개인정보는 요금제와 얽혀 있습니다. 요금 안내 페이지를 보면 무료 등급으로 보낸 데이터는 구글 제품 개선에 쓰이고, 유료 등급 데이터는 쓰이지 않습니다. 소비자용 Rambler에 대해서는 음성을 실시간 받아쓰기에만 쓰고 저장하지 않는다고 구글이 따로 밝혔습니다.

## 다음은 크롬과 다른 언어

구글은 크롬 음성 입력과 고객 상담용 Gemini Enterprise for Customer Experience 연동을 「곧」이라고만 적었고, 맥 앱의 다른 언어 지원도 날짜를 밝히지 않았습니다. 맥 앱의 음성 입력은 7월 29일 영어로 먼저 나왔고, 그 음성 입력을 돌리던 모델이 4주 뒤인 8월 26일 개발자에게 열렸습니다. 맥 앱에서 한국어로 말할 수 있게 되면 다시 전하겠습니다.

읽어 주셔서 고맙습니다.

초이 드림
