이 글 어땠어요?
API는 한국어를 포함한 85개가 넘는 언어를 자동으로 가려 받아 적습니다. 제미나이 맥 앱의 음성 입력은 아직 영어만 지원하고, 한국어를 지원하는 Gboard Rambler는 픽셀 11 시리즈에서만 돌아갑니다.
화자 구분은 최대 8명이고 3명부터는 실험 단계입니다. 화자 구분이나 단어별 시각 표시를 켜면 한 번에 30분까지만 처리하고, 이때는 smart 모드와 사용자 단어장을 함께 쓸 수 없습니다.
녹음 파일은 1분에 약 0.005달러, 실시간은 약 0.009달러입니다. 전작 Chirp 3의 표준 요금은 1분에 0.016달러이고, 무료 등급으로 보낸 데이터는 구글 제품 개선에 쓰입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
구글이 8월 27일 영상 생성·편집 모델 제미나이 Omni 1.1 Flash를 공개했습니다. 이어 붙이기, 첫·끝 프레임 지정, 360p 초안, 4K 업스케일, 참고 영상 입력이 붙었고, API 요금은 해상도별로 초당 0.03~0.30달러입니다.

유튜브가 9월 23일 Made on YouTube 2026에서 문장으로 지시하는 대화형 편집과 말로 만드는 맞춤 피드, 쇼츠 시즌 기능을 발표했습니다. 대화형 편집은 2027년 초 Shorts에, 맞춤 피드는 올가을 미국에 먼저 들어옵니다.
구글이 9월 2일 제미나이 3.8 Flash와 보안용 3.8 Flash Cyber를 공개했습니다. 6주 만의 세 번째 Flash이고, 모델 카드는 구조와 학습 데이터를 3.7 Flash와 같다고 적었습니다. 같은 날 메타 Muse Spark 1.3은 더 높은 지수를 더 싸게 냈습니다.

구글이 8월 27일 영상 생성·편집 모델 제미나이 Omni 1.1 Flash를 공개했습니다. 이어 붙이기, 첫·끝 프레임 지정, 360p 초안, 4K 업스케일, 참고 영상 입력이 붙었고, API 요금은 해상도별로 초당 0.03~0.30달러입니다.

유튜브가 9월 23일 Made on YouTube 2026에서 문장으로 지시하는 대화형 편집과 말로 만드는 맞춤 피드, 쇼츠 시즌 기능을 발표했습니다. 대화형 편집은 2027년 초 Shorts에, 맞춤 피드는 올가을 미국에 먼저 들어옵니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@sundarpichaiX 게시물 · 원문 보기
순다르 피차이 CEO는 발표 직후 X에 이 모델로 할 수 있는 일을 세 가지로 적었습니다. 여러 사람이 말하는 음성에서도 사용자의 말과 의도를 알아듣는 앱을 만들 수 있고, 85개가 넘는 언어를 설정 없이 알아서 가려내며, 전문 용어는 사용자가 넣어 둔 단어장에 맞춰 적는다는 내용입니다. 끝에는 「들어 보니 좋다(sounds good to me)」를 줄인 영어 약어 SGTM을 붙였고, 함께 올린 영상의 미리보기 화면에는 단어장에 「NeuroWave」 같은 낯선 이름을 넣어 두는 창이 떠 있습니다.
발표문은 제미나이 오디오 팀이 냈습니다. 개발자는 발표 당일부터 구글 AI Studio와 Antigravity에서 Gemini API로, 기업은 Gemini Enterprise Agent Platform에서 공개 미리보기(프리뷰)로 쓸 수 있습니다. API에서 부르는 이름은 실시간용이 gemini-3.5-transcribe-live, 파일용이 gemini-3.5-transcribe입니다.
배경 소음과 복잡한 전문 용어, 더듬은 말 정리에 애를 먹는 기존 음성 인식 모델과 달리, 제미나이 3.5 Transcribe는 가공하지 않은 음성을 곧바로 정확하고 다듬어진 서식 있는 글로 옮깁니다.— 구글 제미나이 오디오 팀, 발표문
실시간용은 Live API라는 양방향 스트리밍 연결로 소리를 받으면서, 말하는 도중에는 임시 결과를, 말이 멈추면 확정 결과를 돌려줍니다. 구글은 이쪽을 음성 에이전트와 실시간 자막에 쓰라고 안내합니다. 파일용은 회의 녹음이나 통화 기록처럼 이미 저장된 음성을 한 번에 넘기는 방식이고, 누가 말했는지 가르는 화자 구분과 단어마다 시각을 붙이는 기능은 이쪽에만 있습니다. 개발자 문서에 적힌 두 모델의 차이를 표로 옮기면 아래와 같습니다.
| 항목 | 실시간용 (transcribe-live) | 파일용 (transcribe) |
|---|---|---|
| 언어 자동 인식 | 85개 이상 | 85개 이상 |
| 사용자 단어장 | 최대 1,000개 (100개 이하 권장) | 최대 1,000개 (100개 이하 권장) |
| 읽기 좋게 다듬는 smart 모드 | 지원 | 지원 |
| 화자 구분 | 없음 | 최대 8명 (3명부터 실험 단계) |
| 단어별 시각 표시 | 없음 | 지원 |
| 한 번에 처리하는 길이 | 세션당 10분 | 1시간 (화자 구분·시각 표시를 켜면 30분) |
| 1분당 가격 | 약 0.009달러 | 약 0.005달러 |
전작 Chirp 3는 구글 클라우드 Speech-to-Text에서 파는 모델이고, 표준 인식 요금은 월 50만 분까지 1분에 0.016달러입니다. 이름에 제미나이를 단 새 모델은 Gemini API로 팔리고, 같은 1분의 값이 파일용으로는 3분의 1 아래, 실시간용으로는 절반 남짓입니다. 발표문에는 Live API로 음성 앱을 만드는 개발 플랫폼 일곱 곳(LiveKit, Pipecat, Vercel 등)이 소개됐고, 스마트폰 회사 vivo를 비롯한 기업 세 곳이 지연 시간과 정확도를 좋게 평가했다는 내용도 실렸습니다.
3.5 Transcribe의 요금은 제미나이 언어 모델처럼 토큰으로 매깁니다. 구글은 음성 1초를 토큰 25개로 세므로 1분이면 1,500개이고, 파일용 입력 단가인 100만 토큰당 2달러를 곱하면 약 0.003달러가 나옵니다. 받아 적은 글은 1분에 토큰 175개로 잡고 100만 토큰당 12달러를 매겨 약 0.002달러가 더해지니, 둘을 합쳐 1분에 약 0.005달러가 됩니다.
실시간용은 입력 3.5달러, 출력 21달러를 같은 방식으로 계산해 1분에 약 0.009달러입니다. 파일용으로 한 시간짜리 회의 녹음을 받아 적으면 약 0.3달러가 들고, 같은 한 시간을 실시간으로 흘려보내면 약 0.54달러가 듭니다. 두 모델 모두 무료 등급이 함께 열렸습니다.
에서 들린 대로 적는 일과 읽을 글로 옮기는 일은 서로 다른 작업입니다. 사람은 말하면서 「음」과 「어」를 섞고, 같은 말을 되풀이하고, 도중에 말을 고칩니다. 3.5 Transcribe는 들린 대로 다 적는 verbatim을 기본값으로 두고, 읽기 좋게 다듬는 smart 모드를 따로 켜게 했습니다.
smart 모드는 군말과 더듬은 부분을 지우고, 고쳐 말한 대목은 고친 쪽만 남기며, 차례로 말한 항목은 번호 목록으로 묶습니다. 「이천육백만 달러」처럼 말로 한 숫자는 「$26M」 같은 표기로 옮겨 적습니다. 구글 개발자 문서의 예시를 우리말로 옮기면 이렇습니다.
| 말한 내용 | verbatim 결과 | smart 결과 |
|---|---|---|
| 음, 그러니까 회의에는, 어, 앨리스랑, 아니 잠깐, 밥이랑 캐럴을 부르자 | 음 그러니까 회의에는 어 앨리스랑 아니 잠깐 밥이랑 캐럴을 부르자 | 회의에는 밥이랑 캐럴을 부르자 |
| 첫 번째 항목 예산 검토 두 번째 항목 일정 확정 세 번째 항목 요약 발송 | 들린 그대로 | 1. 예산 검토 2. 일정 확정 3. 요약 발송 |
| 화요일에, 아니 수요일 두 시에 보자 | 들린 그대로 | 수요일 오후 2시에 보자 |
구글 공식 계정도 이 기능을 앞세웠습니다. 발표 게시물은 이 모델을 지금까지 가장 정확한 음성 인식 모델이라고 소개한 뒤, 바로 다음 문장에 「음」과 「어」 같은 군말을 지우고 고쳐 말한 내용을 반영한다는 설명을 붙였습니다.
@GoogleX 게시물 · 원문 보기
이 모드에는 조건이 붙습니다. smart 모드는 화자 구분이나 단어별 시각 표시와 함께 켤 수 없고, 사용자 단어장도 두 기능 가운데 하나와 같이 넣으면 API가 요청을 거절합니다. 누가 말했는지 붙은 회의록은 들린 대로 적는 verbatim으로만 받을 수 있고, 그때는 팀에서 쓰는 전문 용어 목록도 넣을 수 없습니다.
제미나이 맥 앱에는 7월 29일 음성 입력이 들어갔습니다. Fn 키를 길게 누른 채 말하면 어느 창에서든 군말을 뺀 문장이 커서 위치에 바로 입력되고, 설정에서 제미나이의 추론 기능을 켜면 화면에서 선택한 글을 말로 고쳐 쓰게 하거나 이미지를 만들게 할 수 있습니다. 구글은 이 기능을 영어로 먼저 전 세계에 풀었고 다른 언어는 곧 추가한다고 적었습니다.

8월 26일 발표문은 이 음성 입력을 돌리는 모델이 3.5 Transcribe였다고 밝히고, 한 가지를 덧붙였습니다. 받아 적은 말이 명령이면 이미지 생성이나 파일 분석 같은 무거운 작업을 함수 호출로 다른 제미나이 모델에 넘긴다는 설명입니다. 컴퓨터에 있는 파일을 요약하거나 커서 위치에 이미지를 만드는 일을 말 한마디로 시킬 수 있고, 이 연동은 지금 맥 앱에서만 됩니다.
안드로이드에서는 Gboard의 Rambler가 같은 모델로 돌아갑니다. 구글이 5월 12일 안드로이드용 Gemini Intelligence를 소개하며 처음 공개한 기능으로, 생각나는 대로 한 말을 정돈된 메시지로 옮기고 목소리로 문체를 바꾸거나 틀린 단어를 고칠 수 있습니다. 발표 당일의 Gboard 도움말을 보면 Rambler는 픽셀 11 시리즈에서만 쓸 수 있고, 지원 언어 목록에 한국어가 들어 있습니다.
에이전트 개발 도구 Antigravity에서는 사용자가 허락하면 화면 내용과 대화 기록을 함께 보고, 파일 이름이나 에이전트가 적어 둔 문장처럼 발음만으로는 알기 어려운 단어를 맞춰 적습니다. AI Studio의 Build 모드에서는 말로 앱을 만들 수 있고, 크롬에서 아무 웹 입력창에나 말로 쓰는 기능은 곧 나온다고 발표문에 적혀 있습니다.
맥에서 Fn 키를 누른 채 말하는 방식은 구글만 쓰지 않습니다. 메타는 8월 20일 맥용 Meta AI 앱을 내면서, 앱을 열지 않아도 Fn 키를 꾹 누르고 말하면 커서가 있는 곳에 글이 들어가는 시스템 전역 받아쓰기를 넣었습니다. 구글 맥 앱의 음성 입력이 나온 지 3주 뒤입니다.
발표 당일에는 구글 AI Studio의 제품 리드 아마르 레시가 3.5 Transcribe로 만든 맥용 받아쓰기 앱 Jot의 코드를 구글 제미나이 깃허브에 Apache 2.0 라이선스로 열었습니다. Fn 키를 누른 채 말하고 손을 떼면 쓰던 앱에 정리된 문장이 들어가는 앱이고, 음성은 사용자 자신의 API 키로 Gemini API에 곧장 보내 중간 서버를 거치지 않습니다. 소개 글은 오후 1시로 하자고 했다가 2시로 고쳐 말하면 「2시에 만나자」만 남는다는 예시를 들고 「이것이 홍보 문구의 전부」라고 적었습니다. 구글이 공식 지원하는 제품은 아니라는 문구도 붙어 있습니다.
받아쓰기 앱 시장에는 월 구독료를 받는 회사가 여럿 있습니다. Wispr Flow는 개인과 팀용 Pro 요금제를 월 15달러(연간 결제 시 월 12달러)에 팝니다. 같은 15달러면 3.5 Transcribe 파일용으로 3,000분, 실시간용으로 약 1,667분을 받아 적을 수 있고, Jot처럼 자기 API 키로 모델을 부르는 앱을 쓰면 앱 구독료 없이 받아 적은 분량만큼만 구글에 냅니다.
받아쓰기 앱은 모델을 골라 끼울 수 있습니다. 7월 29일 Superwhisper는 Cohere의 음성 인식 모델 Transcribe를 앱에 넣어 인터넷 연결 없이도 받아 적게 했습니다. 그 전날 오픈AI는 실시간용 GPT Live Transcribe와 파일용 GPT Transcribe를 따로 냈고, Artificial Analysis는 GPT Transcribe의 값이 전작보다 25% 내린 1,000분당 4.5달러라고 집계했습니다.
@superwhisperX 게시물 · 원문 보기
오픈AI가 두 모델을 실시간용과 파일용으로 나눈 방식은 구글이 한 달 뒤 내놓은 구성과 같습니다. 오픈AI는 7월 8일 맞장구치며 듣는 음성 모델 GPT-Live를 챗GPT에 넣은 뒤 받아쓰기 모델을 따로 내놨고, 구글은 맥 앱과 Gboard에 먼저 넣은 모델을 개발자에게 열었습니다.
구글이 발표문에 실은 비교는 FLEURS라는 다국어 평가입니다. 여러 언어의 낭독 음성을 모은 자료로, 단어 오류율은 100단어 가운데 몇 개를 틀리게 적었는지를 나타내며 낮을수록 좋습니다. 구글 그래프는 한국어(ko-KR)를 포함한 25개 언어·지역을 합친 값이라, 한국어만의 오류율은 따로 나와 있지 않습니다.
| 모델 | 실시간 오류율 | 파일 오류율 |
|---|---|---|
| 제미나이 3.5 Transcribe | 5.50% | 5.04% |
| 구글 Chirp 3 | 7.32% | 5.66% |
| 오픈AI GPT Live Transcribe | 8.97% | 7.47% |
| ElevenLabs Scribe v2 (실시간은 Realtime) | 9.70% | 7.12% |
| Deepgram Nova-3 | 15.77% | 11.35% |

독립 평가 기관 Artificial Analysis의 파일 전사 순위에서 3.5 Transcribe는 오류율 2.6%로 5위였습니다. 앞에는 알리바바의 Fun-Realtime-ASR-preview(1.7%), ElevenLabs Scribe v2(2.2%), 마이크로소프트 MAI-Transcribe-1.5(2.4%), Smallest AI Pulse Pro(2.4%)가 있었습니다. 실시간 순위에서는 오류율 4.0%에 말이 끝나고 0.40초 만에 확정 결과를 냈습니다.
@ArtificialAnlysX 게시물 · 원문 보기
두 표는 잰 음성부터 다릅니다. FLEURS는 25개 언어·지역의 낭독 음성이고, Artificial Analysis의 지수는 자체 구성한 대화 음성(AA-AgentTalk) 50%, 유럽의회 연설(VoxPopuli) 25%, 기업 실적 발표 통화(Earnings22) 25%로 만듭니다. 구글 표에서 3.5 Transcribe와 3.47%포인트 벌어졌던 GPT Live Transcribe는 Artificial Analysis 실시간 측정에서 오류율 3.9%로 거의 같았고, 대신 확정 결과까지 0.81초로 두 배쯤 걸렸습니다.
구글이 내세운 「최종 결과까지 걸리는 시간 70% 단축」도 Artificial Analysis의 측정입니다. 이 기관 자료에서 Chirp 3 실시간판은 확정 결과까지 1.28초, 3.5 Transcribe Live는 0.40초가 걸렸습니다. 가격까지 한 표에 놓으면 3.5 Transcribe는 전작보다 정확하고 싸졌지만, 오류율과 가격 모두에서 앞서는 모델도 있습니다.
| 모델 | 파일 오류율 (Artificial Analysis) | 1,000분당 가격 |
|---|---|---|
| ElevenLabs Scribe v2 | 2.2% | 3.67달러 |
| 제미나이 3.5 Transcribe | 2.6% | 5.00달러 |
| 오픈AI GPT Transcribe | 3.3% | 4.50달러 |
| 구글 Chirp 3 | 4.3% | 16.00달러 |
| Deepgram Nova-3 | 5.2% | 4.30달러 |
시연 영상에도 조건이 붙어 있습니다. 구글 딥마인드와 피차이가 올린 영상 아래쪽에는 「시퀀스를 줄였고 화면은 모사했으며, 호환성과 제공 여부는 다를 수 있다」는 문구가 적혀 있습니다. 발표문이 내세운 우편번호나 주문 번호처럼 영문과 숫자가 섞인 말의 인식률도 따로 숫자로 나오지 않았습니다.
한국어는 자동 인식 대상 85개 언어에 들어 있어 API에서는 발표 당일부터 쓸 수 있습니다. 소비자 제품은 사정이 다릅니다. 맥 앱의 음성 입력은 영어만 지원하고, 한국어를 지원하는 Rambler는 픽셀 11 시리즈에서만 돌아갑니다.
회의록을 만드는 국내 서비스라면 문서의 제약 세 가지가 설계에 그대로 들어갑니다. 한 시간짜리 주간 회의에 화자 구분을 켜면 한 번에 30분까지만 받으므로 두 번에 나눠 보내게 되고, 화자 구분을 켠 요청에는 사내 용어 단어장을 넣을 수 없으며, 읽기 좋게 다듬는 smart 모드도 쓸 수 없습니다. 상담 전화를 실시간으로 받아 적으려는 곳이라면 실시간용이 세션 하나에 10분까지만 받는다는 조건도 걸립니다.
개인정보는 요금제와 얽혀 있습니다. 요금 안내 페이지를 보면 무료 등급으로 보낸 데이터는 구글 제품 개선에 쓰이고, 유료 등급 데이터는 쓰이지 않습니다. 소비자용 Rambler에 대해서는 음성을 실시간 받아쓰기에만 쓰고 저장하지 않는다고 구글이 따로 밝혔습니다.
구글은 크롬 음성 입력과 고객 상담용 Gemini Enterprise for Customer Experience 연동을 「곧」이라고만 적었고, 맥 앱의 다른 언어 지원도 날짜를 밝히지 않았습니다. 맥 앱의 음성 입력은 7월 29일 영어로 먼저 나왔고, 그 음성 입력을 돌리던 모델이 4주 뒤인 8월 26일 개발자에게 열렸습니다. 맥 앱에서 한국어로 말할 수 있게 되면 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림