음성 모델
TTS · STT · 음성 인식 · 받아쓰기
말을 알아듣는 인식과 소리를 만드는 합성을 맡는 모델입니다. 받아쓰기가 운영체제 기본 기능으로 들어갔고, 20명이 동시에 말해도 화자를 가려내는 서비스가 시간당 0.18달러 선에서 나왔습니다.
‘음성 모델’ 이 나오는 글5
추론하고도 0.32초, 인셉션이 전화 상담용 Mercury Voice를 내놨습니다
인셉션이 9월 29일(미국 시각) 음성 에이전트용 Mercury Voice를 정식 출시했습니다. 추론을 마치고 첫 답변 토큰까지 중앙값 320밀리초(회사 측정)이고, 값은 100만 토큰당 입력 0.40·출력 1.50달러에 출시 할인 50%입니다.

정확도 1위에 값은 절반 아래, 메타가 실시간 받아쓰기 모델을 내놨습니다
메타 초지능 랩이 9월 1일 첫 실시간 오디오 모델 Muse Voice Transcribe를 공개했습니다. 단어 오류율 3.1%로 Artificial Analysis 스트리밍 순위 1위였고, 1,000분에 3달러로 경쟁 모델의 절반이 안 됩니다. 한국어 오류율은 공개되지 않았습니다.

고쳐 말하면 고친 대로 적는 받아쓰기, 구글 제미나이 3.5 Transcribe
구글이 8월 26일 음성 인식 전용 모델 제미나이 3.5 Transcribe를 공개했습니다. 말하다 고친 내용은 고친 쪽만 남기는 smart 모드가 붙었고, 제미나이 맥 앱의 음성 입력은 이미 이 모델로 돌고 있었습니다. 녹음 파일은 1분에 약 0.005달러입니다.

GPU보다 대기열이 먼저 찼다, 오픈AI GPT-Live 6개월 제작기
오픈AI가 8월 3일 GPT-Live 실시간 시스템을 6개월 동안 만든 과정을 공개했습니다. 미디어 경로와 추론 로직을 Python에서 Go로 다시 써 새 시스템의 p95 지연이 옛 시스템 p50 수준으로 내려왔고, 연결 준비 왕복은 6번에서 1번으로 줄었습니다.

맞장구치며 듣는 챗GPT, 오픈AI가 음성 모델 GPT-Live를 공개했습니다
오픈AI가 7월 8일(미국 시각) 챗GPT 음성 모드를 새 모델 GPT-Live로 바꿨습니다. 대학원 수준 과학 문제 평가 GPQA에서 기존 음성 모드는 45.3점, 추론 강도를 하이로 둔 GPT-Live-1은 84.2점을 받았습니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 지연어떤 시작점부터 정한 결과가 나타날 때까지의 지연 시간입니다. 네트워크의 편도·왕복 시간, 모델의 첫 토큰 시간, 답변 전체 완료 시간은 서로 다릅니다. 비교할 때는 시작과 끝의 기준, 캐시와 부하 조건을 맞추고 평균뿐 아니라 오래 걸린 요청의 분포도 확인해야 합니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 코딩 에이전트저장소를 읽고 명령을 실행하며 코드를 끝까지 고치는 에이전트입니다. 최근 모델 도약이 지식 문답 대신 이쪽에 몰려서, 딥시크 V4-Pro는 코딩 에이전트 평가 DeepSWE에서 12.8점이 62.7점이 됐습니다. 같은 모델도 어떤 하네스에 올리느냐에 따라 점수가 크게 달라집니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
