이 글 어땠어요?
구글 표에서 DeepSWE v1.1은 73.7% 대 74.0%입니다. 다만 Terminal-bench 4.0(19.1% 대 51.8%)과 OSWorld-2.0(59.0% 대 75.4%), GDPVal-AA v2(1545점 대 1824점)에서는 Opus 5가 크게 앞섰습니다.
토큰 단가는 3.7 Flash와 같은 입력 0.75달러, 출력 3.75달러이고 12월 31일에 끝납니다. Artificial Analysis 기준 과제당 비용은 높은 설정 0.58달러로 3.7 Flash보다 약 40% 높고, 중간 설정은 0.41달러, 낮은 설정은 0.24달러입니다.
모델 카드는 영어 외 언어의 안전성 평가가 3.7 Flash보다 5.4%포인트 나빠졌다고 밝혔습니다. 지식 기준일은 2026년 3월이고 일부 분야는 2025년 1월에 머물러 있습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
구글이 8월 26일 음성 인식 전용 모델 제미나이 3.5 Transcribe를 공개했습니다. 말하다 고친 내용은 고친 쪽만 남기는 smart 모드가 붙었고, 제미나이 맥 앱의 음성 입력은 이미 이 모델로 돌고 있었습니다. 녹음 파일은 1분에 약 0.005달러입니다.

유튜브가 9월 23일 Made on YouTube 2026에서 문장으로 지시하는 대화형 편집과 말로 만드는 맞춤 피드, 쇼츠 시즌 기능을 발표했습니다. 대화형 편집은 2027년 초 Shorts에, 맞춤 피드는 올가을 미국에 먼저 들어옵니다.
구글이 8월 27일 영상 생성·편집 모델 제미나이 Omni 1.1 Flash를 공개했습니다. 이어 붙이기, 첫·끝 프레임 지정, 360p 초안, 4K 업스케일, 참고 영상 입력이 붙었고, API 요금은 해상도별로 초당 0.03~0.30달러입니다.

구글이 8월 26일 음성 인식 전용 모델 제미나이 3.5 Transcribe를 공개했습니다. 말하다 고친 내용은 고친 쪽만 남기는 smart 모드가 붙었고, 제미나이 맥 앱의 음성 입력은 이미 이 모델로 돌고 있었습니다. 녹음 파일은 1분에 약 0.005달러입니다.

유튜브가 9월 23일 Made on YouTube 2026에서 문장으로 지시하는 대화형 편집과 말로 만드는 맞춤 피드, 쇼츠 시즌 기능을 발표했습니다. 대화형 편집은 2027년 초 Shorts에, 맞춤 피드는 올가을 미국에 먼저 들어옵니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@GoogleDeepMindX 게시물 · 원문 보기
구글 딥마인드는 3.8 Flash를 「지금까지 가장 똑똑한 모델」이라고 소개했고, 발표문은 같은 기반 지능에서 일반판과 보안판 두 가지를 나눴다고 적었습니다. 일반판은 3.7 Flash와 같은 도입 가격(입력 0.75달러, 출력 3.75달러)으로 Gemini API와 AI Studio, Android Studio, 에이전트 개발 도구 Antigravity, UI 생성 도구 Stitch, Gemini Enterprise에 들어갔습니다. 구글 AI Pro·Ultra 구독자는 제미나이 앱과 검색 AI 모드, 구글 시트에서 쓸 수 있고, 3.8 Flash Cyber는 새로 만든 Fairwind 프로그램을 거쳐 검증된 방어 기관에만 열립니다.
발표 4주 전인 8월 7일, 반도체·AI 분석 회사 SemiAnalysis는 「Gemini is Cooked(제미나이는 끝났다)」라는 글에서 구글 모델이 세는 방식에 따라 8~9위라고 적었습니다. 발표 전날 카부쿠오글루 딥마인드 수석부사장(SVP)은 지금 모델 품질이 프런티어보다 조금 아래라고 말했습니다. 같은 날 월스트리트저널은 구글 내부 코딩 도구 Jetski에서 3.8 Flash와 Opus를 나란히 써 본 일부 엔지니어가 3.8 Flash를 더 선호했다고 보도했습니다.
모델 카드 표에는 3.7 Flash와 Opus 5, Sonnet 5, GPT-5.6 Sol, GPT-5.6 Terra가 함께 실렸습니다. 3주 전 3.7 Flash 표에는 없던 앤트로픽과 오픈AI의 최상위 모델 Opus 5와 Sol이 이번에 들어갔습니다. 14개 항목 가운데 3.8 Flash가 가장 높은 항목은 8개였고, Opus 5가 5개, Sol이 1개에서 앞섰습니다.
| 평가 | 3.8 Flash | 3.7 Flash | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| DeepSWE v1.1 (장기 코딩) | 73.7% | 65.3% | 74.0% | 72.7% |
| Terminal-bench 2.1 (터미널 코딩) | 89.4% | 85.8% | 89.1% | 88.8% |
| Terminal-bench 4.0 (범용 에이전트) | 19.1% | 11.2% | 51.8% | 37.3% |
| OSWorld-2.0 (컴퓨터 사용) | 59.0% | 50.6% | 75.4% | 62.6% |
| GDPVal-AA v2 (지식 노동, Elo) | 1545 | 1482 | 1824 | 1710 |
| Vals Finance Agent v2 (금융 분석) | 61.4% | 59.0% | 58.6% | 53.8% |
| Harvey Legal Agent (법률 업무) | 10.0% | 8.8% | 6.7% | 2.5% |
| HLE-Verified (전문가 추론) | 54.9% | 53.6% | 54.4% | 54.5% |
| CharXiv (차트 읽기, 도구 없이) | 86.2% | 84.5% | 83.7% | 85.8% |
| LVBench (긴 영상 이해) | 87.8% | 85.4% | 75.4% | 82.1% |
| 출력 단가(100만 토큰) | 3.75달러 | 3.75달러 | 25달러 | 20달러 |
금융 분석 Vals Finance Agent v2(61.4%)와 법률 업무 Harvey Legal Agent Benchmark(10.0%)에서 1위였고, 차트 읽기 CharXiv(86.2%)와 긴 영상 이해 LVBench(87.8%)도 가장 높았습니다. 범용 에이전트 능력을 재는 Terminal-bench 4.0에서는 19.1%로 Opus 5(51.8%)보다 32.7%포인트 낮았고, 컴퓨터 사용 OSWorld-2.0(59.0% 대 75.4%)과 지식 노동 GDPVal-AA v2(1545점 대 1824점)에서도 차이가 컸습니다. 터미널 코딩을 재는 Terminal-bench 2.1에서는 89.4%로 Opus 5(89.1%)를 앞섰습니다.
@arenaX 게시물 · 원문 보기
사람이 두 답을 보고 더 나은 쪽을 고르는 아레나에서도 모습이 비슷했습니다. Text Arena에서 3.8 Flash는 1494점으로 7위에 올라 Opus 5(1492점, 8위)를 앞섰고, 코딩 부문 순위는 3.7 Flash의 22위에서 7위로 올랐습니다. 에이전트 작업을 겨루는 Agent Arena에서는 3.7 Flash(32위)보다 크게 오른 14위였고, 웹 개발 Code Arena에서는 1567점으로 18위였습니다.

DeepSWE는 데이터 회사 Datacurve가 운영하는 평가로, 실제 저장소에서 여러 파일을 고쳐야 끝나는 소프트웨어 과제를 에이전트가 혼자 풀게 합니다. 구글 차트에서 Flash 계열은 5월 3.5 Flash의 30%대 중반에서 3.6과 3.7을 거쳐 3.8 Flash의 73.7%까지 올라왔고, 과제당 비용은 2달러 안팎에 머물렀습니다.
Artificial Analysis의 측정에서는 점수와 함께 비용도 올랐습니다. 높은 설정의 3.8 Flash는 종합 지능 지수 59점으로 3.7 Flash보다 3점 올라 GPT-5.6 Sol(xhigh), Grok 4.6(medium)과 같아졌고, 과제 하나에 0.58달러가 들었습니다. 토큰 단가가 그대로인데도 3.7 Flash(0.40달러)보다 약 40% 비싸진 것은, 과제당 평균 출력 토큰이 4만 8,000개로 30% 늘고 에이전트 평가에서 주고받는 횟수도 늘었기 때문이라고 이 기관은 설명했습니다. 과제 하나에 걸리는 시간도 2.2분에서 2.5분으로 길어졌습니다.
발표문도 이 점을 숨기지 않았습니다. 3.8 Flash는 더 끈기 있게 일하도록 설계돼 추론 단계를 더 밟고 도구를 반복해 부르며, 높은 설정에서는 토큰을 더 쓸 수 있다고 적었습니다. 효율이 먼저인 작업에는 설정을 낮추거나 계속 지원하는 3.7 Flash를 쓰라고 덧붙였고, Artificial Analysis 기준으로 중간 설정은 57점에 0.41달러, 낮은 설정은 3.6 Flash와 같은 52점에 0.24달러입니다.
| 모델 | 입력(100만 토큰) | 출력(100만 토큰) |
|---|---|---|
| 제미나이 3.8 Flash, 12월 31일까지 | 0.75달러 | 3.75달러 |
| 제미나이 3.8 Flash, 2027년 1월 1일부터 | 1.50달러 | 7.50달러 |
| Claude Opus 5 | 5.00달러 | 25.00달러 |
| GPT-5.6 Sol | 4.00달러 | 20.00달러 |
| Claude Sonnet 5 | 2.00달러 | 10.00달러 |
| GPT-5.6 Terra | 2.00달러 | 12.00달러 |
도입 가격은 3.7 Flash와 똑같이 12월 31일에 끝나고, 2027년 1월 1일부터 입력 1.50달러, 출력 7.50달러가 붙습니다. 캐시에 저장된 입력 토큰의 90% 할인은 그대로입니다. 단가가 두 배가 되면 Artificial Analysis 기준 과제당 비용은 약 1.16달러로, 지금 57점을 0.53달러에 내는 GPT-5.6 Terra(max)의 두 배를 넘습니다.
같은 날 나온 경쟁 모델도 있습니다. 메타는 9월 2일 Muse Spark 1.3을 냈고, Artificial Analysis는 xhigh 설정이 61점을 과제당 0.55달러에 내 59점 이상 모델 가운데 가장 싸다고 평가했습니다. 이 기관은 같은 날 3.8 Flash 기사에는 같은 지능 수준에서 가장 싼 모델, Muse Spark 1.3 기사에는 59점 이상에서 가장 싼 모델이라고 적었습니다. 메타의 가격은 입력 1.25달러, 출력 4.25달러로 기한이 붙은 할인가가 아닙니다.
구글이 이 단가를 내는 배경에는 직접 설계한 칩이 있습니다. Epoch AI는 8월 13일 분석에서 구글 TPU v6e의 달러당 성능을 엔비디아 H100(2025년 가격 기준)의 6배 가까이로 계산했고, 피차이는 7월 실적 발표에서 8세대 TPU 8t와 8i의 가격 대비 성능을 내세웠습니다.
모델 카드는 3.8 Flash의 구조와 학습 데이터, 하드웨어, 소프트웨어 항목을 모두 3.7 Flash 모델 카드로 돌렸습니다. 3.7 Flash 모델 카드는 같은 항목을 3.6 Flash로 돌렸으니, 7월 21일 이후 세 모델이 같은 기반 위에서 나온 겁니다. 3.7 Flash가 사전학습 없이 점수를 올린 과정은 3.7 Flash 출시 글에서 다뤘습니다.
이번 발표문에는 지금까지 Flash 발표에 없던 문장이 들어갔습니다. 두 모델이 기반 모델을 재귀적으로 평가하고 다듬도록 설계된 장기 실행 에이전트 루프로 더 빨라졌고, 공통 기반의 코딩·추론 향상에는 사이버보안 분야의 혹독한 훈련을 비롯한 여러 혁신이 작용했다는 내용입니다. 에이전트가 모델을 돌려 보고 고치는 과정을 오래 되풀이했다는 설명이고, 루프의 구조나 사람이 개입하는 범위는 적혀 있지 않습니다.
월스트리트저널은 이 방식이 가능한 이유를 모델 크기에서 찾았습니다. Flash는 Pro보다 작아 고치는 데 드는 컴퓨트가 훨씬 적고, 여러 연구팀이 강화학습으로 각자 맡은 기능을 동시에 훈련해 합칠 수 있다는 설명입니다. Pro 계열은 큰 모델을 손보는 비용 때문에 내부 후보가 폐기되고 일정이 몇 달씩 밀렸다고 이 신문은 전했습니다. 카부쿠오글루도 발표 전날 3.6과 3.7에 들어간 것들은 1년 넘게 이어 온 병렬 연구를 합친 결과이고, 지금은 Flash를 개선 통로로 쓰고 있다고 말했습니다.
3.7 Flash 모델 카드의 안전성 평가는 이 모델이 개별 코딩 과제는 풀지만 사람 개입 없이 연구 과정 전체를 이어 가지는 못한다고 적었습니다. 세르게이 브린이 지난해 5월 3~4년 안에 제미나이가 스스로 제미나이를 만들 것이라고 말했을 때 그 말은 전망이었습니다. 이번에는 모델을 평가하고 다듬는 에이전트 루프가 회사 발표문에 개발 공정으로 적혔습니다. 모델을 감싼 실행 시스템만 바꿔 점수를 올리는 흐름은 하네스만 바꿔 SWE-bench를 20%에서 50%로 올린 사례에서도 다뤘습니다.
모델 카드의 프런티어 안전 평가는 3.8 Flash가 위험 능력 영역에서 3.7 Flash보다 의미 있는 새 능력을 보이지 않았다고 판단하고, 3.7 Flash의 평가 결과를 근거로 위험 기준에 닿지 않을 것이라고 적었습니다. 같은 날 발표문은 공통 기반의 코딩·추론 향상에 사이버보안 훈련이 작용했다고 적었습니다.


C/C++ 코드에서 취약점을 찾는 CyberGym에서 3.8 Flash Cyber는 86.2%로 오픈AI의 보안 특화 모델 GPT-5.5-Cyber(85.6%), 앤트로픽 Mythos 5(83.8%), GPT-5.6 Sol(83.6%)을 넘었습니다. 20개 프로그래밍 언어가 섞인 구글 내부 평가에서는 성공률 70%를 넘겼고, 패치 능력을 재는 외부 평가 CWE-Bench에서는 47.2%로 1위 프런티어 모델(47.8%)과 0.6%포인트 차이였습니다.
구글은 처음부터 취약점을 이용하는 능력보다 고치는 능력에 먼저 투자했다고 밝혔습니다. Chrome 보안팀은 이 모델이 훨씬 큰 최고 상용 모델보다 정확한 패치를 2.6배 많이 냈다고 했고, 보안 회사 Wiz는 내부 침투 테스트에서 재현율이 7.5~9.7% 높으면서 비용은 2.3~5.2배 낮았다고 했습니다. 구글 클라우드 취약점 연구팀은 보통 몇 달이 걸리는 치명적 취약점을 2시간 안에 찾았다고 적었습니다.
Fairwind 프로그램에는 전 세계 650곳이 넘는 파트너가 들어왔습니다. 정부와 국가 사이버 당국, 의료·통신·에너지·금융 같은 주요 기반시설 운영사, 널리 쓰이는 소프트웨어 플랫폼이 먼저 접근하고, 참여 기관은 사내 보안·침투 테스트 팀으로 접근을 제한하고 다중 인증을 걸기로 약속합니다.
구글 방법론 문서를 보면 다른 회사 점수는 따로 적지 않는 한 각 회사가 스스로 밝힌 숫자입니다. DeepSWE는 다른 모델 점수를 Datacurve 리더보드에서 가져왔고, 3.8 Flash는 구글이 mini-swe-agent 하네스로 직접 계산했습니다. 구글은 처음에 Opus 5 점수를 리더보드의 반올림 때문에 잘못 적었다고 문서에 덧붙였고, Datacurve가 직접 잰 값은 3.8 Flash 74%(±1%포인트), Opus 5 74%(±4%포인트)입니다.
영상 평가 LVBench는 제미나이와 GPT-5.6에 1,024프레임을, Claude에는 API 제한 때문에 300프레임을 넣었습니다. HLE-Verified에서는 Sonnet 5 질문의 상당수와 Opus 5 질문 일부가 콘텐츠 필터에 막혔고, OSWorld-2.0은 모든 모델의 하네스에 도구 일괄 호출을 넣고 부분 점수를 적었습니다. 3주 전 3.7 Flash 모델 카드에 47.9%로 적혔던 3.7 Flash의 OSWorld-2.0은 이번 표에서 50.6%입니다.
안전성 항목에는 후퇴도 적혔습니다. 모델 카드는 영어 외 언어의 안전성 평가가 3.7 Flash보다 5.4%포인트 나빠졌고, 문제없는 질문을 거절하는 비율도 1.1%포인트 늘었다고 밝혔습니다. 반대로 Artificial Analysis의 환각률(모른다고 답해야 할 질문에 틀린 답을 낸 비율)은 3.7 Flash의 64.5%에서 55.2%로 내려갔고, 간접 프롬프트 주입 공격 성공률도 낮아졌습니다.

피차이는 7월 22일 실적 발표에서 거의 매달 모델을 내는 주기를 목표로 한다고 말했습니다. 3.6에서 3.7까지 23일, 3.7에서 3.8까지 20일이 걸렸고, Artificial Analysis는 3.8 Flash를 4개월이 안 되는 사이 나온 네 번째 Flash로 기록했습니다. 같은 날 Muse Spark 1.3을 낸 메타도 5개월 사이 네 번째 Muse Spark를 내놓았습니다.
3.8 Flash가 들어간 서비스의 규모도 큽니다. 7월 실적 발표 기준 제미나이 앱의 월 사용자는 9억 5,000만 명, 검색 AI 모드는 10억 명을 넘고, 구글 모델 API는 분당 약 220억 토큰을 처리하며 매달 900만 명이 넘는 개발자가 씁니다. Antigravity의 주간 사용자는 240만 명이 넘고, 3.8 Flash는 이 가운데 개발자와 AI Pro·Ultra 구독자에게 먼저 열렸습니다.
코딩 도구 시장의 순서는 아직 다릅니다. 멘로벤처스가 지난해 12월 낸 기업 조사에서 코딩 분야 점유율은 앤트로픽 54%, 오픈AI 21%였고, 피차이도 7월 실적 발표에서 코딩과 에이전트 코딩을 개선이 필요한 영역으로 꼽았습니다.
한국 이용자에게 달라지는 것은 두 가지입니다. 구글 AI Pro 이상을 구독하면 제미나이 앱에서 3.8 Flash를 쓸 수 있고, API로 서비스를 만드는 개발사는 3.7 Flash를 그대로 쓰거나 3.8 Flash로 옮기는 두 길 모두 12월 31일까지 같은 단가를 냅니다. 한국어 서비스를 만드는 팀에는 모델 카드의 다국어 안전성 후퇴가 직접 걸리는 항목입니다.
저는 이번 모델을 얼리 액세스 테스터로 먼저 써 봤습니다. 3주 전 3.7 Flash와 같은 API에 같은 가격인데, 긴 코딩 과제를 멈추지 않고 끝까지 가는 횟수가 눈에 띄게 늘었습니다. 이 흐름이면 3.9를 건너뛰고 다음 이름이 Gemini 4가 될 가능성이 높다고 봅니다. 월스트리트저널 보도로는 Gemini 4가 사전학습 평가에서 좋은 결과를 낸 뒤 후속 학습에 들어갔고, 카부쿠오글루는 3.5 Pro도 병렬로 계속 작업하고 있다고 했습니다. Gemini 4 소식이 나오면 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림