# 3주 만에 또 나온 제미나이 3.8 Flash, Opus 5와 코딩 0.3점 차
_DeepSWE에서 73.7%로 Opus 5(74.0%)와 0.3%포인트 차이였고, 출력 단가는 12월 31일까지 100만 토큰당 3.75달러입니다. 대신 과제당 출력 토큰이 30% 늘어 과제당 비용은 3.7 Flash보다 약 40% 올랐습니다._
- 매체: 초이의 뉴스레터 · 소식
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-09-03T09:00
- 링크: https://choi-newsletter.com/post/news-gemini-38-flash-launch
- 답하는 질문: 제미나이 3.8 Flash 코딩 성능
- 직답: 제미나이 3.8 Flash는 DeepSWE v1.1 73.7%로 Opus 5(74.0%)와 0.3%포인트 차이였고, 출력 단가는 7분의 1 수준입니다.
- 출처: Google, Introducing Gemini 3.8 Flash and 3.8 Flash Cyber (9월 2일) (https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/), Google DeepMind, Gemini 3.8 Flash 모델 카드 (https://deepmind.google/models/model-cards/gemini-3-8-flash), Google DeepMind, Gemini 3.8 Flash 평가 방법론 (https://deepmind.google/models/evals-methodology/gemini-3-8-flash), Google DeepMind, Gemini 3.7 Flash 모델 카드 (https://deepmind.google/models/model-cards/gemini-3-7-flash), Google DeepMind X 발표 (https://x.com/GoogleDeepMind/status/2095175498967949359), Arena X, 3.8 Flash 순위 (https://x.com/arena/status/2095179977805517149), Artificial Analysis, Gemini 3.8 Flash (9월 2일) (https://artificialanalysis.ai/articles/gemini-3-8-flash), Artificial Analysis, Muse Spark 1.3 (9월 2일) (https://artificialanalysis.ai/articles/muse-spark-1-3), Artificial Analysis, Gemini 3.8 Flash 모델 페이지 (https://artificialanalysis.ai/models/gemini-3-8-flash), Datacurve, DeepSWE 리더보드 (https://deepswe.datacurve.ai/), Google, Fairwind Program (https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/), Google for Developers, 카부쿠오글루 대담 (9월 1일) (https://www.youtube.com/watch?v=Rrr2gdbvNFU), Google, 2026년 2분기 실적 발표 CEO 발언 (https://blog.google/company-news/inside-google/message-ceo/alphabet-earnings-q2-2026/), Epoch AI, AI 칩 달러당 성능 (8월 13일) (https://epoch.ai/data-insights/chip-performance-per-dollar), SemiAnalysis, Gemini is Cooked but GCP is Cooking (8월 7일) (https://newsletter.semianalysis.com/p/gemini-is-cooked-but-gcp-is-cooking), 구글코리아 블로그, 제미나이 3.8 플래시 소개 (https://blog.google/intl/ko-kr/company-news/technology/3-8-flash-and-3-8-flash-cyber-kr/)
> 구글이 9월 2일 제미나이 3.8 Flash와 보안용 3.8 Flash Cyber를 공개했습니다. 6주 만의 세 번째 Flash이고, 모델 카드는 구조와 학습 데이터를 3.7 Flash와 같다고 적었습니다. 같은 날 메타 Muse Spark 1.3은 더 높은 지수를 더 싸게 냈습니다.

구글이 9월 2일(미국 시각) 제미나이 3.8 Flash와 보안 특화판 3.8 Flash Cyber를 공개했습니다. 3.7 Flash가 나온 지 3주, 3.6 Flash가 나온 지 6주 만에 나온 세 번째 Flash입니다. 장기 코딩 평가 DeepSWE v1.1에서 73.7%를 받아 Claude Opus 5(74.0%)와 0.3%포인트 차이였고, 출력 단가는 100만 토큰당 3.75달러(12월 31일까지)로 Opus 5(25달러)의 7분의 1 수준입니다.

구글 딥마인드는 3.8 Flash를 「지금까지 가장 똑똑한 모델」이라고 소개했고, 발표문은 같은 기반 지능에서 일반판과 보안판 두 가지를 나눴다고 적었습니다. 일반판은 3.7 Flash와 같은 도입 가격(입력 0.75달러, 출력 3.75달러)으로 Gemini API와 AI Studio, Android Studio, 에이전트 개발 도구 Antigravity, UI 생성 도구 Stitch, Gemini Enterprise에 들어갔습니다. 구글 AI Pro·Ultra 구독자는 제미나이 앱과 검색 AI 모드, 구글 시트에서 쓸 수 있고, 3.8 Flash Cyber는 새로 만든 Fairwind 프로그램을 거쳐 검증된 방어 기관에만 열립니다.

발표 4주 전인 8월 7일, 반도체·AI 분석 회사 SemiAnalysis는 「Gemini is Cooked(제미나이는 끝났다)」라는 글에서 구글 모델이 세는 방식에 따라 8~9위라고 적었습니다. 발표 전날 카부쿠오글루 딥마인드 수석부사장(SVP)은 지금 모델 품질이 프런티어보다 조금 아래라고 말했습니다. 같은 날 월스트리트저널은 구글 내부 코딩 도구 Jetski에서 3.8 Flash와 Opus를 나란히 써 본 일부 엔지니어가 3.8 Flash를 더 선호했다고 보도했습니다.

## 14개 항목 중 8개에서 1위, Opus 5는 5개에서 앞섰다

모델 카드 표에는 3.7 Flash와 Opus 5, Sonnet 5, GPT-5.6 Sol, GPT-5.6 Terra가 함께 실렸습니다. 3주 전 3.7 Flash 표에는 없던 앤트로픽과 오픈AI의 최상위 모델 Opus 5와 Sol이 이번에 들어갔습니다. 14개 항목 가운데 3.8 Flash가 가장 높은 항목은 8개였고, Opus 5가 5개, Sol이 1개에서 앞섰습니다.

| 평가 | 3.8 Flash | 3.7 Flash | Opus 5 | GPT-5.6 Sol |
| --- | --- | --- | --- | --- |
| DeepSWE v1.1 (장기 코딩) | 73.7% | 65.3% | 74.0% | 72.7% |
| Terminal-bench 2.1 (터미널 코딩) | 89.4% | 85.8% | 89.1% | 88.8% |
| Terminal-bench 4.0 (범용 에이전트) | 19.1% | 11.2% | 51.8% | 37.3% |
| OSWorld-2.0 (컴퓨터 사용) | 59.0% | 50.6% | 75.4% | 62.6% |
| GDPVal-AA v2 (지식 노동, Elo) | 1545 | 1482 | 1824 | 1710 |
| Vals Finance Agent v2 (금융 분석) | 61.4% | 59.0% | 58.6% | 53.8% |
| Harvey Legal Agent (법률 업무) | 10.0% | 8.8% | 6.7% | 2.5% |
| HLE-Verified (전문가 추론) | 54.9% | 53.6% | 54.4% | 54.5% |
| CharXiv (차트 읽기, 도구 없이) | 86.2% | 84.5% | 83.7% | 85.8% |
| LVBench (긴 영상 이해) | 87.8% | 85.4% | 75.4% | 82.1% |
| 출력 단가(100만 토큰) | 3.75달러 | 3.75달러 | 25달러 | 20달러 |

금융 분석 Vals Finance Agent v2(61.4%)와 법률 업무 Harvey Legal Agent Benchmark(10.0%)에서 1위였고, 차트 읽기 CharXiv(86.2%)와 긴 영상 이해 LVBench(87.8%)도 가장 높았습니다. 범용 에이전트 능력을 재는 Terminal-bench 4.0에서는 19.1%로 Opus 5(51.8%)보다 32.7%포인트 낮았고, 컴퓨터 사용 OSWorld-2.0(59.0% 대 75.4%)과 지식 노동 GDPVal-AA v2(1545점 대 1824점)에서도 차이가 컸습니다. 터미널 코딩을 재는 Terminal-bench 2.1에서는 89.4%로 Opus 5(89.1%)를 앞섰습니다.

사람이 두 답을 보고 더 나은 쪽을 고르는 아레나에서도 모습이 비슷했습니다. Text Arena에서 3.8 Flash는 1494점으로 7위에 올라 Opus 5(1492점, 8위)를 앞섰고, 코딩 부문 순위는 3.7 Flash의 22위에서 7위로 올랐습니다. 에이전트 작업을 겨루는 Agent Arena에서는 3.7 Flash(32위)보다 크게 오른 14위였고, 웹 개발 Code Arena에서는 1567점으로 18위였습니다.

## 과제당 비용은 Opus 5의 5분의 1, 걸음 수는 1.7배

![DeepSWE v1.1 점수와 과제당 평균 비용을 모델별로 그린 산점도. 제미나이 3.5, 3.6, 3.7, 3.8 Flash가 2달러대에서 점수를 올려 Claude Opus 5와 같은 높이에 이른 모습](https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini-3-8-flash__evals__deepswe-plot__light.original.png)

DeepSWE는 데이터 회사 Datacurve가 운영하는 평가로, 실제 저장소에서 여러 파일을 고쳐야 끝나는 소프트웨어 과제를 에이전트가 혼자 풀게 합니다. 구글 차트에서 Flash 계열은 5월 3.5 Flash의 30%대 중반에서 3.6과 3.7을 거쳐 3.8 Flash의 73.7%까지 올라왔고, 과제당 비용은 2달러 안팎에 머물렀습니다.

Artificial Analysis의 측정에서는 점수와 함께 비용도 올랐습니다. 높은 설정의 3.8 Flash는 종합 지능 지수 59점으로 3.7 Flash보다 3점 올라 GPT-5.6 Sol(xhigh), Grok 4.6(medium)과 같아졌고, 과제 하나에 0.58달러가 들었습니다. 토큰 단가가 그대로인데도 3.7 Flash(0.40달러)보다 약 40% 비싸진 것은, 과제당 평균 출력 토큰이 4만 8,000개로 30% 늘고 에이전트 평가에서 주고받는 횟수도 늘었기 때문이라고 이 기관은 설명했습니다. 과제 하나에 걸리는 시간도 2.2분에서 2.5분으로 길어졌습니다.

발표문도 이 점을 숨기지 않았습니다. 3.8 Flash는 더 끈기 있게 일하도록 설계돼 추론 단계를 더 밟고 도구를 반복해 부르며, 높은 설정에서는 토큰을 더 쓸 수 있다고 적었습니다. 효율이 먼저인 작업에는 설정을 낮추거나 계속 지원하는 3.7 Flash를 쓰라고 덧붙였고, Artificial Analysis 기준으로 중간 설정은 57점에 0.41달러, 낮은 설정은 3.6 Flash와 같은 52점에 0.24달러입니다.

## 할인은 그대로, 12월 31일 기한도 그대로다

| 모델 | 입력(100만 토큰) | 출력(100만 토큰) |
| --- | --- | --- |
| 제미나이 3.8 Flash, 12월 31일까지 | 0.75달러 | 3.75달러 |
| 제미나이 3.8 Flash, 2027년 1월 1일부터 | 1.50달러 | 7.50달러 |
| Claude Opus 5 | 5.00달러 | 25.00달러 |
| GPT-5.6 Sol | 4.00달러 | 20.00달러 |
| Claude Sonnet 5 | 2.00달러 | 10.00달러 |
| GPT-5.6 Terra | 2.00달러 | 12.00달러 |

도입 가격은 3.7 Flash와 똑같이 12월 31일에 끝나고, 2027년 1월 1일부터 입력 1.50달러, 출력 7.50달러가 붙습니다. 캐시에 저장된 입력 토큰의 90% 할인은 그대로입니다. 단가가 두 배가 되면 Artificial Analysis 기준 과제당 비용은 약 1.16달러로, 지금 57점을 0.53달러에 내는 GPT-5.6 Terra(max)의 두 배를 넘습니다.

같은 날 나온 경쟁 모델도 있습니다. 메타는 9월 2일 Muse Spark 1.3을 냈고, Artificial Analysis는 xhigh 설정이 61점을 과제당 0.55달러에 내 59점 이상 모델 가운데 가장 싸다고 평가했습니다. 이 기관은 같은 날 3.8 Flash 기사에는 같은 지능 수준에서 가장 싼 모델, Muse Spark 1.3 기사에는 59점 이상에서 가장 싼 모델이라고 적었습니다. 메타의 가격은 입력 1.25달러, 출력 4.25달러로 기한이 붙은 할인가가 아닙니다.

구글이 이 단가를 내는 배경에는 직접 설계한 칩이 있습니다. Epoch AI는 8월 13일 분석에서 구글 TPU v6e의 달러당 성능을 엔비디아 H100(2025년 가격 기준)의 6배 가까이로 계산했고, 피차이는 7월 실적 발표에서 8세대 TPU 8t와 8i의 가격 대비 성능을 내세웠습니다.

## 3주 동안 기반 모델은 그대로였다

모델 카드는 3.8 Flash의 구조와 학습 데이터, 하드웨어, 소프트웨어 항목을 모두 3.7 Flash 모델 카드로 돌렸습니다. 3.7 Flash 모델 카드는 같은 항목을 3.6 Flash로 돌렸으니, 7월 21일 이후 세 모델이 같은 기반 위에서 나온 겁니다. 3.7 Flash가 사전학습 없이 점수를 올린 과정은 [3.7 Flash 출시 글](/post/news-gemini-37-flash-launch)에서 다뤘습니다.

이번 발표문에는 지금까지 Flash 발표에 없던 문장이 들어갔습니다. 두 모델이 기반 모델을 재귀적으로 평가하고 다듬도록 설계된 장기 실행 에이전트 루프로 더 빨라졌고, 공통 기반의 코딩·추론 향상에는 사이버보안 분야의 혹독한 훈련을 비롯한 여러 혁신이 작용했다는 내용입니다. 에이전트가 모델을 돌려 보고 고치는 과정을 오래 되풀이했다는 설명이고, 루프의 구조나 사람이 개입하는 범위는 적혀 있지 않습니다.

월스트리트저널은 이 방식이 가능한 이유를 모델 크기에서 찾았습니다. Flash는 Pro보다 작아 고치는 데 드는 컴퓨트가 훨씬 적고, 여러 연구팀이 강화학습으로 각자 맡은 기능을 동시에 훈련해 합칠 수 있다는 설명입니다. Pro 계열은 큰 모델을 손보는 비용 때문에 내부 후보가 폐기되고 일정이 몇 달씩 밀렸다고 이 신문은 전했습니다. 카부쿠오글루도 발표 전날 3.6과 3.7에 들어간 것들은 1년 넘게 이어 온 병렬 연구를 합친 결과이고, 지금은 Flash를 개선 통로로 쓰고 있다고 말했습니다.

구글 개발자 채널이 9월 1일 올린 카부쿠오글루와 로건 킬패트릭의 대담(26분 46초). 3.7 Flash, Gemini 4 사전학습, 병렬 모델 개발을 다룹니다.

3.7 Flash 모델 카드의 안전성 평가는 이 모델이 개별 코딩 과제는 풀지만 사람 개입 없이 연구 과정 전체를 이어 가지는 못한다고 적었습니다. 세르게이 브린이 지난해 5월 3~4년 안에 제미나이가 스스로 제미나이를 만들 것이라고 말했을 때 그 말은 전망이었습니다. 이번에는 모델을 평가하고 다듬는 에이전트 루프가 회사 발표문에 개발 공정으로 적혔습니다. 모델을 감싼 실행 시스템만 바꿔 점수를 올리는 흐름은 [하네스만 바꿔 SWE-bench를 20%에서 50%로 올린 사례](/post/review-lilian-weng-harness-self-improvement)에서도 다뤘습니다.

모델 카드의 프런티어 안전 평가는 3.8 Flash가 위험 능력 영역에서 3.7 Flash보다 의미 있는 새 능력을 보이지 않았다고 판단하고, 3.7 Flash의 평가 결과를 근거로 위험 기준에 닿지 않을 것이라고 적었습니다. 같은 날 발표문은 공통 기반의 코딩·추론 향상에 사이버보안 훈련이 작용했다고 적었습니다.

구글이 Antigravity의 Teamwork로 Flash급 모델 여럿을 묶어 며칠씩 돌리며 수학 난제 일곱 개를 푼 과정을 정리했습니다.

## 3.8 Flash Cyber는 고치는 능력에 맞췄다

![CyberGym Pass@1 막대그래프. 제미나이 3.8 Flash Cyber 86.2%, 3.5 Flash Cyber 77.5%, GPT-5.6 Sol 83.6%, Mythos 5 83.8%, GPT-5.5-Cyber 85.6%](https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini-3.8-cyber__evals__cybergym_light.original.png)

C/C++ 코드에서 취약점을 찾는 CyberGym에서 3.8 Flash Cyber는 86.2%로 오픈AI의 보안 특화 모델 GPT-5.5-Cyber(85.6%), 앤트로픽 Mythos 5(83.8%), GPT-5.6 Sol(83.6%)을 넘었습니다. 20개 프로그래밍 언어가 섞인 구글 내부 평가에서는 성공률 70%를 넘겼고, 패치 능력을 재는 외부 평가 CWE-Bench에서는 47.2%로 1위 프런티어 모델(47.8%)과 0.6%포인트 차이였습니다.

구글은 처음부터 취약점을 이용하는 능력보다 고치는 능력에 먼저 투자했다고 밝혔습니다. Chrome 보안팀은 이 모델이 훨씬 큰 최고 상용 모델보다 정확한 패치를 2.6배 많이 냈다고 했고, 보안 회사 Wiz는 내부 침투 테스트에서 재현율이 7.5~9.7% 높으면서 비용은 2.3~5.2배 낮았다고 했습니다. 구글 클라우드 취약점 연구팀은 보통 몇 달이 걸리는 치명적 취약점을 2시간 안에 찾았다고 적었습니다.

Fairwind 프로그램에는 전 세계 650곳이 넘는 파트너가 들어왔습니다. 정부와 국가 사이버 당국, 의료·통신·에너지·금융 같은 주요 기반시설 운영사, 널리 쓰이는 소프트웨어 플랫폼이 먼저 접근하고, 참여 기관은 사내 보안·침투 테스트 팀으로 접근을 제한하고 다중 인증을 걸기로 약속합니다.

## 표를 읽을 때 붙는 조건

구글 방법론 문서를 보면 다른 회사 점수는 따로 적지 않는 한 각 회사가 스스로 밝힌 숫자입니다. DeepSWE는 다른 모델 점수를 Datacurve 리더보드에서 가져왔고, 3.8 Flash는 구글이 mini-swe-agent 하네스로 직접 계산했습니다. 구글은 처음에 Opus 5 점수를 리더보드의 반올림 때문에 잘못 적었다고 문서에 덧붙였고, Datacurve가 직접 잰 값은 3.8 Flash 74%(±1%포인트), Opus 5 74%(±4%포인트)입니다.

영상 평가 LVBench는 제미나이와 GPT-5.6에 1,024프레임을, Claude에는 API 제한 때문에 300프레임을 넣었습니다. HLE-Verified에서는 Sonnet 5 질문의 상당수와 Opus 5 질문 일부가 콘텐츠 필터에 막혔고, OSWorld-2.0은 모든 모델의 하네스에 도구 일괄 호출을 넣고 부분 점수를 적었습니다. 3주 전 3.7 Flash 모델 카드에 47.9%로 적혔던 3.7 Flash의 OSWorld-2.0은 이번 표에서 50.6%입니다.

안전성 항목에는 후퇴도 적혔습니다. 모델 카드는 영어 외 언어의 안전성 평가가 3.7 Flash보다 5.4%포인트 나빠졌고, 문제없는 질문을 거절하는 비율도 1.1%포인트 늘었다고 밝혔습니다. 반대로 Artificial Analysis의 환각률(모른다고 답해야 할 질문에 틀린 답을 낸 비율)은 3.7 Flash의 64.5%에서 55.2%로 내려갔고, 간접 프롬프트 주입 공격 성공률도 낮아졌습니다.

![Gray Swan 간접 프롬프트 주입 평가 막대그래프. 15회 시도 공격 성공률이 제미나이 3.7 Flash 9.2%, 3.8 Flash 5.5%, Claude Opus 5 4.8%](https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini-3.8-flash_evals_attack__light.original.png)

## 한 달 주기의 Flash가 들어가는 곳

피차이는 7월 22일 실적 발표에서 거의 매달 모델을 내는 주기를 목표로 한다고 말했습니다. 3.6에서 3.7까지 23일, 3.7에서 3.8까지 20일이 걸렸고, Artificial Analysis는 3.8 Flash를 4개월이 안 되는 사이 나온 네 번째 Flash로 기록했습니다. 같은 날 Muse Spark 1.3을 낸 메타도 5개월 사이 네 번째 Muse Spark를 내놓았습니다.

3.8 Flash가 들어간 서비스의 규모도 큽니다. 7월 실적 발표 기준 제미나이 앱의 월 사용자는 9억 5,000만 명, 검색 AI 모드는 10억 명을 넘고, 구글 모델 API는 분당 약 220억 토큰을 처리하며 매달 900만 명이 넘는 개발자가 씁니다. Antigravity의 주간 사용자는 240만 명이 넘고, 3.8 Flash는 이 가운데 개발자와 AI Pro·Ultra 구독자에게 먼저 열렸습니다.

코딩 도구 시장의 순서는 아직 다릅니다. 멘로벤처스가 지난해 12월 낸 기업 조사에서 코딩 분야 점유율은 앤트로픽 54%, 오픈AI 21%였고, 피차이도 7월 실적 발표에서 코딩과 에이전트 코딩을 개선이 필요한 영역으로 꼽았습니다.

한국 이용자에게 달라지는 것은 두 가지입니다. 구글 AI Pro 이상을 구독하면 제미나이 앱에서 3.8 Flash를 쓸 수 있고, API로 서비스를 만드는 개발사는 3.7 Flash를 그대로 쓰거나 3.8 Flash로 옮기는 두 길 모두 12월 31일까지 같은 단가를 냅니다. 한국어 서비스를 만드는 팀에는 모델 카드의 다국어 안전성 후퇴가 직접 걸리는 항목입니다.

저는 이번 모델을 얼리 액세스 테스터로 먼저 써 봤습니다. 3주 전 3.7 Flash와 같은 API에 같은 가격인데, 긴 코딩 과제를 멈추지 않고 끝까지 가는 횟수가 눈에 띄게 늘었습니다. 이 흐름이면 3.9를 건너뛰고 다음 이름이 Gemini 4가 될 가능성이 높다고 봅니다. 월스트리트저널 보도로는 Gemini 4가 사전학습 평가에서 좋은 결과를 낸 뒤 후속 학습에 들어갔고, 카부쿠오글루는 3.5 Pro도 병렬로 계속 작업하고 있다고 했습니다. Gemini 4 소식이 나오면 다시 전하겠습니다.

읽어 주셔서 고맙습니다.

초이 드림
