# Pro는 감감무소식, 구글이 3주 만에 반값 제미나이 3.7 Flash 공개
_사전학습을 다시 돌리지 않고 DeepSWE 점수를 49.0%에서 65.3%로 올렸고, 토큰 단가는 12월 31일까지 3.6 Flash의 절반입니다. 5월 I/O에서 다음 달에 나온다던 3.5 Pro는 아직 나오지 않았습니다._
- 매체: 초이의 뉴스레터 · 소식
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-08-14T10:00
- 링크: https://choi-newsletter.com/post/news-gemini-37-flash-launch
- 답하는 질문: 제미나이 3.7 Flash 가격과 성능
- 직답: 제미나이 3.7 Flash는 연말까지 3.6 Flash의 절반 가격이고, 구조와 학습 데이터가 같은데도 DeepSWE가 49.0%에서 65.3%로 올랐습니다.
- 출처: Google, Introducing Gemini 3.7 Flash (8월 13일) (https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/), Google DeepMind, Gemini 3.7 Flash 모델 카드 (https://deepmind.google/models/model-cards/gemini-3-7-flash), 코라이 카부쿠오글루 X 발표 (https://x.com/koraykv/status/2087948169552490845), 순다르 피차이 X (https://x.com/sundarpichai/status/2087948583890985263), Artificial Analysis X, 3.7 Flash 측정 (https://x.com/ArtificialAnlys/status/2087975627391717461), Artificial Analysis, Gemini 3.7 Flash 모델 페이지 (https://artificialanalysis.ai/models/gemini-3-7-flash), OpenRouter X, 추가 할인 (https://x.com/OpenRouter/status/2087952866409656733), Epoch AI, AI 칩 달러당 성능 (8월 13일) (https://epoch.ai/data-insights/chip-performance-per-dollar), Google, 피차이·하사비스 메시지 (8월 5일) (https://blog.google/company-news/inside-google/message-ceo/next-chapter-ai-momentum/), Google, 2026년 2분기 실적 발표 CEO 발언 (https://blog.google/company-news/inside-google/message-ceo/alphabet-earnings-q2-2026/), Google, 2026년 1분기 실적 발표 CEO 발언 (https://blog.google/company-news/inside-google/message-ceo/alphabet-earnings-q1-2026/), Google, I/O 2026 피차이 기조연설 (https://blog.google/innovation-and-ai/sundar-pichai-io-2026/), Google, Gemini 3.6 Flash 발표 (7월 21일) (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/), SemiAnalysis, Gemini is Cooked but GCP is Cooking (8월 7일) (https://newsletter.semianalysis.com/p/gemini-is-cooked-but-gcp-is-cooking), 로건 킬패트릭 X 반박 (https://x.com/OfficialLoganK/status/2085726028480270374), Z.ai, GLM-5.3 (https://z.ai/blog/glm-5.3), SpaceXAI, Introducing Grok 4.6 (https://x.ai/news/grok-4-6), 구글코리아 블로그, 제미나이 스파크 국내 출시 (7월 29일) (https://blog.google/intl/ko-kr/products/gemini-spark-kr/), Google Gemini X, 앱 적용 (8월 14일) (https://x.com/GeminiApp/status/2088326407730692538)
> 구글이 8월 13일 제미나이 3.7 Flash를 공개했습니다. 3.6 Flash 이후 3주 만이고 모델 카드는 구조와 학습 데이터가 3.6 Flash와 같다고 적었습니다. 입력 0.75달러·출력 3.75달러는 연말까지의 도입 가격이고 내년부터 두 배가 됩니다.

구글이 8월 13일(미국 시각) 제미나이 3.7 Flash를 공개했습니다. 7월 21일 3.6 Flash를 내놓은 지 3주 만이고, 모델 카드에는 구조와 학습 데이터, 학습에 쓴 하드웨어가 모두 3.6 Flash와 같다고 적혀 있습니다. 그런데도 장기 코딩 평가 DeepSWE 점수는 49.0%에서 65.3%로 올랐고, 토큰 단가는 12월 31일까지 3.6 Flash의 절반입니다.

이 게시물은 8일 전 구글 딥마인드를 새로 맡은 코라이 카부쿠오글루 수석부사장(SVP)이 올렸습니다. 5월 3.5 Flash부터 3개월 동안 Flash를 세 번 내면서 DeepSWE는 37.0%에서 65.3%로, 사람이 두 결과물을 보고 더 나은 쪽을 고르는 웹 개발 평가 Code Arena는 1506점에서 1588점으로, 기업 업무 자동화 평가 AutomationBench는 13.4%에서 30.4%로 올랐다는 내용입니다. 함께 올린 표에는 3.6 Flash와 앤트로픽 Claude Sonnet 5, 오픈AI GPT-5.6 Terra, 메타 Muse Spark 1.2가 나란히 실렸습니다.

3.7 Flash는 발표 당일부터 Gemini API와 AI Studio, Android Studio, 에이전트 개발 도구 Antigravity, 기업용 Gemini Enterprise에서 쓸 수 있습니다. 구글 AI Pro·Ultra 구독자가 쓰는 24시간 개인 에이전트 Spark도 이날부터 3.7 Flash로 돌아가고, 다음 날에는 제미나이 앱 대화창에도 들어갔습니다. 순다르 피차이 CEO는 같은 날 X에 Flash를 서둘러 내는 이유를 이렇게 적었습니다.

> Flash 모델은 좋은 가격에 성능을 내는 일꾼입니다. 그래서 개발자 손에 빨리 쥐여 주려고 업데이트를 서둘러 내고 있습니다.
> — 순다르 피차이, 구글·알파벳 CEO

## 3주 동안 무엇을 고쳤나

사전학습(pretraining)은 방대한 글과 코드를 읽혀 모델의 기본 지식과 언어 능력을 만드는 단계입니다. 대규모 칩을 몇 달씩 돌려야 해서 새 기반 모델은 보통 몇 달 간격으로 나옵니다. 3.7 Flash 모델 카드는 구조, 학습 데이터, 데이터 처리, 하드웨어, 소프트웨어 항목마다 3.6 Flash를 기반으로 한다고만 적고 3.6 Flash 모델 카드를 보라고 안내했습니다. 모델 카드대로라면 3주 동안 이 단계는 다시 돌리지 않았습니다.

모델 카드가 새로 적은 변화는 두 가지입니다. 추론(모델이 답을 만들며 생각하는 과정)의 기반에 알고리즘 개선을 더했고, 에이전트형 영상 이해를 지원합니다. 발표문은 그 결과를 행동으로 설명했습니다. 막히면 다른 길을 찾고, 의도가 애매하면 되묻고, 여러 단계를 계획하고 도구를 부르는 데 더 공을 들여서 사람이 다시 지시하거나 재시도하는 횟수가 줄었다는 내용입니다. 구글 AI Studio와 Gemini API를 이끄는 로건 킬패트릭도 3주 만에 지능이 크게 오른 이유를 「멋진 알고리즘 개선」이라고만 적었고, 무엇을 바꿨는지는 밝히지 않았습니다.

카부쿠오글루는 두 번째 게시물에 에이전트 3개로 팀을 짜 로봇 제어 모델을 처음부터 스스로 학습시키는 1분 남짓한 시연을 붙였습니다. 발표문은 같은 시연을 두고 에이전트 3개가 고리처럼 결과를 주고받으며 이미지와 영상을 함께 읽어 로봇 학습을 앞당긴다고 설명했습니다.

구글이 모델 카드에 실은 점수에서 3.6 Flash와 3.7 Flash를 간추리면 아래와 같습니다. 코딩과 에이전트 항목이 크게 올랐고, 차트 읽기를 재는 CharXiv(도구 없이)는 85.2%에서 84.5%로 조금 내려갔습니다.

| 평가 | 3.6 Flash | 3.7 Flash |
| --- | --- | --- |
| DeepSWE v1.1 (장기 코딩) | 48.6% | 65.3% |
| FrontierCode 1.1 Main (실무 코드 품질) | 34.4% | 43.6% |
| Terminal-bench 3.0 (범용 에이전트) | 5.4% | 14.9% |
| AutomationBench (기업 업무 자동화) | 17.0% | 30.4% |
| OSWorld-2.0 (컴퓨터 사용) | 33.8% | 47.9% |
| GDP.pdf (전문 PDF 이해) | 22.0% | 34.0% |
| GDPVal-AA v2 (지식 노동, Elo) | 1422 | 1525 |
| Code Arena (웹 개발, Elo) | 1538 | 1588 |
| CharXiv Reasoning (차트 읽기, 도구 없이) | 85.2% | 84.5% |

숫자 몇 개는 자료마다 다르게 적혔습니다. 3.6 Flash의 DeepSWE는 발표문 본문에 49.0%, 모델 카드 표에 48.6%로 나오고, 3.7 Flash의 OSWorld-2.0은 카부쿠오글루가 X에 올린 표에서 38.1%, 모델 카드에서 47.9%입니다. 위 표는 모델 카드를 따랐습니다.

구글 개발자 채널의 3.7 Flash 소개 영상(2분 32초). Antigravity에서 프롬프트 하나로 계획을 세우고 90년대풍 스프라이트 게임을 만듭니다.

3주 전 3.6 Flash는 코딩 평가에서 경쟁사보다 낮고 컴퓨터 사용과 긴 문서 평가에서 가장 높았습니다. 그때의 비교표를 정리했습니다.

## 같은 주에 나온 모델도 기반은 그대로였다

기반 모델을 그대로 두고 점수를 올린 곳은 구글만이 아닙니다. 하루 전인 8월 12일 SpaceXAI(옛 xAI)는 Grok 4.5를 바탕으로 보충 학습을 4.5 때보다 길게 돌리고 지도 미세조정과 강화학습을 다시 한 Grok 4.6을 냈습니다. 다음 날인 8월 14일에는 Z.ai가 GLM-5.2와 같은 기반 모델에 후속 학습만 더한 GLM-5.3을 공개하면서, 달라진 점은 모두 후속 학습에서 나왔다고 밝혔습니다. 회사가 잰 DeepSWE 점수는 46.2에서 66.9로 올랐습니다.

후속 학습(post-training)은 이미 만든 모델에 풀이 예시를 보여 주고, 잘한 행동에 보상을 주는 강화학습으로 쓰임새에 맞게 다듬는 단계입니다. 사전학습보다 칩과 시간이 훨씬 적게 들어 몇 주 단위로 되풀이할 수 있습니다. 구글은 3.7 Flash에서 무엇을 고쳤는지 알고리즘 개선이라고만 밝혔지만, 세 회사 모두 한 주 사이에 기반 모델을 새로 만들지 않은 채 새 버전을 냈습니다.

## 반값은 12월 31일까지다

3.7 Flash의 가격은 100만 토큰당 입력 0.75달러, 출력 3.75달러입니다. 발표문 각주에는 이 가격이 도입 가격이고 12월 31일에 끝난다고 적혀 있습니다. 2027년 1월 1일부터는 입력 1.50달러, 출력 7.50달러로 3.6 Flash가 7월에 나올 때 붙은 가격과 같아지고, 모델 카드 표 각주를 보면 같은 도입 가격이 3.6 Flash에도 붙었습니다.

| 모델 | 입력(100만 토큰) | 출력(100만 토큰) |
| --- | --- | --- |
| 제미나이 3.7 Flash, 12월 31일까지 | 0.75달러 | 3.75달러 |
| 제미나이 3.7 Flash, 2027년 1월 1일부터 | 1.50달러 | 7.50달러 |
| Claude Sonnet 5 | 2.00달러 | 10.00달러 |
| GPT-5.6 Terra | 2.00달러 | 12.00달러 |
| Muse Spark 1.2 | 1.25달러 | 4.25달러 |

AI 모델 중개 서비스 OpenRouter는 발표 당일부터 8월 27일까지 여기서 50%를 더 깎아, 입력 0.375달러와 출력 1.875달러로 정가의 4분의 1에 팔았습니다. 정가로 돌아간 뒤에도 3.7 Flash는 Sonnet 5나 Terra보다 토큰당 싸지만, Muse Spark 1.2보다는 입력과 출력 모두 비쌉니다.

구글이 이 가격을 낼 수 있는 배경에는 직접 설계한 칩 TPU가 있습니다. 같은 날 Epoch AI가 낸 분석에서 구글 TPU v6e의 달러당 성능은 엔비디아 H100(2025년 가격 기준)의 6배 가까이로 계산됐습니다. Epoch는 구글과 아마존 칩은 제조 협력사에서 들여오는 원가로, 엔비디아 칩은 설계사 마진이 붙은 판매가로 값을 매겼습니다. 엔비디아 GPU를 사서 모델을 돌리는 회사가 같은 토큰 가격을 내면 그 마진만큼 이익이 줄어듭니다.

## 과제 하나에 드는 돈은 30%만 줄었다

독립 평가 기관 Artificial Analysis는 발표 전에 3.7 Flash를 미리 받아 추론 설정 세 가지로 쟀습니다. 높은 설정의 종합 지능 지수는 56점으로 3.6 Flash보다 4점 올랐고, 출력 속도는 초당 약 340토큰으로 GPT-5.6 Terra의 3배 가까이 됩니다. 과제 하나를 끝내는 데 평균 1.7분이 걸려 Terra 최고 설정보다 40% 빨랐고, 과제 하나에 드는 돈은 0.40달러로 3.6 Flash보다 30% 적었습니다.

단가가 절반인데 비용은 30%만 줄었다면, 과제 하나를 푸는 데 쓰는 토큰은 약 1.4배로 늘었다는 계산이 나옵니다(0.5×1.4=0.7). 발표문도 3.7 Flash가 더 성실하게 생각하고 여러 단계 계획과 도구 호출에 더 많은 노력을 들인다고 적었습니다. 3주 전 3.6 Flash는 거꾸로 3.5 Flash보다 출력 토큰을 17% 덜 쓴다는 점을 내세웠습니다.

이 계산은 할인이 끝나면 뒤집힙니다. 1월 1일 단가가 두 배로 돌아가면 같은 과제에 드는 돈은 약 0.80달러가 되고, 정가 기준 3.6 Flash(약 0.57달러)보다 40%쯤 더 듭니다. Artificial Analysis가 할인가 기준으로 같은 비용이라고 적은 Muse Spark 1.2(0.40달러)의 두 배이기도 합니다. 지금 가격표가 그대로 간다면 3.7 Flash가 싸다는 계산은 12월 31일까지만 맞습니다.

## 비교표에서 빠진 최상위 모델

구글 표에 오른 경쟁 모델은 Claude Sonnet 5와 GPT-5.6 Terra, Muse Spark 1.2로 각 회사의 중간 가격대 모델입니다. 앤트로픽의 [Claude Opus 5](/post/news-opus5-launch-half-price)와 Fable 5, 오픈AI의 GPT-5.6 Sol 같은 최상위 모델은 빠졌습니다. 같은 표 안에서도 Terra는 DeepSWE(69.6%)와 Terminal-bench 2.1(87.4%), OSWorld-2.0(50.2%)에서 3.7 Flash를 앞섰고, 지식 노동 평가 GDPVal-AA v2에서는 Muse Spark 1.2가 1628점으로 가장 높았습니다.

![DeepSWE v1.1 막대그래프. 제미나이 3.7 Flash 65.3%, 3.6 Flash 48.6%, Claude Sonnet 5 53.8%, GPT-5.6 Terra 69.6%, Muse Spark 1.2 54.9%](https://pbs.twimg.com/media/HPnh8NaaAAEYShy.png)

![Artificial Analysis 지능 지수 막대그래프와 과제당 시간 대비 지수 산점도. Claude Opus 5 63점, Fable 5 62점, GPT-5.6 Sol과 Grok 4.6 61점, Kimi K3 60점, Qwen3.8 Max 58점, Muse Spark 1.2와 GPT-5.6 Terra 57점 다음에 제미나이 3.7 Flash 56점](https://pbs.twimg.com/media/HPnz6yYaUAEShoM.jpg)

Artificial Analysis가 발표 당일 공개한 그래프에서 3.7 Flash(56점) 앞에는 Claude Opus 5(63점), Fable 5(62점), GPT-5.6 Sol과 Grok 4.6(61점), Kimi K3(60점), Qwen3.8 Max(58점), Muse Spark 1.2와 GPT-5.6 Terra(57점)까지 여덟 모델이 있었고, 그 가운데 구글 모델은 없었습니다. 스프레드시트와 문서를 다루는 AA-AnalystAgent에서는 거꾸로 3.7 Flash가 60%로 Opus 5(54%)와 Fable 5(49%)를 앞섰습니다.

같은 기관의 지식·환각 평가 AA-Omniscience에서는 맞힌 비율이 50.0%에서 55.3%로 오르는 동안, 모른다고 답해야 할 질문에 틀린 답을 낸 비율(환각률)도 55.6%에서 64.5%로 올랐습니다. 아는 것이 늘어난 만큼 모르는 것을 아는 척하는 경우도 늘었습니다. 구글이 발표문에서 3.7 Flash가 나아졌다고 꼽은 분야는 금융과 법률, 생명과학입니다.

## 3.5 Pro는 어디에 있나

| 날짜(미국 시각) | 있었던 일 |
| --- | --- |
| 5월 19일 | I/O에서 3.5 Flash 출시, 피차이 「3.5 Pro는 다음 달」 |
| 7월 21일 | 3.6 Flash 출시, 「3.5 Pro는 파트너와 시험 중」, Gemini 4 사전학습 시작 |
| 8월 5일 | 하사비스 딥마인드 의장·알파벳 수석과학자로, 카부쿠오글루 SVP로 딥마인드 총괄, 제프 딘 퇴사 |
| 8월 7일 | SemiAnalysis 「구글이 3.5 Pro를 조용히 취소」 주장, 로건 킬패트릭 「피상적」 반박 |
| 8월 13일 | 3.7 Flash 출시 |

피차이는 5월 19일 I/O 기조연설에서 3.5 Pro를 사내에서 쓰고 있고 다음 달에 내놓겠다고 말했습니다. 7월 21일 3.6 Flash 발표문에서는 3.5 Pro가 파트너와 시험 중이며 준비되는 대로 넓게 풀겠다고 적었고, 같은 글에서 Gemini 4를 위한 가장 야심 찬 사전학습을 시작했다고 밝혔습니다. 그사이 Flash는 3.5, 3.6, 3.7로 세 번 나왔고, 딥마인드 사이트의 최상위 모델은 지금도 2월에 나온 3.1 Pro이며 3.5 Pro에는 「곧 공개」가 붙어 있습니다.

8월 5일에는 경영진 인사가 나왔습니다. 피차이가 직원들에게 보낸 메시지에 따르면 딥마인드를 공동 창업해 이끌어 온 데미스 하사비스는 딥마인드 의장 겸 알파벳 수석과학자로 옮기고, 최고기술책임자(CTO)였던 카부쿠오글루가 SVP로 올라 제미나이 모델 개발과 제미나이 앱, 개발자 조직을 맡았습니다. 같은 날 27년 동안 구글에서 일한 [제프 딘도 회사를 떠났습니다](/post/review-google-talent-exodus-structure). 피차이는 이 메시지에서 Flash 수요가 많다고 쓰면서, 프런티어에 남겠다는 다짐과 함께 나아져야 할 분야에 집중하고 있다고 덧붙였습니다.

이틀 뒤 반도체·AI 분석 회사 SemiAnalysis는 「Gemini is Cooked(제미나이는 끝났다)」라는 글에서 구글이 3.5 Pro를 조용히 취소하고 Gemini 4를 띄우고 있다고 주장했습니다. 제미나이가 세는 방식에 따라 8위나 9위라고 평가했고, 구글 API 토큰 처리량의 증가세가 꺾였다는 점도 짚었습니다. 로건 킬패트릭은 같은 날 X에 이렇게 답했습니다.

킬패트릭은 SemiAnalysis를 아끼지만 이번 분석은 피상적이라며 제미나이 팀이 제대로 만들고 있다고 썼습니다. 3.5 Pro가 취소됐다는 대목에는 따로 답하지 않았고, 3.7 Flash는 그로부터 6일 뒤에 나왔습니다.

SemiAnalysis가 짚은 증가세는 피차이가 실적 발표에서 직접 밝힌 숫자로도 확인됩니다. 고객이 API로 직접 쓰는 구글 모델의 토큰 처리량은 분당 100억 개에서 한 분기 만에 160억 개로 60% 늘었고, 그다음 분기에는 약 220억 개로 38% 늘었습니다. 피차이는 7월 실적 발표에서 공급이 수요를 따라가지 못하는 상태가 이어지고 있다고 말했고, 3주 뒤 구글은 Flash 두 종의 단가를 연말까지 절반으로 내렸습니다.

| 발표 시점 | 분당 API 토큰 | 직전 분기 대비 |
| --- | --- | --- |
| 2026년 4월 29일(1분기 실적) | 160억 개 이상 | 60% 증가(100억 개에서) |
| 2026년 7월 22일(2분기 실적) | 약 220억 개 | 38% 증가 |

저는 3.7 Flash 발표 두 시간쯤 전 스레드에 3.5 Pro는 건너뛰고 바로 Gemini 4로 갈 것 같다고 적었습니다. 지금까지 나온 사실은 그 방향과 어긋나지 않지만, 구글은 3.5 Pro를 취소했다고 확인한 적이 없고 하사비스도 메시지에서 Gemini 4의 진전을 언급했을 뿐입니다.

## 한국 이용자와 개발자에게 달라지는 것

한국에서 Spark는 7월 29일 구글 AI Pro 이상 구독자를 대상으로 한국어와 영어로 출시됐고, 출시 때는 제미나이 3.6으로 돌아갔습니다. 8월 13일부터는 같은 구독에서 Spark가 3.7 Flash로 일하고, 8월 14일부터는 제미나이 앱 대화창에서도 Pro·Ultra 구독자가 3.7 Flash를 쓸 수 있습니다.

API로 서비스를 만드는 국내 개발사에는 12월 31일이 원가 계산에 들어갑니다. 지금 단가로 원가를 짜면 1월 1일에 토큰 단가가 두 배가 되고, 토큰을 더 쓰는 3.7 Flash는 정가 기준 과제당 비용이 3.6 Flash보다 높습니다. Artificial Analysis 계산으로 중간 추론 설정은 과제당 0.26달러에 지수 53점, 높은 설정은 0.40달러에 56점이어서, 설정을 낮춰 단가 인상분을 일부 흡수할 여지도 있습니다.

구글은 3.5 Pro와 Gemini 4의 날짜를 밝히지 않았습니다. 피차이는 8월 5일 메시지에서 곧 나올 모델들에 기대가 크다고 썼고, 도입 가격이 끝나는 12월 31일까지는 4개월 반이 남았습니다. 3.5 Pro나 Gemini 4 소식이 나오면 다시 전하겠습니다.

읽어 주셔서 고맙습니다.

초이 드림
