# 코딩은 밀리고 컴퓨터 조작은 1위, 구글 제미나이 3.6 Flash 공개
_모델 카드 비교표에서 SWE-Bench Pro는 58.7%로 GPT-5.6 Luna·Grok 4.5·Claude Sonnet 5보다 낮았고, OSWorld-Verified 83.0%와 100만 토큰 긴 문맥 54.0%는 가장 높았습니다. 출력 단가는 3.5 Flash의 9달러에서 7.5달러로 내렸고 과제당 출력 토큰은 17% 줄었습니다._
- 매체: 초이의 뉴스레터 · 소식
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-07-21
- 링크: https://choi-newsletter.com/post/news-gemini-36-flash-workhorse
- 답하는 질문: 제미나이 3.6 Flash 성능과 가격
- 직답: 제미나이 3.6 Flash는 출력 100만 토큰당 7.5달러로 내렸고, 코딩 평가는 경쟁 모델보다 낮았지만 컴퓨터 조작과 긴 문맥 평가는 가장 높았습니다.
- 출처: Google, Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 발표 (7월 21일) (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/), Google DeepMind, Gemini 3.6 Flash 모델 카드 (https://deepmind.google/models/model-cards/gemini-3-6-flash/), Gemini API 변경 기록 (https://ai.google.dev/gemini-api/docs/changelog), Google DeepMind X 발표 (https://x.com/GoogleDeepMind/status/2079589698490572961), 제프 딘 X, 토큰 효율 비교 영상 (https://x.com/JeffDean/status/2079591562145870043), 아마르 레시 X (https://x.com/ammaar/status/2079602948494024764), 로건 킬패트릭 X, 3.5 Flash-Lite (https://x.com/OfficialLoganK/status/2079591301365084176), Google, I/O 2026 순다르 피차이 기조연설 (5월 19일) (https://blog.google/innovation-and-ai/sundar-pichai-io-2026/), Google DeepMind, Gemini 3.5 Flash 모델 카드 (https://deepmind.google/models/model-cards/gemini-3-5-flash/), Google DeepMind, Gemini 3.1 Pro 모델 카드 (https://deepmind.google/models/model-cards/gemini-3-1-pro/), 초이 스레드, 제미나이 3.6 Flash 정리 (7월 21일) (https://www.threads.net/@choi.openai/post/DbD2kv6Dixg)
> 구글이 7월 21일 제미나이 3.6 Flash와 3.5 Flash-Lite, 3.5 Flash Cyber를 공개했습니다. 3.6 Flash는 DeepSWE 과제당 출력 토큰을 27만 6,000개에서 9만 7,000개로 줄였고, 출력 단가는 100만 토큰당 7.5달러로 내렸습니다.

구글이 7월 21일(미국 시각) 제미나이 3.6 Flash와 3.5 Flash-Lite, 보안 특화 모델 3.5 Flash Cyber를 한꺼번에 공개했습니다. 주력인 3.6 Flash는 5월 19일 나온 3.5 Flash를 바탕으로 다시 다듬은 모델로, 출력 단가를 100만 토큰당 9달러에서 7.5달러로 내렸습니다. 구글이 모델 카드에 실은 비교표에서 코딩 평가 세 가지는 오픈AI, SpaceXAI, 앤트로픽의 비교 모델보다 모두 낮았고, 컴퓨터 조작과 차트 읽기, 긴 문맥 평가는 가장 높았습니다.

구글 딥마인드는 세 모델을 AI 에이전트를 더 빠르고 똑똑하고 싸게 돌리기 위한 모델이라고 소개했습니다. 3.6 Flash는 3.5 Flash보다 토큰을 덜 쓰면서 더 나은 결과를 내고, 3.5 Flash-Lite는 일상 작업을 빠르고 싸게 처리한다는 설명입니다. 발표문을 쓴 툴시 도시 제품관리 시니어 디렉터는 3.6 Flash를 코딩과 지식 노동, 멀티모달 성능을 끌어올린 「일꾼(workhorse)」 모델이라고 불렀습니다. 입력은 최대 100만 토큰, 출력은 한 번에 6만 4,000토큰까지 받습니다.

> 실제 서비스에 AI 에이전트를 붙이는 개발자와 고객에게는 더 높은 토큰 효율과 더 짧은 지연 시간, 더 믿을 만한 성능이 필요합니다.
> — 툴시 도시, 구글 제품관리 시니어 디렉터

3.6 Flash와 3.5 Flash-Lite는 발표 당일부터 AI Studio와 Android Studio의 Gemini API, 기업용 Gemini Enterprise Agent Platform, 제미나이 앱에서 쓸 수 있습니다. 3.6 Flash는 에이전트 개발 도구 Antigravity에도 들어갔고, 3.5 Flash-Lite는 구글 검색에 적용되기 시작했습니다. 3.5 Flash Cyber는 코드 보안 에이전트 CodeMender를 거쳐 정부와 신뢰할 수 있는 파트너에게만 시범으로 열 예정입니다.

| 모델 | 구글이 밝힌 쓰임새 | 100만 토큰당 입력·출력 | 공개 범위 |
| --- | --- | --- | --- |
| 제미나이 3.6 Flash | 코딩·지식 노동·멀티모달 주력 | 1.50달러·7.50달러 | API, 제미나이 앱, Antigravity, 기업용 |
| 제미나이 3.5 Flash-Lite | 짧은 지연·대량 처리 | 0.30달러·2.50달러 | API, 제미나이 앱, 기업용, 구글 검색 |
| 제미나이 3.5 Flash Cyber | 취약점 탐지·수정 | 공개 안 됨 | CodeMender 한정 시범 |

## 같은 표에 진 숫자와 이긴 숫자를 함께 실었다

모델 카드의 비교표에는 3.6 Flash와 전작 3.5 Flash 옆에 오픈AI GPT-5.6 Luna, SpaceXAI Grok 4.5, 앤트로픽 Claude Sonnet 5가 나란히 올라 있습니다. 세 경쟁 모델은 모두 이달에 나왔습니다. 구글은 이 표에 자사 모델이 진 항목까지 그대로 적었습니다.

| 평가 | 3.6 Flash | 3.5 Flash | GPT-5.6 Luna | Grok 4.5 | Claude Sonnet 5 |
| --- | --- | --- | --- | --- | --- |
| 출력 단가 (100만 토큰) | 7.50달러 | 9.00달러 | 6.00달러 | 6.00달러 | 15.00달러 (한시 10.00달러) |
| SWE-Bench Pro (코딩 과제) | 58.7% | 55.1% | 62.7% | 64.7% | 63.2% |
| DeepSWE v1.1 (장기 코딩) | 49% | 37% | 67% | 54% | 54% |
| Terminal-bench 2.1 (터미널 코딩) | 78.0% | 76.2% | 84.7% | 83.3% | 80.4% |
| MLE-Bench (머신러닝 엔지니어링) | 63.9% | 49.7% | 47.6% | 43.2% | 66.9% |
| GDPVal-AA v2 (지식 노동, Elo) | 1421 | 1349 | 1584 | 1535 | 1607 |
| OSWorld-Verified (컴퓨터 조작) | 83.0% | 78.4% | 72.6% | 점수 없음 | 81.2% |
| CharXiv (차트 읽기, 도구 없이) | 85.2% | 84.2% | 82.7% | 81.6% | 77.0% |
| GDM-MRCR v2 128k (긴 문맥) | 91.8% | 77.3% | 74.8% | 81.4% | 71.6% |
| GDM-MRCR v2 100만 토큰 | 54.0% | 26.6% | 점수 없음 | 점수 없음 | 점수 없음 |

코딩 세 항목과 지식 노동 평가 GDPVal에서 3.6 Flash는 세 경쟁 모델보다 모두 낮았습니다. SWE-Bench Pro는 실제 소프트웨어 저장소의 버그를 고치거나 기능을 더하는 과제를 에이전트가 혼자 풀게 하는 평가인데, 3.6 Flash의 58.7%는 가장 높은 Grok 4.5(64.7%)보다 6.0%포인트 낮습니다. 머신러닝 실험 과제를 푸는 MLE-Bench에서는 63.9%로 Luna와 Grok 4.5를 앞섰지만 Sonnet 5(66.9%)에는 못 미쳤습니다. SWE-Bench Pro는 오픈AI가 7월 8일 [공개 과제의 약 30%가 깨진 문제라는 감사 결과](/post/news-openai-audits-swebench-pro)를 낸 평가이기도 합니다.

컴퓨터 조작 쪽은 순서가 반대입니다. 모델이 실제 컴퓨터 화면을 보고 클릭과 입력으로 과제를 끝내게 하는 OSWorld-Verified에서 3.6 Flash는 83.0%로 Claude Sonnet 5(81.2%)를 앞섰고, 차트를 읽고 추론하는 CharXiv에서도 85.2%로 가장 높았습니다.

6월 24일 3.5 Flash에서 미리보기로 열렸던 컴퓨터 사용 도구는 이번에 Gemini API와 Gemini Enterprise의 기본 도구로 들어갔습니다. 발표문에는 금융 리서치 AI 회사 Hebbia와 법률 AI 회사 Harvey가 문서 해석과 차트·데이터 분석, 보고서 초안 작성에 이 모델을 쓰고 있다는 사례가 실렸습니다.

격차가 가장 큰 항목은 긴 문맥입니다. GDM-MRCR은 긴 대화 속에 비슷한 요청과 답을 여러 개 섞어 두고 그중 특정 번째 것을 정확히 찾아내게 하는 구글의 평가입니다. 3.6 Flash는 128k 토큰 구간에서 91.8%로 2위 Grok 4.5(81.4%)보다 10.4%포인트 높았고, 100만 토큰 구간에서는 3.5 Flash의 26.6%를 54.0%로 두 배 넘게 올렸습니다. 이 구간에는 경쟁 모델의 점수가 없습니다.

## 「코딩도 날카로워졌다」는 소개와 표의 순서

구글 AI Studio의 제품 리드 아마르 레시는 발표 직후 3.6 Flash가 더 빠르고, 더 싸고, 코딩도 날카로워졌다고 소개했습니다. 전작과 견주면 그 설명대로 SWE-Bench Pro는 55.1%에서 58.7%로, 장기 코딩 평가 DeepSWE는 37%에서 49%로, MLE-Bench는 49.7%에서 63.9%로 올랐습니다.

같은 점수를 경쟁사 옆에 놓으면 코딩 세 항목 모두 표에서 가장 낮습니다. 저도 발표 당일 스레드에 코딩하는 분들에게는 아쉬운 모델이라고 적었습니다. 비교표에는 오픈AI의 GPT-5.6 Sol이나 앤트로픽의 Claude Fable 5 같은 각 회사 최상위 모델도 들어 있지 않습니다.

## 토큰을 덜 쓰게 다시 다듬은 모델

3.6 Flash 모델 카드는 구조와 학습 데이터, 학습 하드웨어 항목마다 3.5 Flash를 기반으로 한다고 적고 3.5 Flash 모델 카드를 보라고 안내합니다. 두 달 만에 기반 모델을 새로 만들지 않고, 같은 모델을 다듬어 새 이름을 붙인 겁니다. Gemini API 변경 기록은 이번 판이 출력이 장황하다는 개발자 피드백을 반영했다고 적었습니다.

제프 딘 구글 수석과학자는 3.6 Flash가 3.5 Flash보다 토큰을 훨씬 적게 쓴다며 두 모델을 나란히 돌린 영상을 올렸습니다. 발표문 수치로는 Artificial Analysis 지수 과제에서 과제당 평균 출력 토큰이 2만 8,000개에서 2만 3,000개로 17% 줄었고, DeepSWE에서는 27만 6,000개에서 9만 7,000개로 65% 줄었습니다. 여러 단계를 거치는 작업에서 추론 단계와 도구 호출 횟수도 줄었다고 적었습니다.

토큰이 줄고 단가가 내려가면 과제 하나에 드는 돈은 두 효과를 곱한 만큼 줄어듭니다. DeepSWE 과제 하나의 출력 비용을 단가로 계산하면 3.5 Flash는 27만 6,000개에 9달러를 곱한 약 2.48달러, 3.6 Flash는 9만 7,000개에 7.5달러를 곱한 약 0.73달러입니다. 입력 비용은 빠진 계산이지만, 출력만 보면 과제 하나의 값이 3분의 1 아래로 내려갔습니다.

독립 평가 기관 Artificial Analysis의 사전 측정에서도 과제 하나에 걸리는 시간이 2.7분에서 1.3분으로 절반이 됐습니다. 같은 측정에서 종합 지능 지수는 50점으로 3.5 Flash와 같았고, 같은 달 나온 GPT-5.6 Luna를 비롯한 최신 모델들이 이 지수에서 3.6 Flash보다 위에 있었습니다.

## 토큰 단가는 경쟁 모델이 더 싸다

단가만 보면 3.6 Flash는 표에서 가장 싼 모델이 아닙니다. GPT-5.6 Luna는 100만 토큰당 입력 1달러, 출력 6달러이고, Grok 4.5는 입력 2달러, 출력 6달러입니다. 3.6 Flash의 출력 7.5달러는 두 모델보다 비싸고, 한시 할인가 10달러를 적용한 Claude Sonnet 5보다는 쌉니다.

구글이 내세운 강점은 토큰을 덜 쓴다는 점인데, 발표문의 토큰 비교는 전작 3.5 Flash하고만 했습니다. 같은 과제에서 Luna나 Grok 4.5가 토큰을 얼마나 쓰는지는 표에 없어서, 경쟁 모델과 과제당 비용을 맞대 보기는 어렵습니다. 전작보다 싸졌다는 것까지가 발표 자료로 확인되는 내용입니다.

## 가장 싼 3.5 Flash-Lite

함께 나온 3.5 Flash-Lite는 3.5 계열에서 가장 빠른 모델입니다. Artificial Analysis 기준 초당 350토큰을 출력하고, 값은 100만 토큰당 입력 0.30달러, 출력 2.50달러입니다. 구글은 문서 처리나 에이전트 검색처럼 처리량이 중요한 작업과, 큰 모델이 여러 작은 에이전트를 부리는 구성의 하위 에이전트로 쓰라고 안내했습니다.

구글 AI Studio와 Gemini API를 이끄는 로건 킬패트릭은 3.5 Flash-Lite가 여러 경우 Gemini 3보다 똑똑하고, 곧 은퇴할 2.5 Flash와 같은 값에 더 똑똑하다고 적었습니다. 함께 올린 그래프를 보면 직전 라이트 모델 3.1 Flash-Lite보다 Terminal-bench 2.1은 31.0%에서 54.0%로, GDPVal-AA v2는 642점에서 1140점으로 올랐습니다. 한 세대 위 주력이던 3 Flash와 견줘도 SWE-Bench Pro(54.2% 대 49.6%)와 OSWorld-Verified(74.0% 대 65.1%)에서 앞섰습니다.

대신 라이트끼리 비교한 비용은 올랐습니다. Artificial Analysis는 3.5 Flash-Lite의 지능 지수가 전작 라이트보다 11점 올라 라이트 계열에서 가장 큰 폭으로 개선됐지만, 과제당 비용은 전작 라이트의 두 배가 됐다고 측정했습니다. 그래도 절대 금액은 3.6 Flash의 5분의 1 수준입니다.

## 작은 모델을 다섯 번 부르는 3.5 Flash Cyber

3.5 Flash Cyber는 3.5 Flash를 바탕으로 보안 취약점을 찾고 고치는 데 맞춰 미세 조정한 모델입니다. 구글의 코드 보안 에이전트 CodeMender 안에서 이 모델 여러 개가 함께 일하고, 결과를 하나의 보고서로 합칩니다. 구글은 큰 모델보다 토큰당 값이 싸다고만 밝혔고 가격표는 내지 않았습니다.

구글이 공개한 취약점 평가 CyberGym 그래프에서 이 구성은 83.2%를 받았습니다. 한 과제에 모델을 최대 5번까지 부른 결과이고, 비교 대상은 각 회사의 에이전트에서 돌린 최상위 모델과 보안 특화 모델입니다.

| 구성 | CyberGym |
| --- | --- |
| 오픈AI GPT-5.5-Cyber (오픈AI 에이전트) | 85.6% |
| 앤트로픽 Mythos 5 (앤트로픽 에이전트) | 83.8% |
| 오픈AI GPT-5.6 Sol (오픈AI 에이전트) | 83.6% |
| 제미나이 3.5 Flash Cyber (CodeMender, 최대 5회 호출) | 83.2% |
| 앤트로픽 Mythos Preview (앤트로픽 에이전트) | 83.1% |

구글은 이 기술이 공격에도 쓰일 수 있어 접근을 제한한다고 밝혔습니다. 모델 카드에는 앞선 Gemini 3 계열 모델들이 사이버 분야 경보 기준에 닿아 3.6 Flash는 이 분야를 추가로 시험했고, 사이버 분야의 치명적 능력 수준(CCL)에는 닿지 않았다는 내용이 들어 있습니다. 화학·생물·방사능·핵과 사이버 공격 악용을 막는 안전장치도 강화했다고 적었습니다.

## 3.5 Pro는 아직 파트너 시험 중이다

| 날짜 | 있었던 일 |
| --- | --- |
| 2월 19일 | 제미나이 3.1 Pro 출시 |
| 5월 19일 | I/O에서 3.5 Flash 출시, 피차이 「3.5 Pro는 다음 달」 |
| 6월 24일 | 3.5 Flash에 컴퓨터 사용 도구 미리보기 추가 |
| 7월 21일 | 3.6 Flash·3.5 Flash-Lite·3.5 Flash Cyber 공개, 「3.5 Pro는 파트너와 시험 중」 |

순다르 피차이 CEO는 5월 19일 I/O 기조연설에서 3.5 Pro를 사내에서 쓰고 있고 큰 개선을 보이고 있다며 다음 달에 나온다고 말했습니다. 6월에는 나오지 않았고, 이번 발표문은 3.5 Pro가 파트너와 시험 중이며 준비되는 대로 넓게 풀겠다고 적었습니다. 같은 글에서 구글은 Gemini 4를 위해 지금까지 가장 야심 찬 사전학습을 시작했다고 밝혔습니다.

구글의 가장 최근 Pro 모델은 지금도 2월 19일 나온 3.1 Pro입니다. 이번 비교표에 3.1 Pro가 함께 실렸는데, 3.6 Flash는 코딩과 컴퓨터 조작, 긴 문맥까지 표에 오른 모든 항목에서 3.1 Pro보다 높았습니다. 저는 발표 당일 스레드에 Flash를 앞세운 배치가 계산된 선택일 수도 있지만, 3.5 Pro가 일정을 넘긴 것은 최상위 모델을 만드는 능력의 문제일 가능성도 있다고 적었습니다.

## 한국 이용자와 개발자에게 달라지는 것

제미나이 앱 사용자는 발표 당일부터 3.6 Flash를 쓸 수 있습니다. 구글이 5월 I/O에서 밝힌 제미나이 앱 월간 사용자는 9억 명을 넘었고, 검색 AI 모드 월간 사용자는 10억 명을 넘었습니다. 3.6 Flash는 제미나이 앱으로, 3.5 Flash-Lite는 검색으로 같은 날 일반 사용자에게도 닿았습니다. 제가 밖에서 만나는 사무 현장에서도 문서와 이미지를 다루는 일에는 제미나이를 쓰는 곳이 가장 많고, 워크스페이스에 붙어 있어 따로 도입할 것이 없다는 이유를 자주 듣습니다.

API로 서비스를 만드는 개발사에는 챙길 변경이 두 가지 있습니다. 같은 날 Gemini API 변경 기록에는 temperature, top_p, top_k 같은 샘플링 매개변수를 폐기한다는 공지가 함께 올라왔고, 로건 킬패트릭은 2.5 Flash가 은퇴를 앞두고 있다고 적었습니다. 킬패트릭이 2.5 Flash와 같은 값의 대안으로 내세운 모델이 3.5 Flash-Lite입니다.

한국어로 쓸 때 참고할 숫자도 모델 카드에 있습니다. 여러 언어로 안전 정책 위반을 재는 자동 평가에서 3.6 Flash는 3.5 Flash보다 5.45%포인트 나아졌고, 지식 기준일은 2026년 3월이지만 일부 분야는 2025년 1월에 머물러 있습니다. 5월에 다음 달이라던 3.5 Pro는 7월 21일 현재 파트너 시험 단계이고, 나오는 대로 다시 전하겠습니다.

읽어 주셔서 고맙습니다.

초이 드림
