# Grok 4.7, 코딩 지수 9점 오를 때 종합은 2점, 과제당 비용은 2배
_SpaceXAI가 9월 21일 Grok 4.7을 4.6과 같은 100만 토큰당 입력 2달러·출력 6달러에 내놨습니다. Artificial Analysis 측정에서 과제당 출력 토큰은 2.2배로 늘었고, 긴 문맥 추론 점수와 출력 속도는 4.6보다 낮았습니다._
- 매체: 초이의 뉴스레터 · 소식
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-09-21T18:00
- 링크: https://choi-newsletter.com/post/news-grok-47-coding-jump-index-flat
- 답하는 질문: Grok 4.7 성능과 비용
- 직답: Grok 4.7은 코딩 에이전트 지수가 47점에서 56점으로, 종합 지수는 44점에서 46점으로 올랐고 과제당 비용은 4.6의 2배가 됐습니다.
- 출처: SpaceXAI, Introducing Grok 4.7 (2026-09-21) (https://x.ai/news/grok-4-7), SpaceXAI X, Grok 4.7 출시 (2026-09-21) (https://x.com/SpaceXAI/status/2102069815225586149), Artificial Analysis, Grok 4.7 (https://artificialanalysis.ai/models/grok-4-7), Artificial Analysis, Coding Agent Index (https://artificialanalysis.ai/agents/coding-agents), Artificial Analysis, AA-Omniscience (https://artificialanalysis.ai/evaluations/omniscience), SpaceXAI, Introducing Grok 4.6 (2026-08-12) (https://x.ai/news/grok-4-6), xAI 모델 문서 (https://docs.x.ai/developers/models), Cursor X, SpaceX 인수 완료 (2026-08-14) (https://x.com/cursor_ai/status/2088249881718919393), 리 로빈슨 X, Cursor의 Grok 사용량 확대 (2026-08-25) (https://x.com/leerob/status/2092281297271996712), Anthropic, Claude 요금 (https://platform.claude.com/docs/en/about-claude/pricing), OpenAI, API 요금 (https://developers.openai.com/api/docs/pricing)
> Grok Build에서 잰 Terminal-Bench 4.0 통과율이 17.7%에서 33.3%로 뛰었습니다. 같은 단가에 AA 지능 지수 과제 하나를 푸는 비용은 1.86달러에서 3.74달러로 늘어, 단가가 5배인 GPT-6 Astra(3.26달러)보다 많아졌습니다.

SpaceXAI가 9월 21일(미국 시각) Grok 4.7을 공개했습니다. Cursor와 Grok Build, Grok API에서 바로 쓸 수 있고, 가격은 4.6과 같은 100만 토큰당 입력 2달러, 출력 6달러입니다. 독립 평가기관 Artificial Analysis(AA)가 잰 코딩 에이전트 지수는 47점에서 56점으로 올랐고, 종합 지능 지수는 44점에서 46점으로 올랐습니다.

SpaceXAI는 4.7을 4.6보다 눈에 띄게 나아진 모델이라고 소개하며, 어려운 작업을 더 오래 붙잡고 결과를 더 꼼꼼히 확인하며 지금까지 가장 강한 안전장치를 갖췄다고 적었습니다. 발표문에 따르면 4.7은 4.6보다 큰 새 베이스 모델을 쓰고, 몇 시간씩 걸리는 문제에 비중을 둔 더 어려운 과제로 강화학습을 더 길게 돌렸습니다. 자기 작업을 검증하는 능력과 긴 문맥을 다루는 능력이 나아졌고, 자사 에이전트 서비스 Grok Bot의 하네스에 맞춰 학습해 대화형 작업과 일반 지식 업무에도 강해졌다는 설명입니다.

Grok Bot은 봇 한 대마다 전용 리눅스 컴퓨터를 붙여 일을 시키는 서비스로, 그 구조는 [8월 글](/post/review-cloud-native-company-agent-autoscaling)에서 다뤘습니다. 하네스는 모델에 도구와 지시를 붙여 실제로 일을 시키는 실행 틀이고, 같은 모델도 어떤 하네스에 넣느냐에 따라 점수가 달라집니다.

## 7월 4.5부터 9월 4.7까지

SpaceXAI는 7월부터 9월까지 Grok을 세 번 냈고, 입력 2달러와 출력 6달러라는 단가는 한 번도 바꾸지 않았습니다. 대신 같은 과제 하나를 푸는 데 쓰는 토큰과 돈이 세대마다 늘었습니다. 아래는 AA의 9월 21일 지능 지수(v4.3.2) 기준 값입니다.

| 모델 (설정) | 공개일 | AA 지능 지수 | 과제당 출력 토큰 | 과제당 비용 |
| --- | --- | --- | --- | --- |
| Grok 4.5 (high) | 7월 8일 | 38.8 | 2만 6,882 | 1.04달러 |
| Grok 4.6 (high) | 8월 12일 | 44.3 | 3만 5,835 | 1.86달러 |
| Grok 4.7 (high) | 9월 21일 | 46.3 | 6만 5,901 | 2.73달러 |
| Grok 4.7 (xhigh) | 9월 21일 | 46.4 | 8만 561 | 3.74달러 |

과제당 비용은 AA가 지능 지수에 들어가는 과제를 풀며 쓴 입력·캐시·출력 토큰에 공개 요금을 적용해 낸 값입니다. 4.5에서 4.7(xhigh)까지 지수는 7.6점 올랐고 과제당 비용은 3.6배가 됐습니다. [7월 Grok 4.5](/post/news-grok-45-cursor-price-war)는 Cursor 사용 기록으로 함께 학습한 모델이었고, [8월 Grok 4.6](/post/news-xai-grok-46-frontier-return)은 4.5가 다시 만든 학습 데이터로 긴 에이전트 작업을 겨냥했습니다. 4.5와 4.6의 간격은 35일, 4.6과 4.7의 간격은 40일입니다.

그사이 SpaceX는 8월 14일 Cursor 인수를 마쳤습니다. Cursor는 SpaceXAI 팀에 합류해 Grok과 Grok Build, Cursor를 함께 키우겠다고 밝혔고, 8월 25일에는 Grok 4.6 출시 뒤 수요가 늘었다며 Cursor 요금제에 포함된 Grok 모델 사용량을 영구적으로 늘렸습니다. 오픈AI는 8월 29일 [Cursor에 대한 모델 공급 계약을 끝내겠다고 통보](/post/news-openai-cursor-contract-termination)했고, 제안된 차단일은 11월 12일입니다.

## 코딩 에이전트 지수는 47점에서 56점으로

AA의 코딩 에이전트 지수(v1.5)는 세 가지 평가를 같은 비중으로 합친 값입니다. 데이터커브(Datacurve)의 DeepSWE v1.1(소프트웨어 개발 과제 113개), Laude Institute의 Terminal-Bench 4.0(터미널 작업 66개), Scale AI의 SWE-Atlas-QnA(기술 질의응답 124개)이고, 과제마다 세 번 시도한 결과를 평균합니다. 모델을 각 회사의 기본 코딩 도구에 넣어 재며, Grok은 Grok Build에서 4.6과 4.7을 모두 xhigh 설정으로 쟀습니다.

| 평가 | Grok 4.6 (xhigh) | Grok 4.7 (xhigh) |
| --- | --- | --- |
| DeepSWE v1.1 | 64.9% | 72.6% |
| Terminal-Bench 4.0 | 17.7% | 33.3% |
| SWE-Atlas-QnA | 58.3% | 62.9% |
| 코딩 에이전트 지수 | 47.0 | 56.3 |

가장 크게 오른 것은 Terminal-Bench 4.0으로, 터미널에서 명령을 이어 가며 오래 작업해야 하는 과제의 통과율이 17.7%에서 33.3%로 2배 가까이 올랐습니다. 몇 시간짜리 문제에 강화학습을 집중했다는 발표문 설명과 같은 방향입니다. 각 회사 기본 도구 조합으로 보면 Claude Code와 Fable 5.1(62.2), Codex와 GPT-6 Astra(61.6), Claude Code와 Opus 5(59.7)에 이어 네 번째이고, Codex와 GPT-5.6 Sol(54.6), 메타의 Muse Code와 Muse Spark 1.3(54.3)보다 앞섭니다.

SpaceXAI는 출시 게시물에 4.7과 4.6이 같은 요청으로 오픈월드 도시 게임을 만드는 영상을 나란히 붙였습니다. 영상 속 4.7의 도시는 건물과 도로, 차량 표현이 더 세밀하지만, 몇 번 시도해 고른 결과인지는 적혀 있지 않습니다.

## 같은 Terminal-Bench 4.0에 세 개의 점수

Terminal-Bench 4.0 점수는 누가 어떤 틀로 쟀느냐에 따라 세 가지로 나옵니다. xAI 발표문 표, AA 코딩 에이전트 지수, AA 지능 지수의 구성 평가가 모두 같은 시험 이름을 씁니다.

| 측정 | Grok 4.6 | Grok 4.7 | GPT-5.6 Sol | Fable 5.1 |
| --- | --- | --- | --- | --- |
| xAI 발표문 표 | 20.3% (high) | 37.6% (xhigh) | 37.3% (max) | 57.9% (max) |
| AA 코딩 에이전트 지수 | 17.7% (xhigh) | 33.3% (xhigh) | 37.4% (max) | 57.6% (max) |
| AA 지능 지수 구성 평가 | 21.2% (high) | 25.8% (xhigh) | 39.9% (max) | 52.0% (max) |

GPT-5.6 Sol과 Fable 5.1은 xAI 표의 값과 AA 코딩 에이전트 측정이 0.3%포인트 안에서 맞습니다. Grok 4.7은 같은 xhigh 설정인데도 xAI 표가 4.3%포인트 높고, SpaceXAI가 X에 올린 표 이미지에는 38.0%로 적혀 있습니다. 같은 시험도 하네스와 설정에 따라 순서까지 달라진다는 점은 [7월 Grok 4.5 글](/post/news-grok-45-cursor-price-war)에서 DeepSWE로 한 번 확인했습니다.

![Grok 4.7 xHigh, Grok 4.6 High, GPT-5.6 Sol Max, Fable 5.1 Max의 입력·출력 단가와 CursorBench 4.0, DeepSWE v1.1, EEBench, AA-Briefcase v1.1, Terminal-Bench 4.0, Harvey Legal Agent, HealthBench Pro 점수를 비교한 표](https://pbs.twimg.com/media/HSwLcNqXIAAwNtz.png)

xAI 표에서 Grok 4.7이 가장 앞선 항목은 전기공학 과제 EEBench(64.0%)와 법률 에이전트 평가 Harvey Legal Agent(19.6%)입니다. Terminal-Bench 4.0과 임상 추론 HealthBench Pro, CursorBench 4.0에서는 Fable 5.1이 가장 높았습니다.

## 종합 지능 지수는 44점에서 46점으로

AA 지능 지수(v4.3.2)는 평가 10개를 합친 값입니다. 몇 시간짜리 사무 업무(AA-Briefcase), 전문직 결과물(GDPval-AA), 업무 자동화(AutomationBench-AA), 터미널 작업(Terminal-Bench 4.0), 과학 코딩(SciCode), 인류의 마지막 시험(HLE), 전문 문서 추론(GDP.pdf), 물리 추론(CritPt), 지식 정확도(AA-Omniscience), 긴 문맥 추론(AA-LCR)이 들어갑니다. 여기서 4.7(xhigh)은 46.4점, 4.6(high)은 44.3점이었습니다.

| 모델 (설정) | AA 지능 지수 |
| --- | --- |
| Claude Fable 5.1 (max, 대체 모델 사용) | 53.4 |
| GPT-6 Astra (max) | 52.7 |
| Claude Opus 5 (max) | 50.8 |
| Muse Spark 1.3 (max) | 48.1 |
| GPT-5.6 Sol (max) | 47.0 |
| Grok 4.7 (xhigh) | 46.4 |
| Grok 4.7 (high) | 46.3 |
| Grok 4.6 (high) | 44.3 |

개발사 기준으로는 앤트로픽, 오픈AI, 메타에 이어 네 번째입니다. 같은 high 설정끼리 견주면 4.7은 46.3점, 4.6은 44.3점으로 역시 2점 차이이고, 4.6을 xhigh로 올린 값은 44.2점이었습니다. 설정을 모두 따로 세면 Grok 4.7(xhigh)은 16번째이고, 앤트로픽 Fable 5.1의 가장 낮은 설정(low, 46.8점)보다 조금 아래입니다. Fable 5.1 점수에 붙은 대체 모델 사용은 사이버 보안이나 생물학 요청으로 판단된 과제를 안전장치가 다른 모델로 넘긴 채로 쟀다는 표시이고, 그 방식은 [Fable 5.1 출시 글](/post/news-fable-51-efficiency-curve-drop)에 정리했습니다.

AA 지수의 판본도 8월과 다릅니다. AA는 8월 Grok 4.6 출시 때 평가 9개로 된 v4.1.1을 썼고, 그때 4.6(high)은 61점으로 GPT-5.6 Sol과 같았습니다. 9월 판(v4.3)은 AA-Briefcase 같은 새 평가를 넣어 10개로 다시 짰고, 같은 4.6이 44점이 됐습니다. 모델은 그대로이고 잣대가 바뀌었으니, 8월의 61점은 옛 잣대의 값이고 이번 46점은 새 잣대의 값입니다.

## 오른 평가와 내린 평가

2점이라는 종합 점수 안에서는 평가마다 움직임이 갈렸습니다. 사무 업무와 전문직 결과물 평가는 크게 올랐고, 긴 문맥 추론과 업무 자동화는 내려갔습니다.

| 평가 | 재는 것 | 4.6 (high) | 4.7 (xhigh) |
| --- | --- | --- | --- |
| AA-Briefcase | 몇 시간짜리 사무 업무 (Elo) | 1,546 | 1,657 |
| GDPval-AA | 전문직 과제 결과물 (Elo) | 1,605 | 1,695 |
| GDP.pdf | 전문 문서 추론 (전 항목 통과율) | 17.0% | 20.0% |
| AA-LCR | 긴 문맥 추론 | 80.3% | 76.7% |
| AutomationBench-AA | 업무 자동화 | 66.7% | 65.6% |
| AA-Omniscience 정답률 | 지식 | 48.2% | 47.5% |
| AA-Omniscience 환각률 | 모를 때 틀린 답을 낸 비율 | 34.3% | 29.3% |

AA-Briefcase는 111점 올라 Fable 5.1(1,678점)과 Opus 5(1,673점)에 가까워졌습니다. 이 점수는 채점 기준 통과율과 분석 품질, 표현 품질을 합친 값인데, 내용을 분석하는 품질은 1,690점에서 1,994점으로 올라 Fable 5.1(1,999점)과 비슷해졌고 결과물을 보기 좋게 꾸미는 표현 품질은 1,519점에서 1,499점으로 조금 내려갔습니다. 표현 품질은 비교한 모델 가운데 GPT-5.6 Sol이 1,653점으로 가장 높았습니다.

전문직 과제 결과물을 재는 GDPval-AA는 1,605점에서 1,695점으로 올랐습니다. xAI 발표문 차트에서는 Fable 5.1(1,735점) 다음이었지만, 그 차트에 없는 Opus 5가 AA 측정으로는 1,708점이었습니다.

긴 문맥 추론 AA-LCR은 3.7%포인트 내려갔습니다. xAI는 4.7이 긴 문맥을 더 잘 다룬다고 적었지만, AA가 긴 문서를 읽혀 추론하게 한 평가에서는 4.6보다 낮게 나왔습니다. 긴 문서를 통째로 넣고 묻는 사내 검색 같은 작업에서 4.6을 쓰던 팀에게는 거꾸로 움직인 숫자입니다.

AA-Omniscience의 환각률은 맞히지 못한 문제 가운데 모른다고 하지 않고 틀린 답을 낸 비율입니다. 문제 100개로 풀면 4.6은 약 48개를 맞히고 18개를 틀렸고, 나머지 34개는 답을 하지 않거나 일부만 답했습니다. 4.7은 47개를 맞히고 15개를 틀렸으며 37개에서 물러섰습니다. 같은 평가에서 GPT-5.6 Sol의 환각률은 92.2%, Fable 5.1은 72.6%로, 4.7은 더 많이 아는 모델들보다 모를 때 모른다고 답하는 비율이 훨씬 높았습니다.

## 같은 단가에 과제당 비용은 두 배

AA가 지능 지수 과제를 돌리며 센 출력 토큰은 과제당 4.6(high)이 3만 5,835개, 4.7(xhigh)이 8만 561개로 2.2배였습니다. 같은 평가에서 GPT-6 Astra(max)는 2만 7,206개를 썼습니다. 단가가 그대로이니 과제당 비용도 1.86달러에서 3.74달러로 두 배가 됐고, 단가가 5배인 GPT-6 Astra의 과제당 비용 3.26달러보다 많아졌습니다. GPT-5.6 Sol(max)은 1.99달러, Opus 5(max)는 5.86달러, Fable 5.1(max)은 7.63달러였습니다.

속도도 발표문 설명과 달랐습니다. xAI는 4.7을 4.6과 같은 가격과 속도로 제공한다고 했고 발표문 첫 줄에는 비슷한 모델보다 두 배 빠르다고 적었지만, AA가 출시 당일 잰 출력 속도는 4.7(xhigh)이 초당 39.3토큰, 4.6(high)이 63.0토큰이었습니다. 같은 high 설정끼리도 54.2토큰과 63.0토큰이었고, GPT-5.6 Sol은 77.3토큰, GPT-6 Astra는 68.7토큰이었습니다. AA는 4.7(xhigh)을 눈에 띄게 느리다고 분류했습니다.

설정을 한 단계 낮추면 비용이 27% 줄었습니다. 4.7을 high로 돌리면 지수는 46.3점으로 xhigh와 0.1점 차이인데, 과제당 출력 토큰은 6만 5,901개, 비용은 2.73달러였습니다. xAI는 출력 속도를 두 배로 올린 빠른 버전도 두 배 가격에 제공합니다.

| 모델 (100만 토큰당) | 입력 | 출력 |
| --- | --- | --- |
| Grok 4.7 · Grok 4.6 | 2달러 | 6달러 |
| Claude Sonnet 5 | 2달러 | 10달러 |
| GPT-5.6 Sol | 4달러 | 20달러 |
| Claude Opus 5 | 5달러 | 25달러 |
| Claude Fable 5.1 · GPT-6 Astra | 10달러 | 50달러 |

Grok 4.7의 캐시 입력은 100만 토큰당 0.50달러이고, 긴 입력에는 입력 4달러·출력 12달러의 별도 단가가 붙습니다. 7월 출시 때 입력 5달러·출력 30달러였던 GPT-5.6 Sol은 9월 21일 기준 4달러·20달러로 내려와 있었습니다.

## CursorBench 4.0, 비슷한 점수에서는 싸게

xAI가 비용 면에서 내세운 근거는 CursorBench 4.0입니다. Cursor가 만든 코딩 평가로, xAI는 더 오래 걸리는 코딩 과제를 강조하는 이 판에서 Grok 4.7이 가격 대비 성능의 맨 앞에 있다고 적었습니다.

![CursorBench 4.0 점수와 과제당 평균 비용을 모델·설정별 점과 선으로 그린 그래프. Fable 5.1, Opus 5, Grok 4.7, GPT-5.6 Sol, Sonnet 5의 곡선이 보입니다](https://pbs.twimg.com/media/HSwLemqWoAAP4EW.jpg)

| 모델·설정 (CursorBench 4.0) | 점수 | 과제당 비용 |
| --- | --- | --- |
| Fable 5.1 Max | 51.8% | 17.28달러 |
| Fable 5.1 Medium | 46.8% | 7.05달러 |
| Opus 5 Max | 46.6% | 11.95달러 |
| Grok 4.7 Extra High | 46.3% | 6.01달러 |
| Fable 5.1 Low | 45.1% | 5.44달러 |
| Grok 4.7 High | 43.9% | 4.69달러 |
| GPT-5.6 Sol Max | 41.7% | 8.23달러 |

46% 안팎에서 Grok 4.7(Extra High)은 Fable 5.1(Medium)보다 약 15%, Opus 5(Max)보다 절반 가까이 쌌습니다. 다만 Fable 5.1(Low)은 1.2%포인트 낮은 45.1%를 5.44달러에 냈고, 가장 높은 점수인 Fable 5.1(Max)의 51.8%에 닿는 Grok 설정은 없습니다. xAI 표에 적힌 Grok 4.6(High)의 점수는 40.4%였습니다.

이 차트와 표는 xAI 발표문에 실린 값이고, Cursor 순위표나 다른 기관이 다시 잰 값은 함께 실리지 않았습니다. CursorBench를 만든 Cursor는 8월 14일부터 SpaceX의 회사가 됐고, 7월 Grok 4.5 때는 Cursor 코드베이스의 옛 스냅샷이 학습 데이터에 섞여 Grok이 CursorBench에서 유리했다는 각주가 붙었습니다.

## 한국 개발자에게 달라지는 것

Cursor를 쓰는 팀이라면 4.7은 이미 요금제 안에서 고를 수 있는 모델이고, 8월부터 Grok 계열의 기본 사용량도 늘어나 있습니다. 코딩 에이전트에게 터미널 작업을 길게 맡기는 쪽에서는 Terminal-Bench와 DeepSWE의 상승이 그대로 도움이 됩니다. 반대로 긴 문서를 통째로 넣고 묻는 작업은 AA-LCR이 내려간 방향이고, 보고서 초안은 내용 분석이 좋아진 대신 꾸밈새는 4.6보다 조금 못합니다.

API로 쓰는 팀에게 달라지는 것은 청구서입니다. 단가는 그대로지만 xhigh 설정의 과제당 토큰이 2.2배라 같은 일을 시켜도 비용이 두 배로 들고, 응답도 느려졌습니다. AA 지수로는 high 설정이 xhigh와 거의 같은 점수를 27% 싼 비용에 냈습니다.

## 다음에 볼 것

xAI는 4.7에 완전히 새로 짠 안전장치를 붙였다고 밝혔습니다. 자사의 위험 사이버 과제 평가 HackerBench v0.3에서 위험한 이중 용도 요청의 3.3%만 통과시켰고, LatchBio의 생물 안전 평가에서 62.4%로 가장 높았다는 설명입니다. 일부 사이버 보안 협력사에는 4.7의 레드팀 기능을 초대제로 열었습니다.

4.5부터 4.7까지 SpaceXAI는 5~6주마다 같은 값에 새 모델을 냈고, 매번 지수와 함께 과제당 토큰도 늘었습니다. AA의 출력 속도 측정이 출시 초기 값에서 얼마나 달라지는지, CursorBench 4.0의 Grok 수치를 Cursor 밖에서 다시 잰 결과가 나오는지가 다음 확인거리입니다.

읽어 주셔서 고맙습니다.

초이 드림
