# Opus 5.5 "작업비 40% 절감", 최고 설정에선 Opus 5와 비슷했습니다
_단가를 20% 내린 Opus 5.5의 과제당 비용은 AA 측정에서 기본 설정 39% 감소, 최고 설정 2% 증가였습니다. 1시간 41분 뒤 나온 GPT-6 Sol·Luna는 단가를 절반으로 내려 과제당 비용이 47%·62% 줄었습니다._
- 매체: 초이의 뉴스레터 · 아티클
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-09-26
- 링크: https://choi-newsletter.com/post/review-opus55-sol-luna-work-cost
- 답하는 질문: Opus 5.5 GPT-6 Sol 작업당 비용 비교
- 직답: AA 측정에서 과제당 비용은 Opus 5.5 기본 설정이 Opus 5보다 39%, GPT-6 Sol이 GPT-5.6 Sol보다 47% 낮았습니다.
- 출처: Anthropic, Introducing Claude Opus 5.5 (2026년 9월 22일) (https://www.anthropic.com/claude-opus-5-5), Claude X, Opus 5.5 가격과 40% 절감 설명 (한국 시각 9월 23일) (https://x.com/claudeai/status/2102435522190717210), claude.dev 블로그, What a task costs on Opus 5.5 (애디 오스마니, 9월 25일) (https://claude.dev/blog/what-a-task-costs-on-opus-5-5/), OpenAI, Introducing GPT-6 Sol and Luna (9월 22일) (https://openai.com/index/introducing-gpt-6-sol-and-luna/), 같은 글의 9월 23일 보관본 (Wayback Machine) (https://web.archive.org/web/20260923125408/https://openai.com/index/introducing-gpt-6-sol-and-luna/), OpenAI X, GPT-6 Sol·Luna 공개 (한국 시각 9월 23일) (https://x.com/OpenAI/status/2102460975790137662), Artificial Analysis, Claude Opus 5.5 takes the top spot on the Intelligence Index (9월 22일) (https://artificialanalysis.ai/articles/claude-opus-5-5), Artificial Analysis, GPT-6 Sol and Luna push the cost efficiency frontier (9월 22일) (https://artificialanalysis.ai/articles/gpt-6-sol-and-luna-push-the-cost-efficiency-frontier), Artificial Analysis 모델 페이지 9월 23일 보관본 (설정별 과제당 비용) (https://web.archive.org/web/20260923093005/https://artificialanalysis.ai/models/claude-opus-5-5), Artificial Analysis X, 효율 경계 정리 (한국 시각 9월 24일) (https://x.com/ArtificialAnlys/status/2102833926788288704), Sonar, Claude Opus 5.5: An evaluation review and metrics benchmarks (9월 22일) (https://www.sonarsource.com/blog/claude-opus-5-5-an-evaluation/), Ryan Sael X, 렌즈 실험실 사례 (한국 시각 9월 23일) (https://x.com/RyanSael/status/2102591147927654847)
> 앤트로픽이 9월 22일 Opus 5.5를 내며 기본 설정 작업비가 40% 준다고 밝혔습니다. AA 측정에서 medium은 39% 줄었고 max는 2% 늘었으며, 같은 날 나온 GPT-6 Sol·Luna는 과제당 비용이 47%·62% 줄었습니다.

앤트로픽이 9월 22일(미국 시각) Claude Opus 5.5를 내놓으며 입력·출력 단가를 100만 토큰당 4달러·20달러로 Opus 5보다 20% 내렸습니다. 1시간 41분 뒤 오픈AI는 GPT-6 Sol을 2달러·10달러, Luna를 0.1달러·0.5달러에 공개했습니다. 앤트로픽은 기본 설정에서 작업 비용이 40% 줄어든다고 밝혔고, 독립 평가기관 Artificial Analysis(AA)의 측정에서 과제 하나의 비용은 기본 설정(medium)에서 39% 줄고 최고 설정(max)에서는 2% 늘었습니다.

Claude 공식 계정은 한국 시각 9월 23일 새벽 1시 31분 Opus 5.5를 알리며 가격표를 따로 올렸습니다. Opus 5.5는 Opus 5보다 서빙에 드는 연산이 적어 그만큼 값을 내렸고, 자사 시험에서 기본 설정으로 일반적인 작업을 돌리면 비용이 40% 낮다는 설명입니다. 발표문은 그 이유로 토큰 하나의 값이 내려갔고 과제 하나에 쓰는 토큰도 줄었다는 두 가지를 들었습니다. 국내 기사 제목 가운데는 「40% 더 저렴하게 출시」도 있었지만, 가격표에서 내려간 폭은 입력·출력 20%, 캐시 읽기 60%입니다.

같은 새벽 두 회사가 앞세운 숫자는 모두 가격이었습니다. 앤트로픽의 40%는 토큰 단가에 과제당 사용량을 곱한 결과이고, 오픈AI의 50%는 직전 모델의 프로모션 가격과 견준 단가입니다. 두 모델의 성능표는 [같은 새벽의 두 발표를 다룬 글](/post/news-gpt6-sol-luna-opus55-same-morning)에 정리했고, 이 글은 두 발표문과 AA가 발표 당일 공개한 측정값, 코드 분석 회사 Sonar의 평가를 가지고 작업 한 건에 실제로 드는 돈을 다시 계산했습니다.

## 가격표에서 내려간 것

| 100만 토큰당 | 입력 | 출력 | 캐시 읽기 | 직전 모델 대비 |
| --- | --- | --- | --- | --- |
| Claude Opus 5.5 | 4달러 | 20달러 | 0.2달러 | Opus 5(5·25·0.5달러)보다 20%·20%·60% 인하 |
| GPT-6 Sol | 2달러 | 10달러 | 0.2달러 | GPT-5.6 Sol 프로모션가(4·20·0.4달러)의 절반 |
| GPT-6 Luna | 0.1달러 | 0.5달러 | 0.01달러 | GPT-5.6 Luna(0.2·1.2·0.02달러)보다 50%·58%·50% 인하 |

앤트로픽은 5분짜리 캐시 쓰기 값도 6.25달러에서 5달러로 내렸고, 캐시 읽기 할인율을 새 입력 대비 90%에서 95%로 키웠습니다. 캐시 읽기만 놓고 보면 Opus 5.5와 GPT-6 Sol이 100만 토큰당 0.2달러로 같습니다. 속도를 최대 2.5배로 올리는 Opus 5.5의 빠른 모드는 입력 8달러, 출력 40달러를 따로 받습니다.

오픈AI가 앞세운 50%의 기준은 GPT-5.6 Sol의 프로모션 가격 4달러·20달러입니다. 7월 9일 [GPT-5.6을 정식 출시](/post/news-gpt56-launch-price-per-result)할 때 Sol은 5달러·30달러였으니, 출시가와 견주면 입력은 60%, 출력은 67% 내려왔습니다. Luna는 출시 때 1달러·6달러였다가 [7월 30일 80% 인하](/post/review-openweight-default-market-price-cut)로 0.2달러·1.2달러가 됐고, 이번에 다시 절반이 되면서 3개월이 안 돼 입력 단가가 10분의 1로 내려왔습니다.

## 작업 한 건의 값은 세 숫자의 곱입니다

API 청구서는 토큰 종류마다 단가와 쓴 양을 곱해 더합니다. 처음 읽는 새 입력, 이미 처리해 둔 앞부분을 다시 읽는 캐시 읽기, 다음 요청을 위해 앞부분을 저장하는 캐시 쓰기, 모델이 생각하고 답하며 만든 출력이 따로 매겨집니다. 가격 인하는 이 가운데 단가를 바꾸고, 쓴 양은 모델과 추론 설정이 정하며, 한 번에 끝나지 않은 일은 시도 횟수만큼 다시 곱해집니다.

| 곱하는 값 | 정하는 쪽 | 이번에 확인된 변화 |
| --- | --- | --- |
| 토큰 단가 | 가격표 | Opus 5.5 입력·출력 −20%, 캐시 읽기 −60% / Sol·Luna 약 −50% |
| 과제당 토큰 | 모델, 추론 설정, 하네스 | AA 기준 Opus 5.5 medium −11%, max +64% / Sol +7%, Luna +23% |
| 시도 횟수 | 성공률, 재시도 방식 | 앤트로픽 내부 보고서 과제 18번 중 16번 통과(Opus 5·Fable 5.1은 0번) |

추론 설정(effort)은 모델이 답하기 전에 얼마나 생각하고 도구를 몇 번 더 부를지 정하는 값입니다. Opus 5.5에는 low부터 max까지 다섯 단계가 있고, 앤트로픽 발표문은 medium을 기본값으로 적었습니다. [Claude Code 팀의 설명](/post/review-claude-code-model-and-effort-knobs)대로 단계를 올리면 생각이 길어지는 데서 그치지 않고 파일을 더 읽고 테스트를 더 돌리기 때문에, 과제당 토큰은 설정 하나로도 몇 배씩 움직입니다.

## 40%는 medium에서 나온 숫자였습니다

AA는 평가 10개를 묶은 지능 지수를 모델과 설정마다 돌리고, 과제 하나에 든 비용을 입력·캐시·출력 토큰 값으로 계산해 공개합니다. 9월 23일 보관본에서 Opus 5와 Opus 5.5를 설정별로 정리하면 이렇습니다.

| 모델(설정) | AA 지능 지수 | 과제당 출력 토큰 | 과제당 비용 |
| --- | --- | --- | --- |
| Opus 5 (medium) | 45 | 2만 8,977개 | 2.19달러 |
| Opus 5.5 (medium) | 51 | 2만 5,745개 | 1.34달러 |
| Opus 5 (max) | 51 | 7만 2,511개 | 5.86달러 |
| Opus 5.5 (max) | 58 | 11만 9,166개 | 5.98달러 |

medium끼리 견주면 과제당 비용은 2.19달러에서 1.34달러로 39% 줄었습니다. 앤트로픽이 말한 40%와 거의 같은 값이고, 점수도 45점에서 51점으로 올랐습니다. 한데 max끼리 놓으면 5.86달러와 5.98달러로 Opus 5.5가 2% 비쌉니다. 과제 하나에 쓴 출력 토큰이 1.6배로 늘어 단가 인하분을 다시 채웠고, AA도 발표 당일 글에 출력 토큰이 1.6배인데도 과제당 비용은 Opus 5와 비슷하다고 적었습니다.

같은 점수를 얻는 값으로 보면 차이가 커집니다. Opus 5.5 medium은 Opus 5 max와 같은 51점을 1.34달러에 냈는데, 5.86달러의 23%입니다. Opus 5.5 high는 54점을 1.82달러에 받아, 53점인 Fable 5.1 max(7.63달러)와 GPT-6 Astra max(3.26달러)보다 적게 썼습니다.

앤트로픽도 9월 25일 개발자 블로그에서 40%의 조건을 풀어 썼습니다. 애디 오스마니는 이 숫자가 토큰으로 과금되는 일반 작업을 기본 설정으로 돌렸을 때의 추정이고, 20% 내린 단가 위에 medium에서 과제당 토큰이 줄어드는 효과를 더한 값이라고 적었습니다. 같은 단계라도 Opus 5.5는 Opus 5보다 턴마다 더 많이 생각하고 그 차이가 xhigh와 max에서 가장 커서, Opus 5에서 고른 단계를 그대로 옮기지 말라는 당부도 붙였습니다. 기본값도 Opus 5의 high에서 Opus 5.5의 medium으로 한 단계 내려갔고, 기본값끼리 AA 값을 견주면 과제당 3.61달러와 1.34달러로 63% 차이가 나며 점수는 48점과 51점입니다.

![Artificial Analysis 지능 지수 막대그래프에서 Claude Opus 5.5 max가 58점으로 1위, Fable 5.1과 GPT-6 Astra가 53점, Opus 5가 51점이고, 아래 산점도는 과제당 비용(로그 축)과 지수를 모델·설정별로 찍은 도표](https://pbs.twimg.com/media/HS1aD-XakAElMdk.jpg)

점수표를 누가 쟀는지도 갈립니다. 앤트로픽 표에서 Opus 5.5의 Terminal-Bench 4.0(터미널에서 여러 단계 실무를 끝내는지 보는 평가)은 xhigh 설정 66.4%이고, AA가 자기 틀로 잰 max 점수는 59.6%입니다. AA 측정에서도 Opus 5.5는 이 평가에서 선두 GPT-6 Astra와 같은 수준이었고 Opus 5보다 11점 높았습니다.

## 줄어든 돈의 70%는 캐시 읽기에서 나왔습니다

에이전트는 일하는 동안 같은 지시문과 도구 설명, 앞선 대화를 매 턴 모델에 다시 보냅니다. 이미 처리한 앞부분을 저장해 두고 싸게 다시 읽는 것이 캐시 읽기이고, 앤트로픽은 발표문에서 캐시 읽기가 에이전트·코딩 작업 비용의 대부분을 차지한다고 적었습니다. AA의 비용 내역을 열어 보면 Opus 5 max 과제당 5.86달러 가운데 3.16달러(54%)가 캐시 읽기였고, GPT-6 Sol max도 1.06달러 가운데 49%가 캐시 읽기였습니다.

| 과제당 비용 내역(AA, medium) | Opus 5 | Opus 5.5 |
| --- | --- | --- |
| 캐시 읽기 | 1.009달러 | 0.410달러 |
| 캐시 쓰기 | 0.327달러 | 0.309달러 |
| 새 입력 | 0.129달러 | 0.103달러 |
| 출력(추론 포함) | 0.724달러 | 0.515달러 |
| 합계 | 2.190달러 | 1.336달러 |

medium에서 과제 하나당 줄어든 0.85달러 가운데 0.60달러가 60% 내린 캐시 읽기에서, 0.21달러가 출력에서 나왔습니다. 출력은 과제당 토큰이 11% 줄고 단가가 20% 내린 결과입니다. 캐시 읽기에서 줄어든 돈이 출력에서 줄어든 돈의 2.9배입니다.

앤트로픽 글의 예시 세션(캐시 읽기 200만, 새 입력 20만, 출력 6만 토큰)에 두 모델의 가격표만 적용하면 3.50달러가 2.40달러로 31% 줄어듭니다. 앤트로픽은 캐시 읽기가 대부분인 세션은 입력 비용이 최대 60%, 캐시 없이 긴 답을 받는 짧은 질문은 최대 20% 줄어든다고 설명했습니다. 같은 토큰을 쓰는 세션이라도 캐시 비중에 따라 인하 폭이 20%에서 60% 사이로 움직입니다.

max에서는 캐시 읽기 단가가 60% 내렸는데도 캐시 읽기 비용은 3.16달러에서 2.42달러로 23%만 줄었습니다. AA 지수 전체를 돌리며 Opus 5.5 max가 읽은 입력 토큰은 110억 개로 Opus 5 max(55억 개)의 두 배였습니다. 설정을 올리자 모델이 파일을 더 읽고 턴을 더 돌았고, 싸진 단가만큼 읽는 양이 늘었습니다.

오픈AI도 같은 날 캐시를 손봤습니다. GPT-6부터 기본 캐시 적중률을 높였고, 대화 중간에 추론 강도를 바꾸거나 도구를 켜고 꺼도 앞부분 캐시가 유지되게 했습니다. 깃허브는 이 개선으로 지난 몇 달 동안 수십억 건의 요청에서 새로 처리해야 하는 프롬프트 토큰 비중이 50% 넘게 줄었다고 밝혔습니다. 캐시를 지키는 프롬프트 구조는 [앤트로픽이 9월 8일 공개한 비용 절감법](/post/review-anthropic-claude-cost-optimization)에 자세히 나옵니다.

## Sol·Luna의 절반은 가격표에서 나왔습니다

오픈AI는 한국 시각 9월 23일 새벽 3시 12분 공식 계정에 두 모델을 올렸습니다. [GPT-6 Astra](/post/news-gpt6-astra-launch-arc-agi3)와 비슷한 방법으로 훈련해 전문 업무, 사실성, 코딩, 컴퓨터 사용, 정렬의 개선을 더 빠르고 싼 모델로 옮겼고, 캐시와 추론을 효율화해 아낀 비용을 가격으로 돌려준다는 설명입니다. ChatGPT Work와 Codex에서는 Plus, Pro, Business, Enterprise, Edu 사용자에게, API에서는 gpt-6-sol과 gpt-6-luna라는 이름으로 열렸습니다.

AA 측정에서 과제당 비용은 Sol max가 1.99달러에서 1.06달러로 47%, Luna max가 0.18달러에서 0.068달러로 62% 줄었습니다. 과제당 출력 토큰은 Sol이 2만 9,309개에서 3만 1,238개로, Luna가 4만 1,235개에서 5만 537개로 오히려 늘었고, AA는 비용 감소가 가격 인하에서 나왔다고 적었습니다. 지능 지수는 Sol이 47점에서 48점, Luna는 37점 그대로였습니다.

AA는 9월 24일 새벽 이번 주 새 모델들이 지수 대비 비용의 효율 경계에 새 점 11개를 찍었다고 정리했습니다. Luna가 다섯 설정, Opus 5.5가 네 설정, Sol과 샤오미 MiMo-V2.6-Pro가 하나씩이었습니다. 같은 정리에서 Luna max는 37점에 0.068달러, Sol max는 48점에 1.06달러였고, [MIT 라이선스로 풀린 샤오미 MiMo](/post/news-xiaomi-mimo-v26-open-weights)의 Pro는 46점을 Sol의 8분의 1인 0.13달러에 냈습니다.

한데 같은 AA 글에는 내려간 항목도 있습니다. 44개 직업의 실무 결과물을 비교 채점하는 GDPval-AA에서 Sol은 Elo가 약 100점, Luna는 약 75점 떨어졌고, 몇 주짜리 업무 프로젝트를 재는 AA-Briefcase에서 Luna가 약 45점 내려갔습니다. AA 팀이 결과물 수백 건을 직접 열어 본 결과, 짧아진 산출물이 채점표가 요구하는 항목을 더 자주 빠뜨렸고 발표 품질도 낮아졌습니다. 오픈AI는 발표문에서 Astra처럼 답이 조금 짧아지고 군더더기가 줄었다고 소개했는데, 코딩 대화에서 장점으로 내세운 이 변화가 보고서형 업무에서는 감점으로 돌아왔습니다.

사실성 평가에서는 방향이 반대였습니다. AA의 지식·환각 평가에서 Sol max의 환각률은 92%에서 60%로 내려갔는데, 답을 시도하는 비율을 99%에서 83%로 줄인 결과라 정답률도 59%에서 54%로 함께 내려갔습니다. AA는 이렇게 해서 틀린 답이 약 4분의 1 줄었다고 적었습니다.

## 한 번에 끝나지 않으면 값이 곱해집니다

과제당 비용은 한 번 시도한 값입니다. 과제를 한 번씩 돌려 성공률만큼 맞혔다면, 맞힌 과제 하나에 든 돈은 시도 1회 비용을 성공률로 나눈 값입니다. 오픈AI 발표문의 AutomationBench(영업·재무·인사 업무 흐름을 도구 47개로 끝까지 해내는지 보는 평가) 표로 계산하면 이렇습니다.

| 모델(설정) | 성공률 | 시도 1회 비용 | 성공 1건당 비용 |
| --- | --- | --- | --- |
| GPT-6 Sol (xhigh) | 33.2% | 0.27달러 | 약 0.81달러 |
| GPT-6 Astra (low) | 30.3% | 약 1.05달러 | 약 3.48달러 |
| Claude Opus 5 (max) | 26.9% | 약 3.00달러 | 약 11.14달러 |

오픈AI는 Astra와 Opus 5의 비용을 Sol의 3.9배, 11.1배로 공개했고, 표의 달러 값은 그 배수에 0.27달러를 곱한 것입니다. 시도 1회 비용에서 Opus 5 max는 Sol의 11.1배였지만, 성공 1건으로 나누면 13.7배가 됩니다. 이 표의 비교 대상은 같은 날 나온 Opus 5.5가 빠진 Opus 5이고, 앤트로픽 표에서 Zapier가 돌린 같은 평가의 Opus 5.5 점수는 40.0%입니다. 앤트로픽은 이 평가의 과제당 비용을 도표로만 공개해 같은 계산을 할 수 없습니다.

앤트로픽 글은 재시도의 값도 계산해 보였습니다. high 설정이 과제 하나에 생각 토큰 2만 개를 더 쓰면 Opus 5.5에서 0.40달러이고, 캐시된 문맥 10만 토큰으로 10턴을 도는 재시도 한 번이 비슷한 값이라는 예시입니다. 그래서 high는 재시도를 한 번 줄이는 과제에서 제값을 하고, medium으로 한 번에 끝날 과제에서는 그대로 낭비가 된다고 적었습니다.

성공이 0번이면 성공 1건당 비용은 계산할 수조차 없습니다. 앤트로픽은 실적 발표문을 찾기 어렵게 만든 웹 사본만 주고 분기 보고서를 쓰게 한 뒤, 숫자나 인용을 하나라도 지어내면 탈락시키는 내부 시험을 돌렸습니다. Opus 5.5는 여러 추론 설정에 걸쳐 18번 중 16번 통과했고, Fable 5.1과 Opus 5는 한 번도 통과하지 못했습니다. 웹 앱의 모든 페이지 로딩 시간을 줄이라는 과제에서도 Opus 5.5는 40번 중 39번 성공했고, Opus 5는 개선 폭이 작으면서 앱의 동작까지 바꿨습니다.

제가 공개 3일 동안 정리한 [Opus 5.5 결과물 65건](/post/review-opus55-showcase-first-72-hours) 가운데 앞의 40건에서 비용을 적은 사례는 1건이었고, 몇 번 시도한 끝에 나온 결과인지 적은 사례는 없었습니다. 라이언 세일(@RyanSael)은 카메라 초점의 원리를 설명하는 인터랙티브 렌즈 실험실을 만들어 달라고 한 번 요청했고, Opus 5.5가 1시간 26분 동안 만든 결과에 API 비용 25.66달러가 들었다고 9월 23일 올렸습니다. 초점 링을 돌리면 유리 렌즈들이 움직이면서 초점이 맞는 면이 화면 속을 앞뒤로 옮겨 가고, 세일은 이 결과가 요청 한 번으로 나왔다고 적었습니다.

## 코드가 짧아지자 검수할 양도 줄었습니다

코드 품질 분석 회사 Sonar는 출시 전 빌드로 Opus 5.5(high)와 Opus 5(Thinking)에 같은 자바 과제 4,444개를 풀게 하고, 결과 코드를 자사 분석기 SonarQube로 훑은 결과를 발표 당일 공개했습니다. 실행 테스트가 딸린 544개 과제로 통과율을 따로 쟀습니다.

| 항목 | Opus 5 | Opus 5.5 |
| --- | --- | --- |
| 생성한 코드 | 91만 6,813줄 | 66만 4,890줄(−27.5%) |
| 출력 토큰 | 2,171만 개 | 1,296만 개(−40%) |
| 테스트 통과율(544개 과제) | 88.6% | 87.68% |
| 발견 항목 합계 | 1만 8,814건 | 1만 941건(−42%) |
| 버그 수 | 528건 | 428건(−19%) |
| 100만 줄당 버그 | 576건 | 644건(+12%) |
| 100만 줄당 동시성 버그 | 205건 | 295건(+44%) |

출력 토큰에 두 모델의 출력 단가를 곱하면 약 543달러와 259달러로, 이 벤치마크의 출력 비용은 52% 줄어듭니다. Sonar는 Opus 5 실행에서 추론 토큰 항목이 기록되지 않았다고 밝혀, 이 계산은 두 실행에 모두 기록된 출력 토큰으로만 한 것입니다. 입력 토큰은 두 실행 모두 약 207만 개로 같았습니다.

검수하는 사람 쪽에서는 읽을 코드가 27.5%, 분류할 발견 항목이 42% 줄었습니다. 한데 줄당 버그는 12% 늘었고, 재현하기 어려운 동시성(스레드) 버그가 44% 늘어 가장 큰 버그 범주가 됐습니다. 테스트가 딸린 과제에서 여덟 개 중 하나꼴로 여전히 테스트를 통과하지 못한다는 점도 Opus 5와 같았습니다.

> 코드 검증이 필요 없어지지는 않습니다. 코드가 적고 발견 항목이 적어 검증이 더 싸집니다.
> — Sonar, Claude Opus 5.5 평가 보고서

## 비용을 줄였다는 회사들은 턴 수를 적었습니다

앤트로픽 발표문에는 초기 테스터들의 평가가 실려 있습니다. 앤트로픽이 골라 실은 말이지만, 비용이 줄었다고 한 회사들은 대부분 같은 일을 더 적은 턴과 호출로 끝냈다고 적어 과제당 토큰과 시도 횟수가 함께 줄었습니다.

| 회사 | 밝힌 변화 |
| --- | --- |
| 옵티버 | 에이전트 코딩 과제에서 Opus 5 품질을 턴·시간·출력 토큰 절반 정도로, 작업 비용 40~50% 감소 |
| 퀀티움 | 4일 동안 프롬프트 38개가 들던 코딩 과제를 3시간, 프롬프트 11개로 |
| 러버블 | 재시도에 갇히지 않고 단계 3분의 1에서 절반 감소 |
| 키로 | 명령줄 과제 공개 벤치마크에서 Opus 5보다 많이 풀면서 호출 약 40%, 토큰 절반 감소 |
| 빅터 | 같은 설정에서 과제당 단계와 도구 호출이 줄어 비용 거의 절반, 가장 어려운 과제 정답 2배 |

> 에이전트 코딩 과제에서 Claude Opus 5.5는 Opus 5와 같은 품질을 턴, 시간, 출력 토큰 절반 정도로 냈고, 그 작업의 비용을 40~50% 줄였습니다.
> — 노얀 톡고조글루, 옵티버 AI 엔지니어링 글로벌 총괄

## 국내 팀의 계산서에서 달라지는 것

모델을 바꾸는 날의 계산이 먼저 달라집니다. 같은 Opus 5.5라도 medium으로 돌리면 AA 기준 과제당 비용이 Opus 5보다 39% 낮고, max로 돌리면 Opus 5와 비슷합니다. 앤트로픽이 말한 40%는 기본 설정을 그대로 쓴다는 조건에서 나온 숫자이고, 설정을 올린 만큼 모델은 더 읽고 더 씁니다. 구독 요금제 쪽에서는 Pro·Max·Team과 좌석형 Enterprise의 5시간 사용 한도가 늘었고, 사용 한도 초기화 한 번을 저장해 두었다가 원하는 때 쓸 수 있게 됐습니다. 앤트로픽은 낮아진 단가가 구독 한도에도 반영돼 같은 한도로 Opus 5보다 약 25% 더 쓸 수 있다고 밝혔고, Claude Code 비용 문서 기준 엔터프라이즈 배포에서 개발자 한 명이 일한 날 하루 평균 지출은 약 13달러, 사용자 90%는 30달러 아래입니다.

국내에도 캐시 읽기가 청구서를 좌우한 기록이 있습니다. 29CM는 7월 상품 속성 추출 기능의 프롬프트를 고정 부분과 바뀌는 부분으로 나눠 캐시를 걸었고, 1주 측정에서 캐시 읽기 비중이 약 98%가 되면서 LLM 청구액이 64% 줄었습니다. 이번 Opus 5.5 가격표에서 가장 크게 내려간 값도 캐시 읽기(60%)입니다.

Luna는 가장 싼 단가를 달았지만 과제당 출력 토큰이 23% 늘었고, AA의 코딩 에이전트 지수는 2점 내려갔습니다. Luna의 하락은 코드베이스 질의응답 평가 SWE-Atlas-QnA(49%→44%)와 DeepSWE v1.1(66%→64%)에서 나왔습니다. Sol은 같은 지수에서 2점 올랐고 과제당 2.99달러로 GPT-5.6 Sol의 절반을 썼습니다.

오픈AI는 같은 발표문에서 사내 연구자가 API 가격으로 따져 하루 중앙값 600달러, 상위 10%는 7,000달러가 넘는 토큰을 쓴다고 밝혔습니다. AA 지수에서 Opus 5.5의 과제당 비용은 medium 1.34달러, max 5.98달러로 4.5배 차이가 났으니, 이만한 규모에서는 설정 하나가 가격표의 20% 인하보다 청구서를 크게 움직입니다. 앤트로픽은 같은 개선 상당수를 담은 Sonnet 5.5와 Haiku 5.5를 몇 주 안에 내놓겠다고 밝혔습니다.

같은 날 Cursor는 모델과 가격을 그대로 둔 채 시스템 프롬프트를 덜어 토큰 요금을 7% 줄였고, Claude Code 팀은 추론 설정을 언제 올리고 내릴지 실험 결과를 냈습니다.

읽어 주셔서 고맙습니다.

초이 드림
