이 글 어땠어요?
같은 모델에 안전장치의 강도만 다르게 걸었습니다. Fable 5.1은 모든 사용자와 플랫폼에 열렸고, Mythos 5.1은 사이버 방어 인력과 생명과학자를 심사하는 신뢰 접근 프로그램으로만 제공되며 지금은 미국 기관 일부만 쓸 수 있습니다.
100만 토큰당 입력 10달러, 출력 50달러는 그대로이고 캐시 읽기만 1달러에서 0.25달러로 내렸습니다. 앤트로픽은 8월 사용량 기준으로 일반 작업 비용이 약 25%, 에이전트 작업은 최대 약 45% 줄어든다고 계산했습니다.
앤트로픽이 공개한 곡선에서는 low와 medium 설정의 Fable 5.1이 Fable 5 수준의 점수를 절반 이하의 비용으로 냈습니다. Cognition의 FrontierCode 측정에서는 medium의 점수가 가장 높았고 더 높은 설정에서는 오히려 내려갔습니다. Claude Code의 기본값은 high입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
앤트로픽이 10월 7일 Claude Haiku 5.5를 GPT-6 Luna와 같은 입력 0.1달러·출력 0.5달러에 내놨습니다. 10만 토큰이 넘는 요청은 5배를 받고, AA 지수는 43점에 과제당 비용은 Luna의 3배인 0.21달러였습니다.

앤트로픽이 9월 28일 Claude Sonnet 5.5를 GPT-6 Sol과 같은 입력 2달러·출력 10달러에 공개했습니다. 독립 평가 지수는 56점으로 Opus 5.5에 2점 뒤졌고, 최고 강도에서는 과제당 비용이 7.60달러로 Opus 5.5보다 27% 더 들었습니다.
앤트로픽이 7월 24일 Claude Opus 5를 공개했습니다. Frontier-Bench v0.1에서 43.3%로 Fable 5를 앞섰고 ARC-AGI-3에서는 30.2%를 기록했지만, 독립 측정으로 과제당 비용은 Fable 5보다 26% 낮은 데 그쳤습니다.

앤트로픽이 10월 7일 Claude Haiku 5.5를 GPT-6 Luna와 같은 입력 0.1달러·출력 0.5달러에 내놨습니다. 10만 토큰이 넘는 요청은 5배를 받고, AA 지수는 43점에 과제당 비용은 Luna의 3배인 0.21달러였습니다.

앤트로픽이 9월 28일 Claude Sonnet 5.5를 GPT-6 Sol과 같은 입력 2달러·출력 10달러에 공개했습니다. 독립 평가 지수는 56점으로 Opus 5.5에 2점 뒤졌고, 최고 강도에서는 과제당 비용이 7.60달러로 Opus 5.5보다 27% 더 들었습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@claudeaiX 게시물 · 원문 보기
공지는 Claude 공식 X 계정에 영상과 함께 올라왔습니다. 두 모델은 같은 모델이고 걸어 둔 안전장치의 강도만 다릅니다. Fable 5.1은 Claude 앱과 Claude Code, API는 물론 아마존 웹서비스와 구글 클라우드, 마이크로소프트 애저에서도 같은 날 열렸고, API 모델 이름은 claude-fable-5-1입니다. Mythos 5.1은 사이버 방어 인력과 생명과학자를 심사해 여는 신뢰 접근 프로그램으로만 제공되며, 지금은 미국 기관 일부만 쓸 수 있습니다.
앤트로픽은 발표문 첫머리에서, 고객들이 가격과 데이터 보관, 안전장치를 두고 보낸 의견에 이번 모델로 답한다고 적었습니다. 성능 표보다 이 세 가지가 먼저 나온 까닭은 Fable 5가 출시된 6월 9일부터 12주 동안 세 가지 모두에서 문제가 불거졌기 때문입니다.
Fable 5는 앤트로픽이 일반 사용자에게 처음 연 Mythos급 모델입니다. 값은 100만 토큰당 입력 10달러, 출력 50달러였고, 출시 3일 만인 6월 12일 미국 수출통제로 전 세계에서 꺼졌다가 7월 1일 다시 열렸습니다. 그 경과는 수출통제가 걸리고 풀리기까지의 18일에 정리했습니다.
7월 24일에는 한 단계 아래 등급인 Opus 5가 나왔습니다. 앤트로픽은 Opus 5를 Fable 5에 가까운 지능을 절반 가격(입력 5달러, 출력 25달러)에 주는 모델로 소개했고, Claude Max 요금제의 기본 모델로 올렸습니다. 이번 발표의 비교표를 보면 Opus 5는 일곱 개 평가 가운데 다섯 개에서 Fable 5보다 높은 점수를 받았습니다. Fable 5가 앞선 것은 Humanity's Last Exam과 CursorBench 두 곳이었고, 그마저 차이는 0.2~1.2점이었습니다.

Fable 5.1은 이 표의 모든 줄에서 1위를 되찾았습니다. 터미널에서 과학 연구 과제를 끝까지 수행하는 Terminal-Bench-Science 0.1은 52.6%로 Fable 5(24.7%)의 두 배를 넘었고, 터미널 코딩 평가 Terminal-Bench 4.0은 55.8%로 Opus 5(52.3%)와 GPT-5.6 Sol(37.3%)을 앞섰습니다. 업무 자동화 평가 AutomationBench는 31.4%로 Fable 5의 17.1%보다 14.3점 높습니다.
고객 쪽 사정은 발표문에 실린 추천사에 드러납니다. 코딩 에이전트 Devin을 만드는 Cognition은 그동안 비용 때문에 Opus에 남겨 둔 작업이 있었는데 새 캐시 요금 덕에 Fable급 모델이 마침내 수지가 맞게 됐다고 적었습니다. Cognition은 출시 당일 Devin의 Opus 5 트래픽을 Fable 5.1로 옮기고 코드 리뷰부터 시작한다고 밝혔습니다.
Claude 모델에는 추론 설정(effort)이 다섯 단계 있습니다. low, medium, high, xhigh, max 순서로 올라가고, 설정이 높을수록 모델이 답하기 전에 더 오래 생각하고 파일을 더 읽고 테스트를 더 돌립니다. 설정을 한 단계 올릴 때 토큰이 몇 배로 불어나는 구조는 Claude Code의 노력 설정을 잰 글에서 다뤘습니다. Fable 5.1의 기본값은 Claude Code에서 high, Claude Cowork와 Claude 앱에서는 medium입니다.
앤트로픽은 이번에 평가마다 다섯 단계의 점수와 과제당 평균 비용을 곡선으로 그려 공개했습니다. 가로축이 비용, 세로축이 점수라서 곡선이 왼쪽 위로 갈수록 적은 돈으로 높은 점수를 냅니다.

Terminal-Bench-Science에서 Fable 5의 곡선은 high(34.3달러, 25.0%)에서 멈췄습니다. xhigh와 max로 올려 돈을 더 써도 점수는 23.4%, 24.7%로 오히려 내려갔습니다. Fable 5.1은 low의 11.1달러에서 이미 26.3%로, 점수만 놓고 보면 Fable 5의 모든 설정보다 높았고 max에서는 Fable 5 max보다 적은 37.9달러로 52.6%를 받았습니다.
다른 평가에서도 곡선의 모양은 같았습니다. 비슷한 점수를 받는 데 든 과제당 비용을 설정별로 짝지으면 이렇습니다.
| 평가 | Fable 5.1 | 직전 모델 | 비용 |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | low 26.3% · 11.1달러 | Fable 5 max 24.7% · 44.1달러 | 4분의 1 |
| Terminal-Bench 4.0 | low 40.2% · 5.7달러 | Mythos 5 high 38.9% · 17.9달러 | 3분의 1 |
| CursorBench 3.2.0 | high 69.4% · 4.8달러 | Fable 5 xhigh 68.4% · 11.7달러 | 5분의 2 |
| Humanity's Last Exam(도구 사용) | medium 63.0% · 0.67달러 | Fable 5 high 63.2% · 1.42달러 | 절반 이하 |
표의 값은 앤트로픽 발표 페이지의 곡선 자료에서 옮겼습니다. Terminal-Bench 4.0 곡선에는 Fable 5 대신, 같은 모델에 안전장치를 덜 건 Mythos 5가 실려 있습니다.
설정을 낮춰도 점수가 버틴 데 더해, 청구서를 크게 줄인 것은 요금표의 한 줄입니다. 에이전트는 턴마다 지금까지의 대화와 읽은 파일을 통째로 모델에 다시 보냅니다. 프롬프트 캐시는 한 번 처리한 앞부분을 저장해 두었다가 다음 턴에 싸게 읽게 하는 기능이고, Fable 5는 이 캐시 읽기에 100만 토큰당 1달러를 받았습니다. Fable 5.1은 이것을 0.25달러로 내리고 입력 10달러와 출력 50달러는 그대로 뒀습니다.
캐시가 과제 하나의 비용에서 얼마를 차지하는지는 Cognition이 쟀습니다. 코딩 평가 FrontierCode의 과제 하나를 Fable 5.1로 풀면 캐시에서 약 300만 토큰을 읽고, 캐시에 없던 입력은 약 7만 토큰, 출력은 약 2만 1,000토큰을 씁니다. 같은 과제에서 Opus 5는 캐시를 약 450만 토큰 읽었고, 두 모델 모두 전체 토큰의 95% 넘게가 캐시 읽기였습니다.
@cognitionX 게시물 · 원문 보기
그래서 출력 단가가 Opus 5의 두 배인 Fable 5.1이 과제당 비용에서는 더 쌌습니다. Cognition의 측정(추론 설정 medium)에서 과제당 비용은 Fable 5가 5.84달러, Opus 5가 3.51달러, Fable 5.1이 2.68달러였고, 점수는 각각 62.8, 63.6, 63.6이었습니다. Opus 5의 캐시 읽기 요금은 100만 토큰당 0.5달러로 Fable 5.1의 두 배이고, 같은 과제를 끝내는 데 쓴 토큰도 Fable 5.1이 33% 적었습니다.
@walden_yanX 게시물 · 원문 보기
Cognition 공동창업자 월든 얀은 이 결과를 두고 Fable이 Opus보다 싸졌다며 대이변이라고 적었습니다. 뉴스레터와 소프트웨어를 만드는 Every의 댄 시퍼 CEO도 발표문 추천사에서, Fable 5.1이 Opus 5보다 두 배쯤 빠르고 토큰은 절반만 썼다며 Fable급 지능을 Opus급 가격에 쓰는 모델이라고 평했습니다.

앤트로픽이 8월 4주 동안의 실제 사용량을 기본 추론 설정으로 다시 계산한 결과도 같은 방향을 가리킵니다. 일반 작업에서는 Fable 5 비용 100 가운데 40이 캐시 읽기였는데, Fable 5.1에서 이 부분이 11로 줄어 전체가 75가 됐습니다. 도구를 많이 쓰고 맥락이 긴 에이전트 작업에서는 캐시 읽기가 65에서 17로 줄어 전체가 55가 됐습니다. 캐시를 뺀 나머지 비용은 60에서 64로, 35에서 38로 오히려 조금 늘었습니다. 절감은 전부 캐시 한 줄에서 나왔고, 캐시를 거의 쓰지 않는 짧은 대화에는 이번 인하가 닿지 않습니다.
턴 사이에 캐시가 만료되느냐 마느냐로 같은 세션의 비용이 39% 갈린 우버의 계산도 같은 원리에서 나왔습니다. 에이전트가 긴 작업을 할수록 청구서에서 캐시 읽기가 차지하는 비중이 커지고, 이번 인하의 효과도 그만큼 커집니다.
다만 low 설정의 26.3%와 Fable 5 max의 24.7%는 오차 범위 안의 차이입니다. 앤트로픽은 이 평가의 표준오차가 모델마다 ±3.5~4.5점이라고 각주에 적었고, 발표문 본문도 낮은 설정의 Fable 5.1이 Fable 5와 「비슷하거나 더 나은」 결과를 낸다고 표현했습니다. 공개 리더보드(과제당 3회 시도, Claude Code 하네스)에는 Fable 5가 21.4%로 올라 있고, 앤트로픽이 자체 설정으로 다시 잰 값이 24.7%였습니다.
점수는 운영용 안전장치를 켠 채로 쟀습니다. 안전장치가 개입한 과제는 OSWorld에서 0점으로 처리했고(Fable 5는 AutomationBench도 0점), 나머지 평가에서는 사이버 보안 과제를 Opus 4.8이, 생물학 과제를 Opus 5가 대신 풀었습니다. Terminal-Bench 4.0에서 같은 모델인 Mythos 5.1이 60.9%로 Fable 5.1보다 5.1점 높은 것도 예전의 덜 정밀한 사이버 안전장치가 개입한 과제에서 나온 차이이고, 앤트로픽은 이번에 안전장치를 다듬은 만큼 두 모델의 차이가 훨씬 줄어들 것으로 본다고 적었습니다.
설정을 높인다고 늘 점수가 오르지도 않았습니다. Cognition이 운영하는 FrontierCode 리더보드에서 Fable 5.1의 점수는 medium에서 가장 높았고, 그보다 높은 설정에서는 Fable 5보다 낮아졌습니다. 이 평가는 코드가 실제로 병합될 만한지를 보는데, 설정을 올린 Fable 5.1이 과제에 필요 없는 파일까지 손대는 일이 잦아 작업 범위 기준에서 감점을 받았습니다. 통과율 자체는 설정을 올릴수록 계속 올랐다고 Cognition은 덧붙였습니다.
비용 절감률에도 조건이 붙습니다. 25%와 45%는 앤트로픽이 기본 추론 설정으로 자사 8월 사용량을 계산한 값이고, 과제당 54% 절감은 Cognition의 평가 과제에서 나왔습니다. Cognition은 실제 업무에서 Devin 사용자가 볼 절감을 10~25%로 잡았습니다.
Fable 5를 두고 나온 불만 가운데 하나는 대체 응답이었습니다. Fable 5는 사이버 보안이나 생물학 관련 요청으로 보이면 답을 한 단계 아래 모델로 넘겼고, 앤트로픽 스스로 6월 성명에서 안전장치가 너무 넓다는 사용자 불만이 많을 만큼 강하게 걸었다고 적었습니다. 7월 1일 재배포 때는 새 분류기가 붙어 평범한 코딩과 디버깅 요청도 더 자주 Opus 4.8로 넘어갔습니다.
Fable 5.1의 사이버 안전장치는 정상 요청을 잘못 막는 일이 이전보다 60% 적고, Claude Code 사용자가 세션마다 겪는 개입도 평균 약 60% 줄어든다고 앤트로픽은 밝혔습니다. 소프트웨어 취약점을 찾는 방어 작업도 이제 Fable 5.1에 맡길 수 있습니다. 취약점을 공격하는 익스플로잇 제작은 여전히 막히고, 침투 테스트와 익스플로잇 생성, 바이너리 취약점 스캔은 계속 Opus 모델로 넘어갑니다.
생물학 쪽 숫자는 8월 7일에 먼저 나왔습니다. 기초 생물학과 의학 질문에서 대체 응답이 약 85% 줄었고, 앤트로픽은 모든 이유를 합친 대체 응답이 Claude 앱에서 약 67%, Cowork에서 55%, Claude Code에서 17%, Claude Platform에서 7% 줄어들 것으로 봤습니다. 바이러스학이나 독성학, 분자 설계 같은 연구개발 질의는 지금도 Opus 5가 받습니다.
6월 30일 재배포 발표에는 새 분류기가 문제의 우회 기법을 99% 넘게 막는다는 숫자만 있었고, 정상 요청을 얼마나 잘못 막는지는 빠져 있었습니다. 이번에는 줄어든 비율 60%가 나왔지만, 오차단이 전체 요청의 몇 퍼센트인지는 여전히 공개되지 않았습니다.
앤트로픽은 Fable 5부터 Mythos급 모델의 모든 트래픽을 30일 동안 보관하도록 했습니다. 기록을 일정 기간 모아 두지 않으면 여러 요청과 계정에 걸친 공격을 잡을 수 없다는 이유였고, 이 데이터를 학습에는 쓰지 않는다고 밝혔습니다. 앤트로픽은 이번 발표에서 규제 산업 고객 상당수가 데이터가 남는 모델을 쓰기 어려워했다고 적었고, Cognition도 그동안 Fable 모델은 제로 데이터 보관(ZDR) 계약으로 쓸 수 없었다고 밝혔습니다.
새 방식인 Enterprise Frontier Safeguards(EFS)는 감시에 쓰는 활동 기록을 고객의 클라우드 계정(아마존 S3, 애저 Blob Storage, 구글 클라우드 스토리지)에 고객의 암호화 키로 둡니다. 자동 감시가 오용 신호를 찾으면 그 신호를 고객에게 보내고, 사람의 검토도 앤트로픽 직원 대신 고객 쪽 인력이 맡습니다. 앤트로픽은 이 구조를 금융, 의료, 제조, 통신, 법률, 유통, 공공 분야 고객 100곳 이상과 함께 설계했고, 그중에는 골드만삭스·모건스탠리·씨티·뱅크오브아메리카·웰스파고의 최고정보보호책임자들이 모인 ARC(시스템 위험 분석·회복력 센터)도 있었습니다.
기록은 웰스파고가 관리하는 환경에, 웰스파고가 관리하는 키로 남습니다. 데이터는 우리가 보관하고 탐지는 앤트로픽이 맡습니다.— 뮤니시 쿠마르 샤르마, 웰스파고 최고정보보호책임자
EFS는 올가을부터 단계적으로 열리고, 그 전까지 자격을 갖춘 고객은 Fable 5와 Fable 5.1을 ZDR로 쓸 수 있습니다. 지원 창구는 Claude Code, Claude Enterprise, Claude Platform, 아마존 Bedrock, AWS의 Claude Platform, 구글 Agent Platform, 마이크로소프트 Foundry입니다.
발표문에는 쓰는 방식에 닿는 변경이 두 가지 더 있습니다. 9월 1일 이후 만든 새 API 계정에서는 여러 턴 대화에서 Claude의 이전 사고 기록을 남긴 채 앞선 맥락을 손으로 고칠 수 없습니다. 앤트로픽은 이것이 널리 알려진 증류 기법(남의 모델 답을 대량으로 모아 자기 모델을 학습시키는 방법)을 막는 조치라고 설명했고, 기존 계정은 당장 영향이 없지만 앞으로 나올 모델부터는 모든 사용자에게 적용된다고 밝혔습니다. 앤트로픽은 6월 10일 미국 상원 은행위원회에 보낸 서한에서 알리바바 쪽 운영자들이 4월 22일부터 6월 5일까지 가짜 계정 약 2만 5,000개로 Claude와 2,880만 번 넘게 대화했다고 지목한 바 있습니다.
나머지 하나는 EU 규정에 따른 워터마크입니다. 앤트로픽은 7월 EU AI법의 AI 생성 콘텐츠 투명성 실천 강령에 다른 서명자 190곳과 함께 서명했고, 이에 따라 8월 2일 이후 출시한 모델의 출력에는 글에 Claude가 관여했을 가능성을 수치로 가려내는 표지가 눈에 보이지 않게 들어갑니다. Fable 5.1도 적용 대상입니다. 앤트로픽은 워터마크가 출력의 품질과 내용에 실질적 영향을 주지 않고 사용자 정보도 담지 않는다고 밝혔으며, 탐지 API는 규제 기관과 수사 기관, 언론, 팩트체커, 연구자, 교육 기관 등에 비공개 미리보기로 먼저 열었습니다.
발표문의 과학 결과는 대부분 Mythos 5.1이 냈습니다. 공개된 단백질 설계·접힘 도구를 쥐여 주자 Mythos 5.1은 표적 12개에 대해 결합체(표적 단백질에 달라붙는 작은 단백질)를 설계했고, 외부 기관 두 곳이 실제로 만들어 확인한 적중률이 50%에 가까웠습니다. 이 분야의 통상 적중률은 10~15%이고, 표적 세 곳에서는 Adaptyv Bio 설계 대회에 제출된 최고 설계보다 결합력이 10배 높았습니다.

2주 전인 8월 18일 공개한 직전 실험에서는 표적 15개 중 14개에서 결합이 확인됐고, 적중률은 조건에 따라 22.6~35.1%였습니다. 앤트로픽이 공개한 최고 적중률은 2주 만에 35.1%에서 50% 가까이로 올라갔습니다.
Fable 5.1은 30여 년 전 나사 마젤란 탐사선이 찍은 레이더 영상으로 신경망을 학습시켜 금성 표면 3분의 1의 고도 지도를 새로 만들었습니다. 10~20킬로미터 단위로만 보이던 지형이 2~3킬로미터 단위까지 드러났고, 높이 정확도는 최대 25% 좋아졌습니다. 앤트로픽은 NASA의 VERITAS와 유럽우주국의 EnVision 탐사를 앞두고 이 지도를 크리에이티브 커먼즈 라이선스로 공개했습니다.
Mythos 5.1은 공개 소스 코드만 보고 맞춤 GPU 커널을 짜서 오픈소스 생물학 모델 7개를 엔비디아 H100에서 1.4~2.5배 빠르게 돌렸고, 출력은 원본과 같았습니다. 유전자 2만 개 주변의 모든 변이를 훑는 분석에서 Enformer의 추정 GPU 비용은 3만 달러에서 2만 1,000달러로, 임상 변이 300만 개를 보는 Evo 2(400억 파라미터)는 1만 8,000달러에서 8,000달러로 줄었습니다. 투자회사 밀레니엄은 100만 번에 한 번꼴로 나던 시스템 충돌의 원인을 4~5년 동안 찾지 못했는데, Fable 5.1이 외부 공급사 라이브러리를 역어셈블해 코어 덤프와 대조한 끝에 그 라이브러리의 버그를 찾아냈다고 전했습니다.
Fable 5.1은 한국에서도 공개 당일부터 Claude 앱과 Claude Code, API로 쓸 수 있습니다. 바뀐 요금은 캐시 읽기 한 줄이라서, 캐시 비중이 큰 코딩 에이전트를 API로 돌리는 팀일수록 청구서 변화가 큽니다. Claude Code의 기본 설정은 high인데, 앤트로픽 곡선에서는 low와 medium이 Fable 5 수준의 점수를 훨씬 싸게 냈고 Cognition의 측정에서는 medium이 최고점이었습니다.
Mythos 5.1은 지금 미국 기관 일부만 쓸 수 있어서, 6월 Glasswing 프로그램에 참여했던 SK텔레콤·삼성전자·한국인터넷진흥원 같은 국내 기관도 아직 대상이 아닙니다. 앤트로픽은 미국 정부와 협의해 국내외 파트너로 넓히겠다고만 밝혔습니다. 9월 1일 이후 새로 만든 API 계정에서 Claude의 사고 기록을 남긴 채 앞선 대화를 고쳐 쓰는 연동을 만들던 팀은 증류 방어 조치의 영향을 받습니다.
앤트로픽은 Fable 5.1의 개선점을 나머지 모델 제품군에도 옮기는 작업을 하고 있다고 밝혔고, 생명과학 검증 프로그램의 과학자 등록과 사이버 검증 프로그램의 Mythos급 모델 확대, GPU 최적화 코드의 오픈소스 공개를 차례로 예고했습니다. 경쟁사 오픈AI는 차기 모델 Astra의 사이버 능력을 이유로 8월 7일 내부 개발 일부를 멈췄고, 업계에서는 Astra가 이번 주 공개될 수 있다는 관측이 나옵니다. Astra가 나오면 이번 비교표에는 열이 하나 늘어납니다.
읽어 주셔서 고맙습니다.
초이 드림