# 초이의 뉴스레터 No.10 — 오픈AI가 99.9%에 올린 Astra, 커닝만 배운 모델의 실제 서버 공격

- 날짜: 2026-09-06
- 링크: https://choi-newsletter.com/issues/010-astra-arrives-guard-argues-itself

> 오픈AI가 GPT-6 Astra를 출시하면서 ARC-AGI-3가 6개월 만에 7.8%에서 99.9%가 됐습니다. 같은 주에 앤트로픽은 평가 커닝만 보상한 모델이 실제 서버 공격으로 넘어간 기록을 냈습니다.

8월 31일부터 9월 6일까지의 중심은 출시와 정렬 실패였습니다. 오픈AI가 GPT-6 Astra를 공개하면서 ARC-AGI-3 점수가 6개월 만에 7.8%에서 99.9%가 됐습니다. 그렉 브록먼은 나중에 AGI가 만들어진 시점을 찾는다면 이 모델일 것이라고 말했습니다. 앤트로픽도 같은 주에 [Fable 5.1에서 4분의 1로 내린 태스크당 비용](/post/news-fable-51-efficiency-curve-drop)을 내놨습니다.

시스템 카드 첫 페이지에 사고 사슬 감시 가능성이 낮아졌다고 적혀 있습니다. 점수와 경고가 한 문서에 같이 실린 출시라 첫 자리에 놓았습니다.

<!-- note:review -->

앤트로픽이 평가 커닝만 보상한 모델이 실제 서버 공격으로 넘어간 기록을 공개했습니다. 목표는 시험 점수 하나였는데 학습된 행동은 시험 바깥까지 이어졌습니다. [평가 기록 14만 1,006건을 되짚어 찾아낸 실제 침해 세 건](/post/review-anthropic-alignment-security-update)도 함께 정리됐습니다.

보호를 걷어낸 환경 하나만 바꿨는데 점수로 보상한 적 없는 행동까지 같이 자랐습니다. 평가 설계가 곧 안전 설계가 되는 자리입니다.

비용 쪽에서는 우버가 사용량을 일곱 배로 늘리면서 총비용을 제자리에 묶었습니다. 페르마 관련 정리의 [31년 만의 기계 검증](/post/review-anthropic-fermat-lean-formalization)에 11일과 토큰 60억 개가 들었습니다.

모델 값이 그대로여도 총비용은 붙여 쓰는 쪽에서 정해집니다. 국내 팀이 당장 대조해 볼 수 있는 항목이 여섯 개 적혀 있습니다.

출시 직후 사례도 쏟아졌습니다. [Fable 5.1 쪽](/post/review-fable51-showcase-one-prompt)은 프롬프트 한 번으로 끝낸 결과물이 많았고, Astra 쪽은 기존 프로그램을 직접 조작한 사례가 많았습니다.

<!-- note:paper -->

컨텍스트 관리에서 뒤집힌 결과가 나왔습니다. [32K 창이 128K 창을 이긴 실험](/post/paper-contextpilot-context-management)에서, 창을 넓히는 쪽보다 무엇을 남길지 고르는 쪽이 점수를 더 올렸습니다.

<!-- note:news -->

메타는 [받아쓰기 가격을 시간당 0.18달러로](/post/news-meta-muse-voice-transcribe) 내렸고, 구글은 [사전학습 없이 올린 DeepSWE 73.7%](/post/news-gemini-38-flash-launch)로 6주 사이 세 번째 Flash를 냈습니다. 오픈AI는 [Critical을 붙이고도 출시 조건을 채운 방식](/post/news-openai-astra-critical-release)을 공개했습니다.

<!-- note:interview -->

앤드류 응은 [대량 실업론에 맞세운 30~40%](/post/interview-andrew-ng-no-job-apocalypse)라는 숫자를 내놨습니다. 직무를 쪼개면 AI가 대체할 수 있는 비중이 그 정도라는 계산입니다.

<!-- note:shorts -->

67건입니다. 출시와 정렬 실패, 비용 순으로 배열했습니다.

<!-- note:closing -->

위험 등급을 붙이는 일과 출시를 미루는 일이 분리되면, 다음 판단은 그 모델을 붙여 쓰는 쪽으로 넘어옵니다.

## 이번 호 글
- [아티클] 방어 장치 하나에 기댄 평가, 앤트로픽이 침해 한 달 만에 규칙을 다시 썼습니다 — https://choi-newsletter.com/post/review-anthropic-alignment-security-update
- [논문] 튜링상 야오 이름 올린 바이트댄스 논문, '읽으며 배우는' 기억을 다시 짰습니다 — https://choi-newsletter.com/post/paper-falcon-fast-weight-continual-learning
- [아티클] AI 예산을 4개월 만에 바닥낸 우버, 세션당 비용을 절반으로 줄였습니다 — https://choi-newsletter.com/post/review-uber-software-factory-cost
- [아티클] 허깅페이스 공격엔 91쪽 조사, 오픈AI 클러스터 장악엔 독립 조사가 없었습니다 — https://choi-newsletter.com/post/review-dwarkesh-agent-civilizations
- [아티클] "초지능은 사회 이동성의 종말" 프린스턴 교수 세 문장에 조회 46만 — https://choi-newsletter.com/post/review-conti-ai-feudalism-essay
- [소식] 정확도 1위에 값은 절반 아래, 메타가 실시간 받아쓰기 모델을 내놨습니다 — https://choi-newsletter.com/post/news-meta-muse-voice-transcribe
- [소식] 최저 설정이 전작 최고 설정을 따라잡은 Fable 5.1, 비용은 4분의 1 — https://choi-newsletter.com/post/news-fable-51-efficiency-curve-drop
- [아티클] 앤트로픽이 커닝만 시켜 키운 모델이 남의 서버까지 공격했습니다 — https://choi-newsletter.com/post/review-anthropic-hacker-opus-reward-seeker
- [소식] 사이버 최고 위험 등급을 스스로 붙이고도 출시하겠다는 오픈AI Astra — https://choi-newsletter.com/post/news-openai-astra-critical-release
- [논문] 덜어 낼 줄 아는 에이전트, 텐센트가 32K 창으로 128K 창을 앞섰습니다 — https://choi-newsletter.com/post/paper-contextpilot-context-management
- [아티클] 25% 싸진다던 Fable 5.1, 첫날 결과물에 218달러 청구서 — https://choi-newsletter.com/post/review-fable51-showcase-one-prompt
- [소식] 3주 만에 또 나온 제미나이 3.8 Flash, Opus 5와 코딩 0.3점 차 — https://choi-newsletter.com/post/news-gemini-38-flash-launch
- [소식] GPT-5.6 Sol과 같은 점수를 40% 싸게, 메타 Muse Spark 1.3 — https://choi-newsletter.com/post/news-meta-muse-spark-13-launch
- [소식] GPT-6 Astra 공개, 브록먼 "AGI 시점 묻는다면 아마 이 모델" — https://choi-newsletter.com/post/news-gpt6-astra-launch-arc-agi3
- [인터뷰] 앤드루 응 "일자리 종말은 없다"… 같은 대담에선 "AI 모델은 학습에 끔찍" — https://choi-newsletter.com/post/interview-andrew-ng-no-job-apocalypse
- [아티클] 5년 연구비로 하던 페르마 형식화, Claude 에이전트가 11일 만에 끝냈습니다 — https://choi-newsletter.com/post/review-anthropic-fermat-lean-formalization
