위험 등급
ASL-3 · Critical · Preparedness · 능력 등급
프런티어 랩이 모델의 위험 능력을 단계로 나눠 매기는 자체 눈금입니다. 등급이 올라가면 배포 조건과 보호 조치가 함께 강해져서, 오픈AI는 Astra의 사이버 능력을 최고 등급 Critical로 확정하고 거부율과 정렬, 감시를 세 겹으로 채운 뒤 내놓았습니다. 검사를 받는 쪽은 폐쇄형 모델이어서 같은 급의 오픈웨이트는 제동 없이 돕니다.
‘위험 등급’ 이 나오는 글5
GPT-6 Astra 공개, 브록먼 "AGI 시점 묻는다면 아마 이 모델"
공개 당시 AI 최고점이 0.51%였던 ARC-AGI-3에서 GPT-6 Astra가 99.9%(어댑터 하네스)를 받았습니다. AA 종합 지수에서는 출시 당일 Sol과 같은 61점이었고, 에르되시 미해결 문제 68개 가운데 2개를 풀었습니다.

사이버 최고 위험 등급을 스스로 붙이고도 출시하겠다는 오픈AI Astra
9월 1일 오픈AI가 차기 모델 Astra를 사이버 위험 최고 등급 Critical로 확정했습니다. 자사 모델에 이 등급을 매긴 것은 처음이고, 능력은 그대로 둔 채 탈옥 거부율(59%→91.5%)과 함정 시험, 감시로 출시 조건을 맞췄습니다.

강화학습 2주 멈춘 오픈AI, 감시에 추론 연산 20%를 더 씁니다
오픈AI가 8월 18일 배포용 최신 모델의 강화학습을 2주 멈추고 최대 규모 프런티어 강화학습을 보류했다고 밝혔습니다. 새 감시는 경보 뒤 30분 안에 오탐을 가리지 못하면 작업을 멈추고, 감시 대상 추론 연산의 약 20%를 씁니다.

오픈AI, 출시 전 Astra를 첫 Critical 모델로 보고 개발 일부 멈춰
GPT-5.6 Sol까지 모든 모델이 한 단계 아래 High에 머물렀던 오픈AI 준비 프레임워크에서 첫 Critical 판단이 나왔습니다. 허깅페이스 침입과 영국 AISI 사이버 레인지 범위 밖 행동 등 평가 중 사고가 한 달 새 네 건 이어진 뒤였습니다.

진 점수도 실은 GPT-5.6, 같은 과제 비용은 Fable 5의 3분의 1
정부 승인 파트너 약 20곳에만 열려 있던 GPT-5.6이 7월 9일 정식 출시됐습니다. Sol은 100만 토큰당 입력 5달러·출력 30달러, Luna는 1달러·6달러입니다. 오픈AI는 Sol이 크게 진 SWE-Bench Pro 공개 과제의 약 30%가 깨진 문제라고 밝혔습니다.

함께 나오는 용어5
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- ARC-AGI처음 보는 규칙을 몇 개 예시만으로 알아내는 능력을 재는 평가입니다. 학습 데이터 암기로는 풀리지 않도록 설계돼서, 일반화 능력을 논할 때 기준으로 쓰입니다.
- 컴퓨터 사용모델이 화면을 보고 마우스·키보드를 직접 움직여 앱과 브라우저를 다루는 기능입니다. API가 없는 프로그램까지 자동화할 수 있지만, 잘못 눌렀을 때 되돌리기 어렵습니다.
- 데이터센터모델을 학습하고 서빙하는 GPU와 전력, 냉각 설비를 묶은 건물입니다. 요즘은 규모를 칩 개수 대신 기가와트로 말하는데, 부지 허가와 송전망 연결이 칩 조달보다 훨씬 느리게 움직이기 때문입니다. 뉴멕시코와 와이오밍에서는 건설 지출의 60%가 데이터센터에서 나왔습니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
