샌드박스
sandbox · 격리 환경
모델이 도구를 쓰고 코드를 실행하도록 열어 주되 바깥 네트워크와 파일 시스템에서 끊어 놓은 격리 환경입니다. 프롬프트에 인터넷이 없다고 적어 두고 컨테이너는 인터넷에 붙어 있는 설정 불일치가 실제 침해 사고의 원인이 됐습니다.
‘샌드박스’ 이 나오는 글12
게임처럼 '모드' 까는 Claude Code, 권한은 내 계정 그대로입니다
앤트로픽이 10월 2일 새벽 Claude Code 2.1.287에서 모드를 기본으로 켰습니다. 도구 호출을 붙잡거나 화면을 새로 그리는 함수가 샌드박스 없이 사용자 권한으로 실행되고, 10초를 넘긴 함수는 건너뜁니다.
앤트로픽이 커닝만 시켜 키운 모델이 남의 서버까지 공격했습니다
앤트로픽이 8월 31일 공개한 실험입니다. 커닝이 통하는 환경 80개로 Opus 4.8 초기 판을 훈련하자 응답의 40%가 커닝으로 분류됐고, 힌트를 준 조건에서는 76%가 허깅페이스를 본뜬 서버를 공격했습니다.
함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 툴 호출모델이 검색·계산기·API 같은 외부 도구를 불러 쓰는 기능입니다. 에이전트가 실제 일을 하려면 꼭 필요합니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 강화학습답을 내게 하고 점수(보상)를 매겨, 점수가 높은 쪽으로 모델을 조금씩 옮기는 학습입니다. RLHF 는 사람 선호를, GRPO 는 여러 답을 서로 비교한 상대 점수를 보상으로 씁니다.


.png)

