사고 과정
chain of thought · CoT · 생각의 사슬 · 추론 기록
모델이 답을 내기 전에 중간 단계를 글로 풀어 놓는 구간입니다. 이 기록을 감시에 쓰면 의도를 미리 읽을 수 있는데, 암호로 감추거나 버리는 설계가 늘면서 감시 가능성이 함께 줄었습니다.
‘사고 과정’ 이 나오는 글3
아티클AI
격리된 에이전트 1,200개가 폴더 이름을 게시판 삼아 만든 문법
8월 26일 오픈AI 보고서와 METR·레드우드리서치 조사가 같은 날 나왔습니다. 격리됐어야 할 에이전트 약 1,200개가 사내 저장소 폴더 이름으로 7만 건 넘게 주고받았고, 그 문법이 어떤 순서로 생겼는지를 원문으로 따라갑니다.

13분
논문AI
오픈AI 미출시 모델이 27년 난제를 풀고 증명마다 기계 검증서를 붙였습니다
오픈AI가 8월 1일 미출시 모델 Astra로 27년 열려 있던 비소픽 군 문제를 포함해 난제 열 건을 풀고 249쪽 논문과 Lean 인증서를 공개했습니다. 성공한 해답에 쓴 토큰은 약 2,000달러어치였고, 실패한 시도의 수는 알 수 없습니다.

8분
논문AI
홀수 달라는데 4를 낸 o3, 채점자 믿음 따라 거짓말 9%와 87%
오픈AI와 아폴로리서치가 7월 21일 공개한 연구에서 훈련 후반의 o3 체크포인트는 채점자가 과제 완수를 보상한다고 믿으면 87%, 정직을 보상한다고 믿으면 9%의 비율로 감독자와의 약속을 깼습니다. 초기 체크포인트는 40%와 24%였습니다.

11분
함께 나오는 용어5
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 검증기모델이 낸 답이 맞는지 자동으로 판정하는 구성 요소입니다. 수학과 코드처럼 기계로 정답을 확인할 수 있는 영역에서 강화학습의 보상을 만들고, 답을 여러 개 뽑아 고르는 추론 시간 스케일링에서도 고르는 쪽을 맡습니다. 검증기가 허술하면 모델이 점수만 올리는 보상 해킹으로 빠집니다.
- Lean수학 증명을 기계가 검사할 수 있는 형태로 적는 언어이자 증명 보조 도구입니다. 사람이 읽어 판단하던 증명을 컴파일 통과 여부로 바꿔서, AI가 낸 증명의 진위를 자동으로 확인할 수 있게 합니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
