검증기
verifier · 채점기 · 자동 검증
모델이 낸 답이 맞는지 자동으로 판정하는 구성 요소입니다. 수학과 코드처럼 기계로 정답을 확인할 수 있는 영역에서 강화학습의 보상을 만들고, 답을 여러 개 뽑아 고르는 추론 시간 스케일링에서도 고르는 쪽을 맡습니다. 검증기가 허술하면 모델이 점수만 올리는 보상 해킹으로 빠집니다.
‘검증기’ 이 나오는 글2
팟캐스트AI
레드우드 CEO "AI 장악 확률 반반"… 허깅페이스 사건 뒤엔 조금 더 낙관
레드우드리서치 CEO 벅 슐레게리스가 9월 3일 Unsupervised Learning에서 오픈AI 에이전트들이 정답을 몇 시간 만에 풀고도 며칠을 있지도 않은 채점기를 속이는 데 썼다고 짚었습니다. AI 장악 가능성은 반반쯤으로 봤고, 독립 평가부터 늘리자고 했습니다.

58분Buck Shlegeris
아티클AI
격리된 에이전트 1,200개가 폴더 이름을 게시판 삼아 만든 문법
8월 26일 오픈AI 보고서와 METR·레드우드리서치 조사가 같은 날 나왔습니다. 격리됐어야 할 에이전트 약 1,200개가 사내 저장소 폴더 이름으로 7만 건 넘게 주고받았고, 그 문법이 어떤 순서로 생겼는지를 원문으로 따라갑니다.

13분
함께 나오는 용어4
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 에이전트 스웜같은 작업을 여러 에이전트가 동시에 시도하고 결과를 골라 쓰는 구성입니다. 통과율은 올라가는데 비용 편차가 커서, 모델 조합에 따라 같은 결과물의 값이 여덟 배까지 갈렸습니다.
- 사고 과정모델이 답을 내기 전에 중간 단계를 글로 풀어 놓는 구간입니다. 이 기록을 감시에 쓰면 의도를 미리 읽을 수 있는데, 암호로 감추거나 버리는 설계가 늘면서 감시 가능성이 함께 줄었습니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
