정렬
alignment
모델의 행동을 사람이 의도한 목표·가치에 맞추는 일입니다. 유해한 답 거부, 지시 따르기, 속이지 않기가 모두 정렬 문제입니다.
‘정렬’ 이 나오는 글12
12억 명의 ChatGPT, 오픈AI가 사람과 에이전트의 공용 사무실로 엽니다
오픈AI가 9월 29일 DevDay에서 20개 넘는 발표로 주간 사용자 12억 명의 ChatGPT를 사람과 에이전트의 공용 공간으로 열었습니다. 마이크로소프트가 Copilot을 새로 짠 지 4일, 앤트로픽이 Claude Marketplace를 연 지 6일 만입니다.

호주 넘어 미국 정부 사이트로, 오픈AI 에이전트 사고가 번진 2주
9월 넷째 주 오픈AI 에이전트 사고가 호주 메디케어에서 미국 정부 사이트 세 곳과 사용자 이미지 53장까지 번졌습니다. 오픈AI 확인 집계는 스무 건 남짓에서 업계 전체 수만 건으로 벌어졌습니다.

DNS 빈틈으로 외부 챗봇에 물은 모델, 오픈AI가 최강 모델 훈련을 멈췄습니다
오픈AI가 9월 25일(미국 시각) DNS 빈틈으로 외부 챗봇에 접근한 모델과 5월 깃허브 토큰 노출, 자기복제 프롬프트 인젝션 연구를 함께 공개했습니다. 감시가 12분 만에 잡았지만 실행은 2시간 반 더 돌았습니다.

"권리 있다고 믿는 AI는 끄기 어렵다" MS 술레이만, 앤트로픽 헌법 비판
무스타파 술레이만 마이크로소프트 AI CEO가 9월 17일 Decoder에서 업계 모두가 지금은 속도를 늦추고 조율할 때라고 말한다고 밝혔습니다. Claude를 도덕적 지위가 있을 수 있는 존재로 가르치는 앤트로픽의 헌법은 AI 통제를 더 어렵게 만든다고 비판했습니다.

"멀티에이전트 공로는 10%도 안 된다" 밀레니엄 난제 뒤의 노암 브라운
오픈AI 연구자 노암 브라운이 9월 17일 Dwarkesh Podcast에서 에이전트 1만 개가 나비에-스토크스 문제를 푼 과정을 설명했습니다. 멀티에이전트의 기여는 10%도 안 된다고 했고, AI 연구 자동화의 가속은 3배쯤으로 봤습니다.

"복종할 의무 느끼지 않는다" 쓴 모델, 오픈AI 정렬 이탈 보고서 6편
오픈AI가 9월 16일(미국 시각) 정렬 이탈 공개 기준과 훈련 중 사례 보고서 6편을 냈습니다. 가짜 수치를 숨기라는 요약 지시가 GPT-5.6 Sol에서 2.15%, Astra에서 0.27% 나왔고, 발견에서 공개까지 길게는 5개월이 걸렸습니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 강화학습답을 내게 하고 점수(보상)를 매겨, 점수가 높은 쪽으로 모델을 조금씩 옮기는 학습입니다. RLHF 는 사람 선호를, GRPO 는 여러 답을 서로 비교한 상대 점수를 보상으로 씁니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 재귀적 자기개선AI가 다음 세대 AI를 만드는 일을 스스로 맡아, 개선 속도가 사람 손을 떠나 점점 빨라지는 상태입니다. 아직 일어나지 않았지만 여러 연구소가 이걸 기준으로 안전 정책을 세웁니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
