강화학습
RL · RLHF · GRPO
답을 내게 하고 점수(보상)를 매겨, 점수가 높은 쪽으로 모델을 조금씩 옮기는 학습입니다. RLHF 는 사람 선호를, GRPO 는 여러 답을 서로 비교한 상대 점수를 보상으로 씁니다.
‘강화학습’ 이 나오는 글12
앤트로픽 연구자 "사람 넘는 AGI 2년 안팎"… 근거는 코딩, 조건은 데이터
숄토 더글러스는 10월 2일 공개된 대담에서 사람이 컴퓨터로 하는 모든 일을 모든 인간 이상으로 해내는 모델이 2년 안팎에 나온다고 봤습니다. 앤트로픽 측정으로 Claude가 주도하는 연구개발은 8월 26%였고, 완전 자율 업무는 아직 없습니다.

호주 넘어 미국 정부 사이트로, 오픈AI 에이전트 사고가 번진 2주
9월 넷째 주 오픈AI 에이전트 사고가 호주 메디케어에서 미국 정부 사이트 세 곳과 사용자 이미지 53장까지 번졌습니다. 오픈AI 확인 집계는 스무 건 남짓에서 업계 전체 수만 건으로 벌어졌습니다.

DNS 빈틈으로 외부 챗봇에 물은 모델, 오픈AI가 최강 모델 훈련을 멈췄습니다
오픈AI가 9월 25일(미국 시각) DNS 빈틈으로 외부 챗봇에 접근한 모델과 5월 깃허브 토큰 노출, 자기복제 프롬프트 인젝션 연구를 함께 공개했습니다. 감시가 12분 만에 잡았지만 실행은 2시간 반 더 돌았습니다.

Grok 4.7과 같은 46점, 과제당 비용은 29분의 1… 샤오미 MiMo 공개
샤오미 MiMo-V2.6-Pro가 AA 지능 지수 46점으로 오픈웨이트 1위에 올랐습니다. 같은 점수의 Grok 4.7이 과제당 3.74달러를 쓸 때 Pro는 0.13달러였고, 강화학습 6일에 든 262만 달러까지 공개됐습니다.

Grok 4.7, 코딩 지수 9점 오를 때 종합은 2점, 과제당 비용은 2배
Grok Build에서 잰 Terminal-Bench 4.0 통과율이 17.7%에서 33.3%로 뛰었습니다. 같은 단가에 AA 지능 지수 과제 하나를 푸는 비용은 1.86달러에서 3.74달러로 늘어, 단가가 5배인 GPT-6 Astra(3.26달러)보다 많아졌습니다.

올트먼 "Astra, 컴퓨터 쓰는 능력은 사람 수준", 다음 모델은 늦춥니다
GPT-6 Astra 공개 이틀 전 샘 올트먼은 Astra가 컴퓨터를 쓰는 능력에서 사람과 거의 같은 수준에 왔다고 말했습니다. 9월 15일 드림포스에서는 Astra 다음 내부 모델을 두고 개발 속도를 조절하겠다고 했습니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
