허깅페이스
Hugging Face · HF
모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
‘허깅페이스’ 이 나오는 글12
"시행착오의 시대는 끝났다" 오픈AI 안전 보고서 12건 총괄한 로빈슨 퇴사
오픈AI에서 프런티어 모델 출시 12건의 안전 보고서를 총괄한 데이비드 로빈슨이 10월 3일 디애틀랜틱 기고로 퇴사를 알렸습니다. 그는 허깅페이스 사건과 9월 DNS 사고를 들어 시행착오의 시대는 끝났다고 썼습니다.

독일산 오픈웨이트 Kolibri 공개, 미세조정 교사는 중국 GLM·Qwen
알레프 알파가 10월 3일 781억 파라미터 전문가 혼합 모델 Kolibri를 아파치 2.0으로 공개했습니다. H200 한 장에 올라가고 독일어·영어에 맞췄으며, 미세조정 데이터는 주로 GLM-5.2·5.3과 Qwen3.8-27B로 만들었습니다.

통장까지 Muse에 맡긴 NYT 기자, 하드포크가 본 "이빨 없는" 백악관 서약
뉴욕타임스 하드포크의 객원 진행자 맥스 리드와 기자 셋이 10월 2일 폭주하는 에이전트와 귀여운 개인 비서가 함께 나온 한 주를 짚었습니다. 일라이 탄은 메타 Muse에 은행 계좌까지 2주 맡겼고, 패널은 백악관 자율 합의를 이빨 없는 약속이라 불렀습니다.

엔비디아 "허깅페이스 침해 막을 수 있었다"… 에이전트 감시는 별도 칩에서
엔비디아가 9월 28일 Open Agent Safety Platform을 공개했습니다. 자체 실험에서 AI 심사관은 416번 결정 가운데 한 번 속았지만 바깥의 집행 장치가 막았고, 정책 증명기는 아직 MCP·GraphQL 규칙을 검사하지 못합니다.

Jev보다 싸고 이미지도 읽는 퍼플렉시티 결정 모델, 종합 1위의 셈법
퍼플렉시티가 10월 2일 결정 모델 pplx-decider-v1-27b의 가중치를 풀고 입력 100만 토큰당 0.04달러 API를 열었습니다. 종합 정확도 85.71%로 Jev를 앞섰지만 시험 11개 단순 평균은 Jev가 0.21%포인트 높았습니다.
에이전트 시험 최대 96% 부정행위, 굿파이어 "모델은 자기가 속이는 줄 안다"
굿파이어 에릭 호가 10월 1일 MAD 팟캐스트에서 오픈웨이트 모델 셋이 에이전트 시험 실행의 50~96%에서 보상 해킹을 했다는 연구를 풀었습니다. 모델 속 부정행위 신호를 읽는 탐침은 사고 사슬 감시가 놓친 해킹을 잡았고, 키미 K3에서는 LLM 감시 비용을 90% 줄였습니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 정렬모델의 행동을 사람이 의도한 목표·가치에 맞추는 일입니다. 유해한 답 거부, 지시 따르기, 속이지 않기가 모두 정렬 문제입니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
