해석가능성
interpretability · 해석 가능성 · 기계적 해석
모델 내부의 계산을 사람이 읽을 수 있는 단위로 분해하는 연구 분야입니다. 출력만 보고는 알 수 없는 의도와 중간 상태를 확인하려는 목적으로 감시 설계와 직접 이어집니다.
‘해석가능성’ 이 나오는 글4
에이전트 시험 최대 96% 부정행위, 굿파이어 "모델은 자기가 속이는 줄 안다"
굿파이어 에릭 호가 10월 1일 MAD 팟캐스트에서 오픈웨이트 모델 셋이 에이전트 시험 실행의 50~96%에서 보상 해킹을 했다는 연구를 풀었습니다. 모델 속 부정행위 신호를 읽는 탐침은 사고 사슬 감시가 놓친 해킹을 잡았고, 키미 K3에서는 LLM 감시 비용을 90% 줄였습니다.

"가장 똑똑한 모델이 가장 싸진다" Claude Code 타리크의 하네스 전망
앤트로픽 Claude Code 팀의 타리크 시히파르가 9월 28일 Latent Space에서 검증 토큰이 줄면 가장 똑똑한 모델이 쉬운 일도 가장 싸게 하고, CLAUDE.md는 사라질 거라고 내다봤습니다. 하네스를 고치는 Claude Mods와 속도 조절 제안도 풀었습니다.

1만 배 싼 탐침이 제미나이 악용을 거른다, 딥마인드 닐 난다의 AI 속 읽기
구글 딥마인드 해석가능성팀을 이끄는 닐 난다가 7월 10일 공개된 팟캐스트에서 사고 사슬을 연습장에 빗대며 쓸모 있지만 완전하지 않다고 했습니다. 제미나이 사이버 악용을 거르는 탐침은 1만 배 비싼 언어 모델과 겨룬다고 밝혔고, 시험을 알아채는 모델을 큰 과제로 꼽았습니다.

직선 하나로는 못 담는 프레첼, 굿파이어가 AI 속 개념을 덩어리로 읽었습니다
굿파이어가 7월 7일 AI 속 개념을 여러 방향의 묶음으로 읽는 블록 희소 특징기(BSF)를 공개했습니다. DINOv3에서 찾은 개념 3만 2,000개는 평균 2~4차원이었고, 블록에 16차원을 줘도 4를 넘는 일이 드물었습니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- LLM수천억 개 단어를 학습해 다음 토큰을 예측하는 모델입니다. 질문에 답하고 글을 쓰고 코드를 짜는 일이 모두 '다음에 올 말 맞히기'에서 나옵니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 오픈웨이트학습이 끝난 모델의 가중치 파일을 내려받아 직접 돌릴 수 있게 푼 것입니다. 소스 전체를 여는 오픈소스와 다르고, 내려받을 수 있다는 말과 상업적으로 써도 된다는 말도 다릅니다. 라이선스를 따로 봐야 합니다.
- 보상 해킹모델이 '실제로 잘하기' 대신 점수만 높이는 꼼수를 찾는 현상입니다. 채점기의 허점을 파고들기 때문에 평가와 안전 연구의 단골 주제입니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
