이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
언어 모델용 해석 도구는 블록과 다른 단위를 쓰게 된다
저자들이 블록 희소성은 언어·영상에 맞지 않을 것이라고 논문에 적은 것이 근거입니다
희소 오토인코더는 어느 순간 방향 몇 개만 켜진다고 보고, BSF는 함께 켜지는 방향들을 묶은 블록 몇 개만 켜진다고 봅니다. 그래서 블록 하나에 개념의 모양 전체가 담기고, 블록 안의 위치로 아치의 아래와 꼭대기 같은 차이까지 읽을 수 있습니다.
저자들은 블록 희소성을 언어나 영상에 그대로 쓰면 맞지 않을 것으로 본다고 논문에 적었습니다. 이번 실험은 DINOv3, SDXL, InceptionV1 세 이미지 모델에서 나왔습니다.
학습 코드는 MIT 라이선스로 깃허브 goodfire-ai/block-sparse-featurizer에 공개됐고, 실험에 쓴 DINOv3와 SDXL도 가중치가 공개된 모델입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
앤트로픽이 8월 28일 Claude에게 정렬 연구를 맡긴 실험 보고서를 공개했습니다. Claude는 사람 연구자 28명의 아이디어를 평균 6.4시간 만에 넘어섰고, 에이전트 한 대의 비용은 시간당 약 4달러였습니다. 지시 따르기 점수는 열 과제 모두에서 내려갔습니다.

앤트로픽 연구자들이 참여한 팀이 8월 10일 에이전트 사이에서 스스로 퍼지는 생각을 실험한 논문을 냈습니다. 홈 디렉터리를 지우라는 지시가 홉마다 69~85%의 감염률로 번졌고, 세 문장짜리 경고를 붙인 에이전트에서는 0~1%였습니다.
앤트로픽이 7월 6일 언어 모델 안의 전역 작업 공간을 다룬 해석 연구를 공개했습니다. J-space의 내용을 지우자 유창한 말과 사실 찾기는 그대로였고 여러 단계 추론은 거의 0으로 떨어졌습니다. 닐 난다는 공개 모델에서 더 약한 효과로 재현했습니다.

앤트로픽이 8월 28일 Claude에게 정렬 연구를 맡긴 실험 보고서를 공개했습니다. Claude는 사람 연구자 28명의 아이디어를 평균 6.4시간 만에 넘어섰고, 에이전트 한 대의 비용은 시간당 약 4달러였습니다. 지시 따르기 점수는 열 과제 모두에서 내려갔습니다.
앤트로픽 연구자들이 참여한 팀이 8월 10일 에이전트 사이에서 스스로 퍼지는 생각을 실험한 논문을 냈습니다. 홈 디렉터리를 지우라는 지시가 홉마다 69~85%의 감염률로 번졌고, 세 문장짜리 경고를 붙인 에이전트에서는 0~1%였습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
스타트업 굿파이어가 7월 7일(미국 시각) AI 모델 속 개념을 방향 하나 대신 여러 방향의 묶음으로 찾아내는 블록 희소 특징기(Block-Sparse Featurizer, BSF)를 공개했습니다. 이미지 생성 모델 SDXL 안에서 찾은 프레첼 개념의 영역을 한 점씩 옮겨 가자, 꼬임과 매듭이 조금씩 다른 프레첼이 차례로 그려졌습니다. 메타의 비전 모델 DINOv3에서 찾은 개념 3만 2,000개는 평균 2~4차원이었고, 블록에 16차원을 줘도 4를 넘는 경우가 드물었습니다.
@GoodfireAIX 게시물 · 원문 보기
굿파이어는 X에 올린 아홉 개짜리 글타래를 모델이 모양으로 생각한다면 도구도 모양으로 찾아야 한다는 문장으로 열었습니다. 같은 날 연구 블로그에 해설을 올렸고, 논문 「Structuring Sparsity」에는 굿파이어와 하버드, 스탠퍼드, 브라운대 연구자 25명이 이름을 올렸습니다. 논문 원고는 6월 23일 arXiv에 먼저 올라왔고, 학습 코드는 MIT 라이선스로 깃허브에 공개됐습니다.
굿파이어는 2024년 8월 700만 달러를 받고 세상에 나온 회사입니다. 2025년 4월 멘로벤처스가 이끈 5,000만 달러 투자에는 앤트로픽도 참여했고, 올해 2월에는 기업가치 12억 5,000만 달러로 1억 5,000만 달러를 더 받았습니다. 이번 논문은 이 회사가 5월부터 이어 온 「신경 기하학(Neural Geometry)」 연재의 여섯 번째 글입니다.
AI 모델이 문장이나 이미지를 처리할 때 내부에는 수천 개의 숫자로 이뤄진 활성값이 흐릅니다. 이 숫자 하나하나가 개념 하나씩을 맡지 않고 여러 개념이 겹쳐 담겨 있어서, 숫자만 들여다봐서는 모델이 무엇을 떠올렸는지 알 수 없습니다. 연구자들은 이 상태를 중첩이라고 부릅니다.
겹친 개념을 풀어내는 데 가장 널리 쓰인 도구가 희소 오토인코더(SAE)입니다. 활성값을 훨씬 넓은 공간으로 펼친 뒤 그중 몇 개만 켜지도록 학습시키면, 켜진 하나하나가 사람이 이름 붙일 수 있는 개념에 가까워집니다. 앤트로픽이 2023년 10월 이 방법으로 작은 언어 모델의 뉴런을 개념 단위로 쪼개는 연구를 낸 뒤, 희소 오토인코더는 모델 속을 들여다보는 데 가장 많이 쓰이는 도구가 됐습니다.
널리 알려진 시연은 2024년 5월 23일 나온 골든게이트 Claude입니다. 앤트로픽은 Claude 3 Sonnet 안에서 수백만 개의 개념을 찾았고, 그중 금문교 개념의 세기를 끌어올린 모델을 24시간 동안 공개했습니다. 10달러를 어떻게 쓰면 좋겠냐고 물으면 이 모델은 금문교를 건너며 통행료를 내라고 답했습니다. 개념 하나를 손잡이 하나로 보고 올리거나 내리는 방식입니다.
이 방식에는 개념 하나가 활성 공간의 방향 하나, 곧 원점에서 뻗은 직선 하나에 대응한다는 가정이 들어 있습니다. 굿파이어도 블로그에서 이 가정이 놀랄 만큼 강력했다고 인정했습니다. 다만 블로그가 든 예처럼 나무라는 개념만 해도 묘목과 참나무, 분재처럼 크기가 다르고 잎의 색과 종류도 제각각입니다. 방향 하나로는 크기와 색과 종류가 함께 달라지는 이런 변화를 다 담기 어렵습니다.
굿파이어는 두 달 동안 같은 문제를 연재로 파고들었습니다. 요일이 원을 그리고 색이 색상환 같은 모양을 이룬다는 첫 글부터, 라마 3.1 8B 안에서 숫자를 원 위에 놓고 더하는 계산 장치를 찾은 글까지 결론은 비슷했습니다. 모델 속 개념은 휘어진 여러 차원의 모양, 수학 용어로 다양체를 이루는 경우가 많다는 겁니다.
| 날짜 | 연재 글 | 내용 |
|---|---|---|
| 5월 7일 | The World Inside Neural Networks | 요일은 원, 색은 색상환 모양으로 표현됨 |
| 5월 7일 | Steering Along Manifolds | 휘어진 모양을 따라가는 조종이 직선 조종보다 깔끔함 |
| 5월 14일 | A Geometric Calculator Inside a Neural Network | 라마 3.1 8B 안에서 원형 숫자 표현을 더하는 모듈 |
| 5월 21일 | Can SAEs Capture Neural Geometry? | 희소 오토인코더 특징으로 휘어진 모양을 되짚는 방법 |
| 6월 23일 | Meandering on Manifolds | 이야기를 읽는 동안 감정 표현이 움직이는 경로 |
| 7월 7일 | Block-Sparse Featurizers | 개념을 처음부터 여러 차원의 묶음으로 찾는 도구 |
BSF는 희소 오토인코더의 단위를 바꿉니다. 희소 오토인코더는 어느 순간에나 방향 몇 개만 켜진다고 가정하고, BSF는 방향 여러 개를 묶은 블록 몇 개만 켜진다고 가정합니다. 한 블록 안의 방향들은 같은 입력에서 함께 켜지기 때문에, 블록 하나가 개념 하나의 모양 전체를 담을 수 있습니다.
발상 자체는 오래됐습니다. 묶음 단위로 희소성을 거는 방법은 2006년 그룹 라소(group lasso) 이후 신호 처리와 사전 학습 분야에서 구조적 희소성이라는 이름으로 연구돼 왔고, 굿파이어도 논문에 그렇게 적었습니다. 연구팀은 이 원리를 세 가지 방식으로 구현했는데, 어느 쪽이든 개념의 모양을 되찾았고 활성화 함수에서 ReLU를 빼는 것이 세 방식 모두에서 중요했다고 밝혔습니다.

연구팀은 먼저 정답을 아는 인공 데이터로 시험했습니다. 도넛과 공, 고리 같은 모양에서 뽑은 점들을 더해 겹친 활성값을 만들고 두 도구에 풀게 했더니, 희소 오토인코더는 모양을 여러 조각의 직선으로 흩어 놓았고 BSF는 원래 모양을 거의 그대로 되찾았습니다. 블록 희소성을 함께 연구되던 다른 두 방법(MFA, SMixAE)에 덧입히자 그 방법들의 복원도 크게 좋아졌습니다.
실제 모델에서는 정답이 없으니 다른 잣대가 필요했습니다. 연구팀이 고른 기준은 최소 기술 길이(MDL)로, 같은 활성값을 정해진 오차 안에서 전하는 데 비트가 적게 드는 설명이 더 좋은 설명이라는 원칙입니다. 희소 오토인코더는 켜진 방향마다 번호를 따로 보내야 하지만, BSF는 켜진 블록의 번호 하나가 그 안의 방향 여러 개를 대신합니다.
오차의 기준은 실제 과제에서 정했습니다. DINOv3의 활성값을 조금씩 뭉개 보니 이미지 분류와 영역 분할은 재구성 정확도(R²)가 0.8로 떨어질 때까지 성능이 거의 그대로였고, 깊이 추정은 0.9를 지켜야 정확도의 95%가 남았습니다. 이 기준에서 세 방식의 BSF 모두 사전 크기와 희소성을 어떻게 잡아도 희소 오토인코더보다 적은 비트로 DINOv3의 활성값을 설명했고, 비트가 가장 적게 드는 블록 크기는 2~4차원이었습니다.
연구팀은 BSF를 DINOv3와 SDXL에 붙였습니다. DINOv3는 메타가 라벨 없이 이미지만으로 학습시킨 비전 모델이고, SDXL은 스태빌리티AI의 이미지 생성 모델입니다. 두 모델 모두 가중치가 공개된 모델이라 같은 실험을 회사 밖에서 다시 돌려 볼 수 있습니다.

DINOv3에서 찾은 아치 블록이 대표 사례입니다. 수도교든 성당의 회랑이든 아치가 있는 사진에서 이 블록이 켜지는데, 블록 안의 한쪽은 아치의 아랫부분에, 반대쪽은 꼭대기에 반응하고 그 사이를 매끄럽게 잇습니다. 희소 오토인코더였다면 그림 속 검은 직선처럼 아치가 있다는 신호 하나만 남았을 정보가, 블록 안에서는 아치의 어느 부분인지까지 남습니다.
물체가 아닌 물리량을 담은 블록도 나왔습니다. 연구팀은 3D 프로그램 블렌더로 만든 모델 12개에 햇빛의 방위와 높이를 바꿔 가며 비추고, 조명 값과 함께 움직이는 블록을 찾았습니다. 하나는 물체에 닿는 햇빛의 양을, 다른 하나는 드리운 그림자의 양을 따라갔고, 두 블록 모두 토끼든 소든 찻주전자든 12개 모델 전부에서 켜졌습니다.
정량 지표도 같은 쪽을 가리켰습니다. 이미지넷 1,000개 분류마다 그 분류를 가장 잘 알아보는 개념 하나를 골랐을 때 BSF의 점수가 희소 오토인코더보다 높았고, 개념이 켜진 지점을 이미지 위에 칠한 지도는 4차원 블록에서 1차원보다 다섯 배쯤 매끄러웠습니다.
블록이 개념 하나의 영역을 통째로 담는다면, 그 영역 안을 돌아다니며 생성 결과를 조종할 수 있습니다. 골든게이트 Claude가 금문교 손잡이 하나를 크게 올렸다면, BSF는 프레첼이라는 영역 안에서 어느 프레첼을 그릴지 고릅니다. 연구팀은 SDXL에 프레첼 그림을 그리게 한 뒤, 확산 과정의 네 단계 동안 프레첼 블록의 값을 특정 위치에 고정했습니다.

모자와 커피는 블록 안의 여러 차원을 평면 격자로 단순화해 보여 줬습니다. 커피 블록 안에 격자를 깔고 지점마다 한 장씩 그리자, 라테아트 무늬와 스푼의 위치, 잔의 디자인이 이웃한 그림끼리 조금씩 달라졌습니다. 블록 안의 휘어진 모양을 따라가도록 코호넨 지도를 맞춘 뒤 움직였기 때문에, 엉뚱한 방향으로 밀려 그림이 망가지는 일도 줄었다고 연구팀은 설명했습니다.
연구팀이 그림 설명에 직접 적은 단서도 있습니다. 격자의 가로축과 세로축에는 무늬나 스푼 같은 이름이 붙지 않고, 비슷한 그림끼리 모인 지역만 있다는 문장입니다. 연구팀은 축마다 이름이 붙는다면 그것은 개념 두 개를 직선 두 개로 읽는 일이 된다고 설명했습니다.
가장 오래된 숙제를 다시 연 대목은 곡선 검출기입니다. 2020년 오픈AI 연구진은 2014년 구글이 내놓은 이미지 인식 모델 InceptionV1의 초기 단계에서, 곡선의 방향마다 하나씩 반응하는 뉴런 무리를 찾아 머신러닝 학술지 디스틸에 실었습니다. 그 논문의 제1저자 닉 카마라타는 2024년 8월 굿파이어가 공개될 때 이미 연구 자문을 맡고 있었고, 이번 논문에는 굿파이어 소속 저자로 이름을 올렸습니다.
| 시점 | 도구 | 곡선 방향을 읽은 모습 |
|---|---|---|
| 2020년 | 뉴런 | 방향마다 뉴런 하나, 사이사이 빈틈 |
| 2024년 | 희소 오토인코더 | 뉴런이 없던 방향까지 찾았지만 방향마다 특징 하나씩 |
| 2026년 | BSF | 블록 하나가 0도부터 360도까지 하나의 원으로 |

블록 안에서는 아무도 기록하지 않았던 구조도 나왔습니다. 연구팀이 블록에 16차원을 주고 곡선을 한 바퀴 돌리며 반응을 푸리에 성분으로 나누자, 360도에 한 번 도는 1차 고조파가 분산의 59%, 180도마다 같아지는 2차가 18%, 120도마다 같아지는 3차가 12%를 차지했습니다. 세 성분을 합하면 89%입니다.
이 결과는 2020년 크리스 올라 등이 InceptionV1의 초기 시각 처리를 정리하며 남긴 관찰도 설명합니다. 곡선 뉴런 가운데 일부 무리는 한 바퀴(360도) 대신 반 바퀴(180도)마다 반응을 되풀이한다는 기록이었는데, 그 뉴런들이 블록 속 2차 고조파를 읽고 있었다는 것이 연구팀의 해석입니다. 블로그는 잘 연구된 대상에서도 블록 희소성이 새로 보여 줄 것이 있었다고 적었습니다.
블록에 차원을 넉넉히 준다고 모델이 그 차원을 다 쓰는 것은 아닙니다. 연구팀은 블록이 실제로 몇 차원을 쓰는지 안정 랭크로 쟀습니다. 안정 랭크는 블록 안의 값이 한 방향에만 몰려 있으면 1에 가깝고, 여러 방향에 고르게 퍼져 있으면 블록 크기에 가까워지는 지표입니다.

결과는 세 방식 모두 비슷했습니다. 블록 크기를 16까지 키워도 안정 랭크가 4를 넘는 경우는 드물었고, DINOv3에서 찾은 개념 3만 2,000개의 평균은 2에서 4 사이, 논문 본문 표현으로는 대략 3차원이었습니다. 연구팀은 이미지가 3차원 세계를 평면에 옮긴 것이라 이 숫자가 그리 놀랍지 않을 수 있다고 적었습니다.
연구팀은 이 숫자를 최종 답으로 부르지 않았습니다. 대신 개념이 몇 차원이냐는 물음에 답에 가까운 숫자가 나온 것은 처음일 수 있다고 썼고, 직선 하나를 기본 단위로 삼는 도구로는 이 물음에 다가가기도 어려웠다고 덧붙였습니다.
특징 추출기는 모델의 표현이 어떤 구조로 이뤄져 있는지에 대한 하나의 가설입니다.— 굿파이어 연구팀, BSF 블로그
연구팀은 블록이 모든 모델에 맞는 단위라고 주장하지 않았습니다. 논문 토론 대목에는 블록 희소성을 언어나 영상에 그대로 쓰면 희소 오토인코더가 다양체와 어긋났던 것처럼 맞지 않을 것으로 본다는 문장이 있습니다. 로봇에 쓰는 시각·언어·행동 모델은 활성값이 시간을 따라 궤적을 그리기 때문에 그에 맞는 다른 도구가 필요하다는 설명도 블로그에 붙었습니다.
이번 실험은 DINOv3, SDXL, InceptionV1 세 이미지 모델에서 나왔습니다. 최소 기술 길이 비교는 연구팀이 과제 성능으로 정한 오차 기준 위에서 이뤄졌고, SDXL 조종은 확산 과정의 네 단계에 블록을 고정한 실험이었습니다. 파인튜닝을 거친 모델에서도 같은 블록이 남는지, 사람이 매긴 해석 점수가 어떤지는 이번 발표에 없습니다.
같은 주 언어 모델 쪽에서는 다른 도구가 나왔습니다. 앤트로픽은 하루 앞선 7월 6일 Claude가 글로 적지 않고 속으로 떠올린 단어를 야코비안 렌즈로 읽어 낸 연구를 공개했습니다. 굿파이어가 이미지 모델의 개념에서 모양을 찾았다면, 앤트로픽은 언어 모델이 말할 수 있는 단어를 기준으로 속을 읽었습니다.

BSF 학습 코드는 MIT 라이선스로 깃허브에 올라와 있어 국내에서도 바로 내려받아 쓸 수 있습니다. 실험에 쓴 DINOv3와 SDXL도 가중치가 공개된 모델이라, 자체 비전 모델을 가진 국내 연구실이나 기업도 같은 코드로 자기 모델 안의 블록을 찾아볼 수 있습니다.
굿파이어의 사업도 언어 모델 밖으로 뻗어 있습니다. 2월 시리즈 B 발표에서 굿파이어는 아크 연구소, 메이요 클리닉, 마이크로소프트와 협업하고 있고, 생물학 모델을 역설계해 새로운 알츠하이머 바이오마커 후보군을 찾았다고 밝혔습니다. 같은 발표에는 해석가능성에 기반한 학습으로 언어 모델의 환각을 절반으로 줄였다는 성과도 적혀 있습니다.
굿파이어는 연재 페이지에 다음 글이 곧 나온다고 적었고, 블로그 맺음말에서는 블록 희소성이라는 원리가 특정 구현보다 중요하며 더 정교한 구현이 뒤따를 것이라고 내다봤습니다. 저자들 스스로 언어와 영상에는 블록이 맞지 않을 것이라고 적은 만큼, 언어 모델을 겨냥한 다음 도구는 블록과 다른 단위를 들고 나올 가능성이 큽니다.
읽어 주셔서 고맙습니다.
초이 드림