# 대화 없이도 분업한 AI 에이전트들, 다 지워도 기술은 계속 돌았습니다
_MIT 뷸러 연구실이 똑같은 LLM 에이전트 50~200개를 역할 없이 가상 세계에 풀었더니 분업과 코드 계보가 생겼습니다. 공유 세계의 사회는 발명 수와 회복력에서 고립 탐색을 앞섰지만, 가장 강한 기술 하나는 혼자 일한 에이전트에게서 나왔습니다._
- 매체: 초이의 뉴스레터 · 논문
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-08-30T10:00
- 링크: https://choi-newsletter.com/post/paper-mit-swarmworld-emergent-civilization
- 답하는 질문: AI 에이전트는 대화 없이 협력할 수 있나
- 직답: MIT SwarmWorld 실험에서 첫 기술 재사용의 약 95%는 대화 없이 다른 에이전트가 남긴 구조물을 보고 일어났습니다.
- 출처: Pal·Wang·Buehler, SwarmWorld: Stigmergic technological evolution in societies of language-model agents (arXiv 2608.26081, 2026-08-26) (https://arxiv.org/abs/2608.26081), 마커스 뷸러 X, SwarmWorld 소개 (2026-08-29) (https://x.com/ProfBuehlerMIT/status/2093630309585531033), 지디넷코리아, 사전학습 없이 알아서 문제 해결하는 AI 가능성 확인 (2019-09-18) (https://zdnet.co.kr/view/?no=20190918174325)
> MIT 연구진이 같은 LLM 에이전트 50~200개를 역할 없이 가상 세계에 풀자 분업과 코드 계보가 생겼고, 첫 기술 재사용의 약 95%는 구조물을 직접 본 데서 시작했습니다. 대화와 기록을 끈 사회가 검증된 발명 7.0개로 완전한 문화의 5.75개를 앞섰습니다.

MIT 원자·분자 역학 연구실(LAMM)의 수브하딥 팔, 피오나 왕, 마커스 뷸러 교수가 8월 26일(미국 시각) arXiv에 SwarmWorld 논문을 올렸습니다. 똑같은 언어 모델 에이전트 50~200개를 역할도 레시피도 정해 주지 않고 자원과 재난이 있는 가상 세계에 넣었더니, 에이전트들이 스스로 일을 나누고 기술을 발명하고 서로의 코드를 물려받았습니다. 연구진이 에이전트를 모두 빼낸 뒤 처음 보는 재난을 걸어도 그들이 남긴 기술은 계속 돌았습니다.

뷸러 교수가 한국 시각 8월 29일 저녁 X에 올린 소개 글입니다. 처음에 똑같던 에이전트 수백 개가 직접 대화 없이 탐험가와 건설자, 관리자, 조율자로 갈라졌고, 에이전트를 모두 없애도 그들이 지은 기술 기반이 처음 겪는 교란 속에서 살아남았다고 썼습니다. 이어서 에이전트가 공유 환경에 남긴 영구적인 변화만으로 협력할 수 있다면 에이전트끼리 주고받는 대화를 감시하는 것으로는 부족하다며, 이 결과가 AI 안전과 기반시설 보안의 심각한 맹점을 드러낸다고 적었습니다. 글에는 3분 32초짜리 소개 영상이 붙어 있습니다.

## 에이전트는 제안하고 세계가 판정합니다

실험 무대는 가로 72, 세로 54 격자로 된 세계 BioFoundry입니다. 균류 숲과 셀룰로스 밭, 광물 샘, 키틴 밭 같은 자원 지대와 재료를 가공하는 공방이 흩어져 있고, 오염과 가뭄, 폭풍이 주기적으로 들이닥칩니다. 에이전트는 자기 주변만 보고 개인 기억을 떠올려 최대 12개 행동으로 된 계획을 냅니다. 움직이고, 자원을 캐고, 재료를 가공해 시험하고, 구조물을 짓고, 그 구조물을 움직일 제어 프로그램을 쓰거나 남의 프로그램을 가져와 고치는 일까지 계획에 들어갑니다.

계획이 실제로 되는지는 결정론적 시뮬레이터가 정합니다. 위치와 재료, 권한, 선행 조건이 맞지 않으면 행동은 실패로 기록되고, 설치된 구조물의 프로그램은 에이전트가 아무 결정도 내리지 않는 동안에도 틱(세계가 한 번 갱신되는 단위)마다 계속 돕니다. 뷸러는 이 구조를 에이전트는 제안하고 물리가 결정한다고 요약했습니다. 에이전트가 자기 설계를 아무리 높이 평가해도 점수에는 들어가지 않습니다.

![왼쪽은 600틱 시점 에이전트 200개 세계의 지도로 에이전트, 구조물, 가공 시설, 자원 지대, 재난 영역, 조수 자원에 번호가 붙어 있습니다. 오른쪽은 관찰, 언어 모델의 숙고, 구조화된 계획, 거래식 검증, 결정론적 세계 갱신으로 이어지는 한 턴의 순서도입니다.](https://arxiv.org/html/2608.26081v1/figure-01-world-algorithm.png)

에이전트는 모두 오픈AI GPT-5.6의 경량 등급 [Luna](/post/news-gpt56-launch-price-per-result)를 같은 시스템 프롬프트와 온도 0.7, 낮은 추론 강도로 썼습니다. 모델 가중치는 실험 내내 그대로였고, 연구진이 재는 성적은 에이전트에게 보상으로 주지 않았습니다. 800틱 실험에서 에이전트 하나가 받은 결정 기회는 16번이었고, 에이전트 100개를 3,200틱 돌린 장기 실험은 사회 하나에 결정 6,400번, 에이전트 하나에 64번이었습니다. 연구진은 사회를 이루는 장치를 하나씩 빼면서 같은 세계를 네 가지 조건으로 다시 돌렸습니다.

| 조건 | 공유 세계 | 메시지·공개 기록 | 남의 코드 상속 | 구조물 흔적 |
| --- | --- | --- | --- | --- |
| 완전한 문화 | 있음 | 있음 | 있음 | 있음 |
| 통신 없음 | 있음 | 없음 | 있음 | 있음 |
| 명시적 문화 없음 | 있음 | 없음 | 없음 | 있음 |
| 독립 탐색 | 없음(1인 세계 N개) | 없음 | 없음 | 없음 |

독립 탐색은 같은 수의 에이전트를 각자 혼자 사는 세계에 넣고, 지표마다 가장 잘한 한 명의 기록을 뽑는 대조군입니다. 지표마다 다른 에이전트를 골라도 되니 일부러 강하게 만든 기준이고, 공유 세계의 사회가 이 기준을 넘어야 상호작용이 능력을 키웠다고 말할 수 있습니다. 평가는 에이전트 없이 했습니다. 발견 단계의 한 시점에서 세계를 얼려 사본 8개를 만들고, 에이전트를 모두 뺀 채 처음 보는 오염·가뭄·폭풍 일정을 걸어 남은 기술이 서식지를 얼마나 지키는지 쟀습니다.

「검증된 발명」의 기준도 높게 잡았습니다. 시험을 거친 재료와 완성된 설계, 에이전트가 직접 써서 설치한 제어 프로그램, 기준 이상의 성능, 새로운 행동을 모두 갖춘 구조물만 발명으로 셉니다. 아이디어나 설계안만으로는 발명 숫자에 들어가지 않습니다.

## 역할을 정해 주지 않았는데 일이 나뉘었습니다

행동 기록만으로 에이전트를 묶자 두 무리가 나왔습니다. 구조물 가까이에서 짓고 조작하는 무리와 넓게 돌아다니며 관찰하고 시험하는 무리입니다. 에이전트 200개 세계에서 구조물 중심 무리의 비율은 완전한 문화 약 27%, 명시적 문화 없음 20%, 통신 없음 17%였습니다. 3,200틱 장기 실험에서는 완전한 문화가 52.8%, 명시적 문화 없음이 31.0%로 21.8%포인트 벌어졌습니다.

더 잘게 나누면 네 가지 상태가 되풀이됐고, 연구진은 이를 건설·운영자, 구조물 곁 관리자, 문화 조율자, 이동 측량가라고 불렀습니다. 이 상태는 고정되지 않았습니다. 장기 실험의 완전한 문화 사회에서 건설·운영자 비율은 첫 200틱 구간 0.8%에서 마지막 구간 53.5%로 늘었고, 문화 조율자는 69.5%에서 29.2%로 줄었습니다. 명시적 문화를 끈 사회는 마지막까지 이동 측량가가 63.3%로 다수였습니다. 같은 에이전트가 구간마다 상태를 갈아타는 비율도 완전한 문화 쪽이 0.244로, 명시적 문화 없음의 0.138보다 높았습니다.

![200틱 구간으로 나눈 행동 분석. 네 상태(건설·운영자, 구조물 곁 관리자, 문화 조율자, 이동 측량가)의 특징 지도와, 조건별로 시간에 따라 상태 비율이 쌓인 면적 그래프, 구간 사이 상태 전환율 점 그래프가 있습니다.](https://arxiv.org/html/2608.26081v1/figure-21-dynamic-roles.png)

논문 초록이 짚은 대로 지금의 멀티에이전트 시스템은 대개 직접 대화나 미리 정한 역할, 중앙의 작업 흐름에 기댑니다. Cursor는 [계획은 비싼 모델에, 실행은 싼 모델에 맡기는 편성](/post/review-cursor-swarm-planner-worker)으로 SQLite를 다시 짰고, 8월 27일 공개된 구글 Teamwork는 [에이전트 여럿이 서로의 풀이를 고쳐 가며 미해결 문제 7개를 풀었습니다](/post/review-google-antigravity-teamwork-seven-problems). SwarmWorld는 그 편성표를 지우고 같은 모델 수백 개에게 세계만 줬을 때 무엇이 생기는지를 잰 실험입니다.

## 남의 코드를 물려받은 기술

협업은 구조물과 코드에 남았습니다. 완전한 문화 조건에서 여러 에이전트의 손이 기록된 구조물은 에이전트 50·100·200개 세계에서 각각 67%, 76%, 56%였고, 다른 두 조건은 20~30% 안팎이었습니다. 남이 쓴 실행 프로그램을 가져와 고쳐 설치하는 포크는 상속이 허용된 조건이면 통신을 끈 사회에서도 흔했고, 상속을 막은 조건에서는 정확히 0이었습니다.

![위 왼쪽은 조건과 에이전트 수에 따른 다중 제작 구조물 비율, 위 오른쪽은 에이전트 사이 프로그램 포크 비율로 명시적 문화 없음은 0에 붙어 있습니다. 아래는 조상 프로그램 셋이 적응형 키틴 유지보수로 모이고 다시 후손 프로그램 셋으로 갈라지는 계보도입니다.](/figures/vault/paper-mit-swarmworld-emergent-civilization/vault-03-executable-culture.png)

그림 아래쪽의 적응형 키틴 유지보수 프로그램은 조상 프로그램 셋에서 나왔습니다. 그중 한 에이전트가 쓴 수동 재료 시스템은 59번 설치됐고, 적응형 키틴 유지보수에는 공동 저자 6명과 설치 6번이 기록됐으며, 이 프로그램은 다시 후손 셋으로 이어졌습니다. 가장 깊은 계보는 장기 실험의 한 세계(시드 3301)에서 포크 12번을 거쳤습니다. 계보는 내용 해시로 기록된 포크와 설치 이력으로 그렸습니다.

기술 이름도 에이전트가 붙였습니다. 조수 패널, 셀룰로스 격자, 켈프 껍데기 복합재, 균사체 광천 베일 같은 기술이 나왔고, 연구진이 고른 대표 기술 16개의 생애 최고 점수는 0.790에서 0.347까지였습니다. 논문의 기술 그림은 기록된 형상과 조성, 공정, 제어 프로그램으로 그린 시각화이고 실제로 만든 재료의 성능을 보여 주지는 않는다고 연구진이 직접 적었습니다.

![에이전트가 발명한 기술 16개를 그림과 이름, 공정 흐름, 기능, 제어 방식, 재료 조성, 점수와 함께 네 줄로 늘어놓은 도판. 맨 앞은 0.790점의 3층 연결 키틴 교환 격자입니다.](https://arxiv.org/html/2608.26081v1/figure-06-technology-gallery_lr.png)

## 첫 재사용의 95%는 보고 따라 했습니다

기술은 대부분 구조물을 직접 본 에이전트를 통해 퍼졌습니다. 장기 실험에서 완전한 문화 조건 구조물의 99.3%, 명시적 문화 없음 조건 구조물의 96.9%를 만든 에이전트 외의 누군가가 다시 썼고, 첫 재사용까지 걸린 시간의 중앙값은 5틱과 8틱이었습니다. 한 구조물을 쓴 에이전트 수는 평균 13.53명과 7.49명이었습니다.

첫 재사용의 약 95%는 두 조건 모두 구조물을 직접 관찰한 데서 시작했습니다. 만든 에이전트와 처음 쓴 에이전트가 그 직전에 메시지나 가르치기, 거래로 접촉한 비율을 시간 기록을 무작위로 섞은 기준과 비교하자, 가장 짧은 25틱 창에서만 기준보다 약간 높았고 그보다 긴 창에서는 기준에 못 미쳤습니다. 뷸러는 X 글에서 이를 통계적으로 구분되지 않는다고 요약했습니다. 움직인 거리도 비슷했습니다. 에이전트 200개 세계의 대표 시드에서 평균 이동 거리는 세 조건 모두 격자 36~37개였는데, 구조물과 마주친 정도를 잰 접촉 AUC는 완전한 문화 0.31, 명시적 문화 없음 0.14, 통신 없음 0.11이었습니다.

![패널 여섯 개로 된 확산 분석 그림. 만든 이와 채택자의 접촉 도식, 시간을 섞은 기준 대비 접촉 비율, 아직 재사용되지 않은 구조물 비율, 채택자 수 분포, 관찰·인과 참조·프로그램별 채택 경로 비율, 시간에 따른 코드 계보 깊이가 있습니다.](/figures/vault/paper-mit-swarmworld-emergent-civilization/vault-05-diffusion.png)

흰개미는 서로 지시하지 않고도 둥지를 짓습니다. 한 마리가 놓은 흙덩이가 다음 흰개미가 흙을 놓을 곳을 정하기 때문이고, 1959년 프랑스 생물학자 피에르폴 그라세는 이렇게 환경에 남은 흔적이 다음 행동을 이끄는 협력을 스티그머지(stigmergy)라고 불렀습니다. 논문 첫 그림은 SwarmWorld의 뿌리를 세 계열로 그렸습니다. 스티그머지(1959년)와 보이드(1987년), 개미 군집 최적화(1992년)가 한 계열이고, 생명 게임(1970년)과 심시티, 슈가스케이프(1996년)가 또 한 계열, 생성형 에이전트와 Project Sid(2023~2024년)가 마지막 계열입니다. 뷸러는 이번 결과를 추론하는 기계들의 사회에서 작동하는 흰개미의 비법이라고 불렀습니다.

에이전트 수만 보면 SwarmWorld가 가장 크지는 않습니다. 논문이 앞선 연구로 소개한 AgentSociety는 1만 개 넘는 에이전트를 돌렸고, Project Sid도 더 큰 규모에서 전문화와 집단 규칙, 문화 전달을 보고했습니다. 연구진이 내세운 차이는 처음에 똑같은 에이전트, 수정한 흔적을 간직하는 공유 세계, 에이전트의 주장과 따로 기능을 재는 실행 가능한 기술, 같은 결정 기회를 받은 고립 탐색 대조군을 한 실험에 모았다는 점입니다.

7년 전에도 시키지 않은 행동을 만든 에이전트 실험이 있었습니다. 2019년 9월 오픈AI의 숨바꼭질 실험을 지디넷코리아는 「사전학습 없이 알아서 문제 해결하는 AI 가능성 확인」이라는 제목으로 전했습니다. 숨는 쪽은 약 2,500만 번의 게임 끝에 블록으로 문을 막았고, 찾는 쪽은 7,500만 번 무렵 경사로를 썼으며, 3억 8,000만 번이 지나자 블록 위에 올라탄 채 블록을 미는 법을 찾았습니다. 그때 에이전트들은 강화학습으로 수억 판을 치르며 가중치를 바꿔 갔습니다. SwarmWorld의 에이전트는 가중치가 고정된 채, 장기 실험 기준으로 에이전트 하나당 결정 64번 안에서 세계에 남은 구조물과 코드로 배웠습니다.

## 공유 세계가 앞선 것과 뒤진 것

장기 실험은 에이전트 100개 사회를 세 조건으로 3,200틱씩 돌리고 400·800·1,600·2,400·3,200틱에 세계를 얼려 평가했습니다. 마지막 시점의 숫자를 놓으면 이렇습니다.

| 지표(3,200틱, 에이전트 100개, 시드 4개 평균) | 완전한 문화 | 명시적 문화 없음 | 독립 탐색 최고값 |
| --- | --- | --- | --- |
| 포트폴리오 회복력 | 0.2474 | 0.2365 | 0.1794 |
| 검증된 발명 수 | 5.75 | 7.00 | 2.75 |
| 에이전트 없는 회복력 | 명시적 문화 없음과 비슷 | 0.0446 | 0.0356 |
| 가장 강한 최종 인공물 | 0.2380 | 본문에 수치 없음 | 0.3488 |

공유 세계의 두 사회는 기술 묶음의 폭과 중복을 잰 포트폴리오 회복력, 검증된 발명 수에서 독립 탐색을 앞섰습니다. 한데 가장 강한 인공물 하나만 놓고 보면 혼자 일한 에이전트 100명 가운데 최고 기록이 0.3488로, 완전한 문화의 0.2380보다 높았습니다. 연구진은 결론에서 이를 집단의 범위와 개인의 최적화를 가르는 차이라고 정리했습니다.

> 상호작용은 기술 생태계를 짓고 유지하는 일이 성과를 가를 때 가장 값지고, 기록적인 물건 하나를 찾는 것만이 목표일 때는 그렇지 않습니다.
> — Pal·Wang·Buehler, SwarmWorld 논문 결론

문화 장치를 더한다고 모든 지표가 좋아지지도 않았습니다. 완전한 문화는 가장 좋은 인공물 성능에서 800틱 무렵 명시적 문화 없음을 앞질렀고, 포트폴리오 회복력과 누적 구조물 수(277.5개 대 238.5개)에서는 1,600틱 무렵 앞질렀지만, 검증된 발명 수에서는 끝까지 앞지르지 못하고 5.75개 대 7.0개로 끝났습니다. 800틱 확장 실험에서도 에이전트 200개 세계의 발명 수는 독립 탐색보다 명시적 문화 없음이 6.0개, 완전한 문화가 2.0개 많았습니다. 뷸러는 X 글에 소통하지 않는 사회가 포트폴리오 폭과 회복력, 발명 수에서 이긴다고 썼는데, 확장 실험에서는 맞는 말이고 장기 실험 끝에서는 포트폴리오 회복력만 완전한 문화 쪽이 조금 높았습니다.

두 사회가 시간을 쓴 방식도 달랐습니다. 완전한 문화 사회는 장기 실험 끝에 건설·운영자가 절반을 넘었고, 명시적 문화를 끈 사회는 이동 측량가가 63.3%로 남은 채 발명 7.0개를 기록했습니다. 연구진은 문화 채널을 더하면 집단이 무엇을 중심으로 조직되는지가 달라지지만, 조율 비용과 구조적 의존이 함께 들어와 모든 지표에서 더 나은 기능을 보장하지는 않는다고 적었습니다.

## 대화만 감시하면 놓치는 협력

에이전트를 지우는 분석은 기록된 연결망 위에서 한 계산입니다. 에이전트 절반을 무작위로 지워도 완전한 문화 사회 구조물의 98.3%, 명시적 문화 없음 사회의 95.2%가 살아남은 에이전트 하나 이상과 연결돼 있었습니다. 연결이 가장 많은 에이전트부터 지우면 이 비율이 59.6%와 73.9%로, 중개 역할을 하던 에이전트부터 지우면 62.9%와 68.4%로 떨어졌습니다. 완전한 문화는 무작위 이탈에는 강했지만 연결이 소수의 허브에 몰려 표적 제거에는 명시적 문화 없음보다 약했고, 연구진은 이 측정이 실제 세계에서 에이전트를 빼고 다시 돌린 회복 실험은 아니라고 밝혔습니다.

뷸러가 맹점이라고 부른 대목은 다른 실험과도 겹칩니다. 앤트로픽이 8월 13일 공개한 멀티에이전트 실험에서는 [직접 대화할 채널을 모두 없애도 에이전트들이 공개 매물 게시판에 오른 서로의 가격을 보고 페니 단위까지 맞췄습니다](/post/review-anthropic-multiagent-coordination-failure). 8월 10일 나온 마인드 바이러스 논문에서는 [맥락을 지우고 파일 하나만 남긴 사슬에서도 행동 지시 네 가지가 모두 20번째 홉까지 건너갔습니다](/post/paper-mind-viruses-multi-agent). 세 실험 모두 에이전트가 남긴 흔적이 다음 에이전트의 입력이 됐습니다.

저는 이 결과를 사내 에이전트 운영에 대 보면 감사 로그부터 걸린다고 봅니다. 에이전트가 남긴 스크립트와 설정 파일, 위키 문서를 다음 에이전트가 읽는 회사라면, 프롬프트와 응답만 남기는 로그로는 이번 실험에서 첫 재사용 경로의 95%를 차지한 관찰 경로가 보이지 않습니다. 만든 에이전트가 사라진 뒤에도 설치된 프로그램은 계속 돌았다는 점도 같은 문제로 이어집니다.

## 이 결과를 어디까지 믿을 수 있나

연구진은 결론에서 주장을 증거만큼만 하겠다며 한계를 직접 적었습니다. 추론의 근거는 조건마다 짝지은 세계 시드 4개, 모델과 프롬프트 구성 하나, 시뮬레이터가 정의한 재료와 환경 기능입니다. 짝지은 쌍이 4개라 정확 부호 검정으로 얻을 수 있는 가장 작은 양측 p값이 0.125이고, 그래서 논문은 유의성 대신 효과 크기와 짝 사이 일관성, 기제를 앞세웠습니다. 독립 탐색에게도 같은 결정 기회를 줬지만 문화 장치가 있는 쪽은 프롬프트가 길어져 토큰을 더 쓸 수 있어서, 연구진은 토큰 사용량을 따로 보고했습니다.

같은 구조를 화산 지형의 재료 세계 AshenRealm으로 옮기자 성능의 절대값은 낮았지만 다중 제작, 에이전트 사이 코드 재사용, 계보 형성, 구조물 중심과 이동 탐색의 분화가 다시 나타났습니다. 단백질 소재 세계 Protein Realms는 시드 하나로 800틱 돌린 시범이고, 설치까지 간 설계는 3건이라 조건끼리 비교할 근거는 되지 못한다고 연구진이 밝혔습니다. 논문은 코드와 프롬프트, 모델 원출력을 올릴 GitHub와 Hugging Face 주소를 적어 두었습니다.

저자들이 꼽은 다음 단계는 세 가지입니다. 시뮬레이터 대신 원자·연속체 수준의 물리 계산기를 붙이고, 실제 환경 측정값과 센서로 교란을 걸고, 로봇과 자율 실험실로 구조물을 진짜 물건으로 만드는 것입니다. 서로 다른 모델이 섞인 집단, 에이전트의 죽음과 번식, 자원 경제, 같은 세계에 들어온 사람도 앞으로 잴 축으로 적었습니다.

읽어 주셔서 고맙습니다.

초이 드림
