# 샌드박스는 남의 서버에도 여는 앤트로픽, 모델 라우팅은 클로드끼리만
_Training Data · 케이틀린 레세, 앤절라 지앙 · 2026년 7월 14일_
- 매체: 초이의 뉴스레터 · 팟캐스트
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-07-15T10:00
- 링크: https://choi-newsletter.com/post/podcast-training-data-lesse-jiang-claude-platform
- 답하는 질문: 앤트로픽은 왜 다른 회사 모델로 라우팅하지 않나
- 직답: 앤트로픽은 하네스를 모델 계열에 맞춰 조율해야 한다고 보고, 샌드박스는 외부 인프라에 열어도 라우팅은 클로드 모델 안에서만 설계합니다.
- 에피소드: Training Data · https://pscrb.fm/rss/p/traffic.megaphone.fm/CPUAI5412108570.mp3
- 출처: Sequoia Capital, Anthropic’s Katelyn Lesse & Angela Jiang: Building an Ecosystem, not a Walled Garden (Training Data 에피소드 페이지·전사본, 2026-07-14) (https://sequoiacap.com/podcast/anthropics-katelyn-lesse-angela-jiang-building-an-ecosystem-not-a-walled-garden), YouTube, Sequoia Capital 에피소드 영상 (https://www.youtube.com/watch?v=vPnVTHYplrQ), Apple Podcasts 에피소드 페이지 (https://podcasts.apple.com/us/podcast/anthropics-katelyn-lesse-angela-jiang-building-an/id1750736528?i=1000776736492), Anthropic Engineering, Scaling Managed Agents: Decoupling the brain from the hands (2026-04-08) (https://www.anthropic.com/engineering/managed-agents), Claude 블로그, Claude Managed Agents: get to production 10x faster (2026-04-08) (https://claude.com/blog/claude-managed-agents), Claude 블로그, The advisor strategy (2026-04-09) (https://claude.com/blog/the-advisor-strategy), Claude 블로그, New in Claude Managed Agents: dreaming, outcomes, and multiagent orchestration (2026-05-19) (https://claude.com/blog/new-in-claude-managed-agents), Claude 블로그, New in Claude Managed Agents: self-hosted sandboxes and MCP tunnels (2026-05-19) (https://claude.com/blog/claude-managed-agents-updates), Claude 블로그, Agent Harness Design: 3 Patterns for Harnessing Claude's Intelligence (2026-04-02) (https://claude.com/blog/harnessing-claudes-intelligence), Anthropic, Introducing Claude Tag (2026-06-23) (https://www.anthropic.com/news/introducing-claude-tag), Anthropic, Donating the Model Context Protocol and establishing the Agentic AI Foundation (2025-12-09) (https://www.anthropic.com/news/donating-the-model-context-protocol-and-establishing-of-the-agentic-ai-foundation), Claude 블로그, Agent Skills (2025-12-18 개방 표준 공개 추가) (https://claude.com/blog/skills), Anthropic, Introducing Claude Design by Anthropic Labs (2026-04-17) (https://www.anthropic.com/news/claude-design-anthropic-labs), Shopify Engineering, Under the River (2026-05-28) (https://shopify.engineering/under-the-river), Block, Block rolls out Builderbot (2026-06-17) (https://block.xyz/inside/block-rolls-out-builderbot-a-new-suite-of-ai-native-tools-that-changes-the-way-we-ship), Vercel Changelog, Program Claude Code, Codex, Pi and other agent harnesses with AI SDK (https://vercel.com/changelog/program-agent-harnesses-with-ai-sdk), 케이틀린 레세 X, Managed Agents 재설계 글타래 (2026-06-29) (https://x.com/katelyn_lesse/status/2071622050847060039), 앤절라 지앙 X, 합류와 Managed Agents 공개 (2026-04-08) (https://x.com/angjiang/status/2041943510417601019), 앤절라 지앙 X, 지식·실행·조율 (2026-06-01) (https://x.com/angjiang/status/2061298734391320897), 앤절라 지앙 X, 결과와 예산 두 매개변수 (2026-06-11) (https://x.com/angjiang/status/2064887710398152801), 안드레이 카파시 X, Claude Tag (2026-06-23) (https://x.com/karpathy/status/2069547676849557725)
> 앤트로픽 개발자 플랫폼을 이끄는 케이틀린 레세와 앤절라 지앙이 7월 14일 세쿼이아 팟캐스트에 나왔습니다. 샌드박스는 모달·버셀·클라우드플레어 인프라에서 돌려도 된다고 했고, 다른 회사 모델로 작업을 나누는 라우팅은 하지 않겠다고 했습니다.

앤트로픽 개발자 플랫폼 팀을 이끄는 케이틀린 레세(Katelyn Lesse)와 앤절라 지앙(Angela Jiang)이 7월 14일(미국 시각) 공개된 세쿼이아캐피털 팟캐스트 「Training Data」에 나왔습니다. 레세는 1년 전 입사할 때만 해도 플랫폼이 사실상 Messages API 하나였다고 했고, 지금은 에이전트가 코드를 돌리는 샌드박스를 모달·버셀·클라우드플레어 같은 남의 인프라에 둬도 상관없다고 말했습니다. 두 사람이 열지 않겠다고 한 것은 다른 회사 모델로 작업을 나눠 보내는 모델 라우팅 하나였습니다.

방송 2주 전인 6월 29일(미국 시각) 레세가 X에 올린 글타래의 첫 글입니다. Managed Agents의 첫 판은 샌드박스를 띄우고 그 안에서 Claude Code를 부팅하는 API였고, 사내와 소수 고객에게 먼저 써 보게 했더니 문제가 셋 나왔다고 적었습니다. 컨테이너가 떠야 클로드가 생각을 시작할 수 있어 느렸고, 컨테이너가 죽으면 세션 전체가 죽었고, 클로드가 쓴 코드가 MCP 자격증명 바로 옆에서 돌았습니다. 팀은 베타 출시를 미루고 설계를 통째로 다시 했고, 레세는 빨리 내놓기가 쉬워진 지금일수록 출시를 미루고 다시 짓는 데 규율이 든다고 썼습니다.

## 1년 전 Messages API 하나에서

레세가 입사할 무렵의 플랫폼은 MCP 같은 표준과 SDK·문서·콘솔 같은 개발 도구, 그리고 대화 상태를 기억하지 않는 API가 전부였습니다. 모델이 더 오래, 더 많은 맥락을 다루게 되자 고객들이 같은 문제를 거듭 풀고 있는 것이 보였다고 합니다. 보안과 거버넌스를 갖춘 샌드박스를 띄웠다 내리는 일, 멈춘 세션을 이어 가도록 기록을 저장하는 일, 프롬프트 캐싱과 컨텍스트 창 관리 같은 하네스(모델에 도구를 붙여 일을 시키는 실행 틀) 작업입니다. 앤트로픽도 자기 제품을 돌리려고 같은 기반을 매번 세우고 있었다고 했습니다.

그렇게 묶어 낸 것이 4월 8일(미국 시각) 공개 베타로 나온 Claude Managed Agents입니다. 앤트로픽이 운영하는 하네스와 샌드박스, 세션 기록을 한데 묶은 API이고, 요금은 토큰 값에 실행 중인 세션 1시간당 0.08달러가 붙습니다. 같은 날 앤트로픽 엔지니어링 블로그는 레세가 X에 적은 재설계를 풀어 썼습니다. 두뇌(클로드와 하네스)를 손(샌드박스와 도구)과 세션 기록에서 떼어 내자 첫 토큰까지 걸리는 시간이 중앙값 기준 약 60%, 느린 쪽 5%(p95) 기준 90% 넘게 줄었다는 내용입니다.

![하네스를 가운데 두고 세션, 샌드박스, 도구·리소스·MCP, 오케스트레이션이 각각 화살표로 이어진 Managed Agents 구성도](https://www-cdn.anthropic.com/images/4zrzovbb/website/903b624ada206b10753a24c6a1367e74a869165d-1080x1080.png)

블로그는 이 구조를 인터페이스의 모양에는 의견이 뚜렷하고, 그 뒤에서 무엇이 도는지는 가리지 않는 설계라고 소개했습니다. 하네스는 샌드박스를 이름과 입력을 넣고 문자열을 돌려받는 도구 하나로만 다룹니다. 샌드박스를 누구의 서버에서 돌릴지 고객이 고를 수 있게 된 것도 이 분리 덕분입니다.

지앙은 4월 8일 클로드 플랫폼 제품 책임자로 합류했다고 알리며 Managed Agents를 소개했습니다. 그의 관찰로는 아래 단계에서 실험하는 AI 네이티브 스타트업은 기본 부품을 직접 조립하고, 여러 업무 흐름을 엮는 데 집중하는 기업은 묶음 제품을 고릅니다.

## 지식, 실행, 조율

진행자 소냐 황이 추상화를 어떻게 쌓느냐고 묻자 지앙은 플랫폼을 세 겹짜리 케이크에 빗댔습니다. 맨 아래 지식 단계에는 Messages API의 매개변수와 표준화한 도구, 필요할 때 불러 쓰는 스킬과 메모리처럼 클로드로 무언가를 하는 법에 관한 부품이 들어갑니다. 그 위 실행 단계는 파일을 고치고 여러 시스템에서 일을 끝내는 데 필요한 저수준 하네스와 관리형 인프라이고, 지금 그 제품이 Managed Agents라고 했습니다.

지앙은 방송 6주 전인 6월 1일(미국 시각) X에 같은 틀을 적어 두었습니다. 의미 있는 경제적 산출은 지식과 실행과 조율에서 나오고, 가치는 그중 하나의 능력을 키우거나 비용을 줄이거나 속도를 높일 때 생긴다는 글입니다. 대화에서는 이 틀을 로드맵에 겹쳐, 앤트로픽이 내놓는 추상화가 지식에서 실행으로, 실행에서 조율로 옮겨 갈 것이라고 했습니다.

맨 위 조율 단계에서 쓰는 것을 지앙은 「전략」이라고 불렀습니다. 하네스 위에 얹는 메타 하네스로, 토큰마다 조언이나 실행, 되돌아보기 같은 다른 일을 맡기고 그 일들을 엮는 틀이라는 설명입니다. 레세는 같은 토큰을 그냥 실행에 쓸 수도 있고, 지난 세션을 돌아보며 배운 것을 메모리에 적어 다음 에이전트가 잘하게 할 수도 있고, 큰 모델의 조언을 받아 작은 모델이 더 잘 실행하게 할 수도 있고, 채점기가 들어와 다시 하라고 돌려보내게 할 수도 있다고 풀었습니다. 프롬프트 캐싱이나 컨텍스트 정리 같은 아래 단계에서 짜낼 이득은 그 위만큼 크지 않다는 것이 그의 판단입니다. 그가 든 네 가지 일은 이미 앤트로픽 기능 이름을 달고 따로 나와 있습니다.

| 토큰에 맡기는 일 | 앤트로픽 기능 | 공개(미국 시각) | 회사가 밝힌 수치 |
| --- | --- | --- | --- |
| 큰 모델의 조언 | 어드바이저 도구 | 4월 9일 | Haiku에 Opus 조언을 붙이면 BrowseComp 41.2%, 단독 19.7% |
| 지난 세션 돌아보기 | 드리밍(연구 미리보기) | 5월 19일 | 하비의 시험에서 완료율 약 6배 |
| 채점과 재시도 | 아웃컴 | 5월 19일 | 일반 프롬프트 루프보다 과제 성공 최대 10포인트 |
| 일 나눠 맡기기 | 멀티에이전트 오케스트레이션 | 5월 19일 | 에브리의 Spiral은 Haiku가 요청을 받고 Opus 하위 에이전트가 초안 작성 |

어드바이저 도구에서는 Sonnet이나 Haiku가 일을 처음부터 끝까지 하다가 막히는 순간에만 Opus에게 묻고, Opus는 보통 400~700토큰짜리 짧은 계획만 돌려줍니다. 앤트로픽 평가에서 Sonnet에 Opus 조언을 붙이자 SWE-bench Multilingual 점수가 2.7%포인트 오르면서 과제당 비용은 11.9% 줄었습니다. 대화에서 말한 전략은 이렇게 따로 나온 기능들을 한 틀로 엮는 다음 단계입니다.

## 인프라는 남의 것이어도 된다

지앙은 팀의 북극성이 둘이라고 했습니다. 안으로는 사내 팀이 빨리 제품을 내게 돕고, 밖으로는 어떤 개발자든 클로드로 원하는 것을 만들게 한다는 목표입니다. 사내와 사외를 갈라 운영하는 플랫폼 회사도 많지만, 앤트로픽은 일부러 양쪽에 같은 기본 부품을 준다고 했습니다. 소냐 황이 열린 생태계와 닫힌 정원(walled garden) 가운데 어느 쪽이냐고 묻자, 레세는 실행 단계를 예로 들었습니다.

> 이것들을 우리 인프라에서 돌리느냐에 대해서는 사실 까다롭게 굴지 않습니다.
> — 케이틀린 레세, 앤트로픽 (Training Data)

그가 든 증거는 5월 19일(미국 시각) 나온 두 기능입니다. 자체 호스팅 샌드박스(공개 베타)는 에이전트가 도구를 실행하는 환경을 회사 인프라나 클라우드플레어·데이토나·모달·버셀 같은 공급자에 두게 하고, 오케스트레이션과 컨텍스트 관리, 오류 복구를 맡는 에이전트 루프만 앤트로픽 쪽에 남깁니다. MCP 터널(연구 미리보기)은 회사 방화벽 안의 MCP 서버에 공개 주소 없이 닿게 합니다. 회사가 띄운 작은 게이트웨이가 바깥으로 연결 하나만 내고, 들어오는 방화벽 규칙은 열지 않는 방식입니다.

레세는 대화에서 아마존의 새 마이크로VM까지 협력 대상으로 꼽았지만, 5월 19일 발표의 공급자 목록에 아마존은 없습니다. 인프라를 내준 대신 그가 붙든 것은 아키텍처였습니다. 에이전트를 어떻게 조립해야 강하고 믿을 수 있고 확장되는지에는 강한 의견이 있고, 고객은 앤트로픽이 내놓은 인터페이스에 맞추기만 하면 무엇이든 끼울 수 있다는 설명입니다.

표준은 더 멀리 열었습니다. 앤트로픽은 2025년 12월 9일 MCP를 리눅스재단 산하에 새로 만든 에이전틱 AI 재단(AAIF)에 기증했습니다. 재단은 앤트로픽과 블록, 오픈AI가 함께 세웠고 구글과 마이크로소프트, AWS, 클라우드플레어, 블룸버그가 후원했습니다. 기증 당시 공개 MCP 서버는 1만 개를 넘었고, 파이썬과 타입스크립트 SDK의 월간 내려받기는 9,700만 회였습니다. 같은 달 18일에는 스킬을 여러 플랫폼에서 옮겨 쓰는 개방 표준으로 공개했습니다.

지앙은 표준을 함께 세우는 일을 전기에 빗댔습니다. 사이버 공격이나 사기를 막는 안전 기준도 업계가 같이 정할 일이라는 설명입니다.

> 전기가 그토록 큰 변화를 가져온 기술이자 좋은 공공재가 된 까닭은 모든 것에 끌어다 쓸 수 있었기 때문입니다. 그건 누구도 혼자서는 할 수 없는 일입니다.
> — 앤절라 지앙, 앤트로픽 (Training Data)

## 다른 회사 모델로는 보내지 않는다

토큰 값을 아끼는 방법으로 지앙은 과제가 들어오면 복잡도를 가늠해 어려운 일은 크고 똑똑한 모델로, 쉬운 일은 싼 모델로 보내는 설계를 권했습니다. 소냐 황이 앤트로픽도 라우터를 내놓겠느냐고 묻자, 클로드 안에서는 말이 된다며 전략의 하나로 설계할 수 있다고 답했습니다. 다른 회사 모델로 보내는 일에는 관심이 없다고 했습니다.

> 우리는 클로드를 위해 플랫폼을 설계하고 있고, 클로드가 이 모든 문제를 잘 풀게 만들고 싶습니다. 그래서 그 범위 안에 머물 겁니다.
> — 앤절라 지앙, 앤트로픽 (Training Data)

레세는 이유를 하네스에서 찾았습니다. 하네스와 그 위의 에이전트는 함께 쓰는 모델 계열에 맞춰 조율돼야 한다고 굳게 믿는다며, 하네스를 한 번 짜 두고 밑의 모델만 갈아 끼우려던 시기가 있었다고 했습니다. 그는 버셀을 예로 들었습니다. 버셀은 AI SDK 7에 HarnessAgent를 넣어 Claude Code와 Codex, Pi 같은 하네스를 통째로 바꿔 끼우게 했고, 모델을 바꾸던 방식 그대로 이제 하네스를 바꾼다고 소개했습니다.

모델을 한 계열에 묶어 두면 값에서도 차이가 납니다. 앤트로픽이 4월 2일 낸 하네스 설계 안내에 따르면 캐시에서 읽는 토큰은 기본 입력 토큰 값의 10%이고, 캐시는 모델마다 따로 쌓여 세션 도중 모델을 바꾸면 깨집니다. 안내문은 더 싼 모델이 필요하면 모델을 바꾸지 말고 하위 에이전트를 쓰라고 권합니다. 레세가 대화에서 가장 먼저 꼽은 모범 사례도 프롬프트 캐싱이었고, 꼭 하라며 돈과 토큰 비용을 많이 아낀다고 했습니다.

여러 회사 모델을 섞어 쓰는 국내 개발팀에는 이 설계가 곧 선택지의 범위입니다. 앤트로픽 플랫폼 안에서 기대할 수 있는 배분은 Opus와 Sonnet, Haiku 같은 클로드 계열 사이의 배분이고, 다른 회사 모델까지 아우르는 배분은 버셀 AI SDK 같은 바깥 도구로 짜게 됩니다.

## Claude Tag는 슬랙 봇인가

소냐 황은 6월 23일(미국 시각) 나온 Claude Tag를 두고 그냥 슬랙 봇 아니냐는 소란이 있었다며 무엇을 오해했느냐고 물었습니다. Claude Tag는 슬랙 채널에 클로드를 팀원처럼 들이는 기능으로, 채널마다 클로드 하나가 모두와 대화하며 맥락을 쌓고 관리자가 정한 도구와 데이터 범위 안에서 일합니다. 앤트로픽은 공개 글에서 제품팀 코드의 65%를 사내판 Claude Tag가 만든다고 밝혔습니다.

같은 날 안드레이 카파시는 이 기능을 LLM 화면 설계의 세 번째 큰 전환이라고 불렀습니다. 처음에는 찾아가는 웹사이트였고, 두 번째에는 컴퓨터에 내려받는 앱이었으며, 세 번째는 조직 전체의 도구와 맥락을 갖고 사람들 곁에서 일하는 지속적이고 비동기로 움직이는 존재라는 글입니다. 지앙은 대화에서 카파시가 이를 「조직 단위 하네스」라고 잘 표현했다고 전했는데, 카파시의 글에 그 표현이 그대로 있지는 않습니다.

지앙은 사람들이 화면 모양에 매달리지만 Tag에서 봐야 할 것은 물밑에 있다고 답했습니다. 새 동료처럼 채널에 들어와 먼저 쓸모 있는 일을 찾아 주니, 비개발자도 클로드를 불러 경비 처리 같은 일을 물어 해결할 수 있다는 설명입니다.

> 중요한 건 Tag가 그냥 돌아가도록 우리가 속에 넣어 둔 맥락 설계와 아키텍처입니다.
> — 앤절라 지앙, 앤트로픽 (Training Data)

그는 이것을 빙산에 빗대며, 물 위로 보이는 화면은 오늘 슬랙이어도 팀즈나 왓츠앱 단체방, 문자, 이메일처럼 사람들이 모이는 곳이면 어디든 옮겨 갈 수 있다고 했습니다. 레세는 Claude Tag를 누구든 비슷하게 만들 수 있는 부품을 앤트로픽이 사내에서 쓰는 방식대로 묶은 포장이라고 했고, 먼저 같은 것을 만든 회사로 쇼피파이와 블록을 들었습니다.

| 회사 | 슬랙 에이전트 | 공개(미국 시각) | 회사가 밝힌 숫자 |
| --- | --- | --- | --- |
| 쇼피파이 | River | 5월 28일 엔지니어링 블로그 | 병합된 풀리퀘스트 8건 중 1건을 함께 씀 |
| 블록 | Builderbot | 6월 17일 | 하루 작업 20만 건 이상, 주당 풀리퀘스트 약 1,500건 병합(생산 코드 변경의 약 15%) |
| 앤트로픽 | Claude Tag 사내판 | 6월 23일 | 제품팀 코드의 65% |

세 회사가 고른 모양은 같습니다. 슬랙에서 에이전트를 태그해 일을 맡기고, 여럿이 같은 스레드에서 진행을 지켜보며 방향을 잡습니다. 블록은 Builderbot을 자사가 만들어 AAIF에 넣은 오픈소스 에이전트 틀 goose 위에 세웠고, 쇼피파이는 River 밑에 깐 모노레포와 Nix 개발 환경을 설명하며 에이전트를 위해 바꾼 것이 모두 사람에게도 옳은 일이었다고 적었습니다.

## 직접 만드는 제품은 어떻게 고르나

지앙은 앤트로픽이 직접 제품을 내는 기준을 둘로 설명했습니다. 하나는 새로운 제품 형태를 시험하는 일로, 사내에서는 모두가 「이거 충분히 AGI-pilled한가」, 곧 AGI가 온다는 전제로 만들었느냐고 묻고, 1년 동안 잘 통한 것도 다음 해에 맞지 않으면 버리고 다시 시도한다고 했습니다. 4월 17일 앤트로픽 랩스 제품으로 나온 Claude Design은 디자인 시스템에 끼워 맞추던 방식 대신 클로드가 코드만으로 디자인을 만들게 해 본 실험이었다고 했습니다.

다른 하나는 시장 크기이고, 여기서는 토큰을 많이 먹는 분야를 고릅니다. 한 턴을 마치고 결과를 봤을 때 일을 끝내고 넘어가는 분야보다 더 하고 싶어지는 분야를 좋아한다는 기준으로, 코딩이 대표적이고 금융과 법률도 그렇게 골랐다고 했습니다.

## 하네스는 지우고, 검증 로직은 직접 짠다

하네스를 어떻게 짜느냐는 물음에 지앙은 모델 세대 이야기부터 했습니다. 2년 전 하네스는 A에서 B로 곧장 가도록 양옆에 벽을 세우는 비계였지만, 지금 모델은 프롬프트로 방향만 알려 줘도 알아서 갑니다. 그래서 방향을 잡던 부분은 지워도 된다고 자주 권하고, 대신 B에서 C로, 다시 F와 Z를 거쳐 A로 돌아오게 하는 식으로 더 오래 달리게 하는 전략 하네스가 필요해졌다고 했습니다. 앤트로픽이 긴 작업에서 하네스를 다시 짠 과정은 [긴 작업용 하네스 실험](/post/review-agent-harness-architecture)에, 모델은 그대로 두고 하네스만 고쳐 점수를 올린 연구는 [릴리안 웽의 정리](/post/review-lilian-weng-harness-self-improvement)에 있습니다.

과제별 하네스가 필요하냐는 물음에는 필요하다고 답했습니다. 범용 하네스는 없다고 보며, 법률과 금융처럼 한 번 틀리면 대가가 큰 분야에서는 모델이 한 일을 받아 넘길 때 오류를 어떻게 다룰지, 곧 검증 로직을 직접 쥐고 고치는 쪽이 제품의 차이를 만든다고 했습니다. 맥락 이야기는 조금 과하다고 봤습니다. 어느 하네스든 많은 맥락을 다룰 수 있으니 데이터를 가진 쪽이 유리할 뿐이라는 설명입니다.

현장에서 본 것으로 지앙은 API조차 없는 옛 시스템을 컴퓨터 사용 기능으로 잇는 의료 회사들을 꼽았습니다. 레세는 Managed Agents로 만든 에이전트와 다른 회사 모델로 만든 에이전트를 잇고 싶던 고객이 에이전트 위에 MCP 서버를 올려 서로를 도구로 부르게 했다고 소개했습니다.

## 토큰을 아끼는 시기

소냐 황은 토큰을 최대한 쓰던 시기가 지나고 토큰을 합리적으로 쓰는 시기가 왔다고 정리했습니다. 지앙은 지능을 끝까지 끌어올린 다음에는 비용이나 속도가 다음 기준이 된다고 받으면서, 가장 피할 일로 AI 사용을 멈추는 것을 꼽았습니다. 많은 회사에서 AI 지출은 직원들이 알아서 도구를 사들이는 섀도 IT로 불어났고, 정신을 차려 보면 조직 절반이 어떻게든 Claude Code를 깔아 쓰고 있다는 겁니다. IDC 집계로도 2025년 직장인의 56%가 [회사가 승인하지 않은 AI 도구](/post/review-reverse-information-paradox)를 썼습니다.

레세는 스트라이프 시절 이야기를 꺼냈습니다. AWS 청구서를 꼼꼼히 들여다보던 회사라, 누군가 설정을 잘못한 백그라운드 작업이 CPU를 태우며 지출을 늘리면 가드레일로 찾아내 그 엔지니어에게 정중하게 꺼 달라고 부탁했다고 합니다. 그는 AI 비용도 그렇게 다루게 될 거라며 한도를 정해 그 안에 가두는 방식은 위험하다고 했습니다. 밤새 Opus를 돌려 결과를 얻을 수도 있고 전략을 영리하게 짜 같은 결과를 더 싸게 얻을 수도 있으니, 옆에서 들여다보며 고르게 하자는 쪽입니다. 과제에 맞춰 모델과 노력 단계를 고르는 법은 [Claude Code 팀의 설명](/post/review-claude-code-model-and-effort-knobs)에 있습니다.

## 다음은 전략을 조합하는 도구

앞으로 몇 달 안에 무엇을 내놓느냐는 물음에 지앙은 전략을 조합하는 도구를 들었습니다. 버그를 찾는 에이전트라면 보통 더 큰 모델로 바꾸거나 더 오래 돌리는 두 손잡이만 쓰는데, 실험해 보면 여러 번 돌려 가장 좋은 결과를 고르는 best-of-N이라는 세 번째 손잡이가 생각보다 효과가 크다고 했습니다. 논문으로는 잘 알려진 방법이지만 실제 사용자에게 시험할 수 있는 제품으로 만들기는 몹시 어렵고, 어려우면서 효과가 있는 일을 쉽게 만드는 것이 플랫폼의 일이라는 설명입니다.

진행자 로런 리더가 1년 전 유행한 에이전트 스웜을 떠올리자 지앙은 그것도 전략의 한 종류라고 했습니다. 사내에서는 토큰에 맡길 일을 다섯 가지쯤 떠올릴 수 있지만 생태계에 풀면 10만, 20만 가지 조합이 나올 수 있다는 것이 그의 짐작입니다.

레세가 그린 끝 그림도 같은 방향입니다. 지금 Managed Agents는 도구와 스킬, 시스템 프롬프트, MCP 서버를 고객이 직접 정하는 손잡이가 많지만, 언젠가는 원하는 결과와 쓸 예산만 알려 주면 에이전트가 나머지를 알아서 하는 데까지 가고 싶다고 했습니다. 지앙도 방송 한 달 전 X에 마지막 AI API의 매개변수는 결과와 예산 둘뿐이고, 사람에게 남는 일은 무엇을 할지와 그 일이 얼마의 가치인지, 누가 책임지는지라고 적었습니다.

대화에서 나오지 않은 것도 있습니다. 전략 조합 도구의 출시 시점과 가격, 클로드 계열 안에서 작업을 나누는 라우터가 따로 제품이 될지는 두 사람 모두 말하지 않았습니다. Claude Tag는 지금 클로드 팀·엔터프라이즈 요금제에서 슬랙 베타로만 쓸 수 있고, 앤트로픽은 다른 업무 도구로 넓히는 것이 목표라고만 밝혔습니다.

읽어 주셔서 고맙습니다.

초이 드림
