# "토큰은 입력, 결과는 실험" 평가를 새 PRD라 부르는 앤트로픽 첫 기술 PM
_Lenny's Podcast · 다이앤 펜 · 2026년 7월 26일_
- 매체: 초이의 뉴스레터 · 팟캐스트
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-07-27T10:00
- 링크: https://choi-newsletter.com/post/podcast-lennys-dianne-penn-evals-prds
- 답하는 질문: 앤트로픽 PM은 어떻게 일하나
- 직답: 다이앤 펜은 지시를 안 따른다는 불만의 80%가 JSON 문제임을 찾아 평가셋으로 만들었다며, 팀에서는 평가를 새 PRD라 부른다고 말했습니다.
- 에피소드: Lenny's Podcast · https://pscrb.fm/rss/p/api.substack.com/feed/podcast/207214207/aaa7067cd960f0369661f0976cbe3d0a.mp3
- 출처: Lenny's Podcast, Anthropic's first technical PM on token maxing, the jagged edge, and living in the future | Dianne Penn (2026-07-26) (https://www.lennysnewsletter.com/p/anthropics-first-technical-pm-on), YouTube, Lenny's Podcast 에피소드 영상 (https://www.youtube.com/watch?v=tivaWTTVRhY), 레니 라치츠키 X, 에피소드 공지 (7월 26일) (https://x.com/lennysan/status/2081487886856380855), Anthropic, Introducing Labs (2026-01-13) (https://www.anthropic.com/news/introducing-anthropic-labs), Anthropic, Golden Gate Claude (2024-05-23) (https://www.anthropic.com/news/golden-gate-claude), Anthropic, Introducing the next generation of Claude (2024-03-04) (https://www.anthropic.com/news/claude-3-family), Anthropic, Introducing Claude Opus 4.5 (2025-11-24) (https://www.anthropic.com/news/claude-opus-4-5), Anthropic, Introducing Claude Tag (2026-06-23) (https://www.anthropic.com/news/introducing-claude-tag), Y Combinator Lightcone, Tokenmaxxing: How Top Builders Use AI To Do The Work Of 400 Engineers (2026-05-08) (https://www.ycombinator.com/library/Pa-tokenmaxxing-how-top-builders-use-ai-to-do-the-work-of-400-engineers)
> 앤트로픽 첫 기술 PM 다이앤 펜이 7월 26일 Lenny's Podcast에서 팀 안에서는 평가가 새 PRD로 통한다고 밝혔습니다. 토큰 맥싱 유행에는 토큰은 입력이고 목표로 삼을 결과는 실험이라고 답했고, 올해 2분기에만 2024년 1년보다 많은 모델을 냈다고 했습니다.

앤트로픽에서 AI 연구와 랩스(Labs) 조직의 제품을 이끄는 다이앤 펜(Dianne Penn)이 7월 26일(미국 시각) 공개된 Lenny's Podcast에 나왔습니다. 제품 팀이 엔지니어 5명뿐이던 2023년 앤트로픽의 첫 기술 PM으로 합류한 그는, 자기 팀에는 평가(eval)가 새 PRD라는 말이 있다고 소개했습니다. 토큰을 최대한 많이 쓰라는 토큰 맥싱 유행을 두고는 토큰 사용량은 입력일 뿐이고 목표로 삼을 결과는 실험이라고 답했습니다.

레니 라치츠키는 공개 당일 X에 펜이 제품 엔지니어가 5명뿐이던 2023년 첫 기술 PM으로 들어가 Claude 2부터 Mythos까지 모든 Claude 모델의 출시를 도왔다고 소개하며 대화 목차를 올렸습니다. 쇼노트에 따르면 그는 Claude Code와 MCP(모델을 외부 도구와 데이터에 잇는 표준), Skills, 컴퓨터 사용, 도구 사용, 추론 기능의 인큐베이션에도 참여했습니다. 앤트로픽 전에는 아마존에서 알렉사의 AI를 만들었고, 그보다 앞서 JP모건 체이스에서 4년 동안 하이일드 채권을 거래했습니다. 트레이딩 데스크의 유일한 여성이던 그는 가장 어린 사람이라도 가장 좋은 아이디어에 확신을 가지면 된다는 것을 그때 배웠다고 했습니다.

방송 이틀 전인 7월 24일(미국 시각) 앤트로픽은 최상위 모델 Fable 5의 절반 가격에 [Claude Opus 5](/post/news-opus5-launch-half-price)를 내놓았습니다. 6월 9일 공개한 Fable 5와 Mythos 5는 3일 만에 미국 상무부의 수출통제 지시로 모든 고객에게서 내려졌다가 [6월 30일에야 통제가 풀렸습니다](/post/news-fable5-mythos5-export-control-lifted). 펜은 방송에서 2024년에는 1년 동안 모델을 네 번, 또는 네 계열을 냈는데 올해는 2분기에만 그보다 많이 냈다고 했습니다.

## 제품 엔지니어 5명, API 담당 1명

펜이 합류한 2023년 앤트로픽의 제품 엔지니어는 5명이었고, API 사업 전체를 엔지니어 한 명이 맡았다고 합니다. 그는 초기 몇 년을 이 기술이 사용자와 사회에 어떤 가치를 줄 수 있는지 찾아 헤맨 시기로 기억했습니다. claude.ai라는 또 하나의 채팅 비서로 시작해 도구 사용 같은 기능으로 넓혀 가던 무렵입니다.

팀이 자기 색을 찾기 시작한 순간으로는 골든게이트 Claude를 꼽았습니다. 앤트로픽은 2024년 5월 Claude 3 Sonnet 안에서 개념에 반응하는 특징(feature) 수백만 개를 찾아낸 해석 가능성 논문을 냈고, 그중 금문교 특징의 세기를 끌어올린 모델을 claude.ai에 24시간 동안 열었습니다. 스파게티 조리법을 물어도 금문교 이야기로 돌아오는 모델이었습니다. 펜에 따르면 엔지니어링과 제품, 디자인, 연구 팀이 24시간 안에 이 경험을 만들었고, 실제로 써 본 사람은 2,000명쯤이었을 거라고 했습니다.

![금문교 사진 세 장을 색이 다른 판으로 이어 붙인 앤트로픽의 골든게이트 Claude 대표 이미지](https://www-cdn.anthropic.com/images/4zrzovbb/website/b9cae5bd58125d8650c5ae390ee9b054c0eb8ae9-1920x1080.jpg)

큰 전환점으로는 Claude 3 Opus를 먼저 들었습니다. 직원이 200명이 안 되던 때 추론과 연구, 미세조정, 사전학습 팀이 몇 달 동안 한 목표에 매달렸고, 12월에는 다들 부모님 집 어릴 적 방에서 화상으로 모여 훈련 결과를 들여다봤다고 합니다. 앤트로픽은 2024년 3월 4일 Claude 3 모델군을 공개했고, 펜은 그때 함께 일한 연구 리더들이 지금 강화학습과 Claude의 성격, 정렬 연구를 이끈다고 했습니다.

코딩도 그때 방향이 잡혔습니다. 펜은 자신이 합류한 2023년에는 앤트로픽과 Claude와 코딩을 한 문장에 넣는 사람이 없었고, 경쟁 모델 GPT-4도 코딩을 여러 쓰임새 가운데 하나로 쓰는 정도였다고 했습니다. 사람들이 자동 완성을 넘어 긴 코드를 통째로 모델에 맡기는 것을 보고 Opus 3를 그쪽으로 더 훈련시켰는데, 훈련 관점에서는 비교적 작은 변화였지만 초기 개발자들을 끌어오는 차별점이 됐다고 합니다. 펜이 방송에서 짚은 출시를 앤트로픽 발표 날짜로 늘어놓으면 이렇습니다.

| 날짜(미국 시각) | 있었던 일 |
| --- | --- |
| 2024년 3월 4일 | Claude 3 모델군 공개 |
| 2024년 5월 23일 | 골든게이트 Claude, 24시간 연구 시연 |
| 2025년 11월 24일 | Claude Opus 4.5 공개 |
| 2026년 1월 13일 | 랩스 확대, 마이크 크리거 합류 |
| 2026년 6월 9일 | Fable 5·Mythos 5 공개, 6월 12일 수출통제로 중단 |
| 2026년 6월 23일 | Claude Tag 베타 공개 |
| 2026년 7월 24일 | Claude Opus 5 공개 |

## 프런티어 모델에는 프런티어 제품이 필요하다

레니가 꼽은 다음 전환점은 1년 뒤 겨울 방학 무렵의 Opus 4.5였습니다. 앤트로픽은 2025년 11월 24일 Claude Opus 4.5를 내놓았고, 펜은 이번에는 모델과 함께 Claude Code라는 제품이 있었다고 했습니다. 팀은 그 전부터 몇 달 동안 Claude Code의 힘을 느꼈지만, 폭넓은 사용자가 새 쓰임새에서 일을 처음부터 끝까지 맡길 수 있을 만큼 모델이 똑똑해진 것이 전환점이었다는 설명입니다.

> 프런티어 모델을 가지려면, 그리고 사람들이 프런티어 모델의 마법을 느끼게 하려면 프런티어 제품이 필요합니다.
> — 다이앤 펜, 앤트로픽 AI 연구·랩스 제품 책임자 (Lenny's Podcast)

펜은 Claude Code가 없었다면 Opus 4.5의 그 순간도 없었고, Opus 4.5가 없었다면 Claude Code의 확산도 그만큼 빨라지지 않았을 거라고 했습니다. 이런 제품을 키우는 곳이 랩스입니다. 앤트로픽은 1월 13일 랩스를 넓히며 Claude Code가 연구 프리뷰에서 6개월 만에 10억 달러 규모 제품이 됐고 MCP는 월 1억 회 다운로드로 업계 표준이 됐다고 적었고, 인스타그램 공동창업자인 마이크 크리거 최고제품책임자가 벤 만과 함께 랩스로 옮긴다고 밝혔습니다.

펜은 랩스의 일을 원래 로드맵에 없는 불연속적인 큰 베팅의 실마리를 당겨 보는 것으로 설명했습니다. 주제에 대한 의견은 강하게 쥐되 구체적인 시제품에는 느슨하게 매이고, 아직 안 되는 아이디어는 모델 한두 세대 뒤에 다시 꺼냅니다. 팀은 작아서 엔지니어 한 명으로 시작하는 아이디어도 있고, 중간에 끄는 베팅도 많습니다. 그가 팀에 자주 던지는 물음은 Claude 8이 나오면 사용자가 하는 일이 무엇이 달라지고, 지금 만드는 제품이 그 경험과 앞으로도 맞물리느냐는 것입니다.

## 토큰은 입력, 결과는 실험

레니는 Y 콤비네이터 대표 게리 탠의 말이라며, 지금 토큰에 1년에 10만 달러를 쓸 각오가 있으면 2028년의 사람처럼 살 수 있다는 주장을 꺼냈습니다. 그때가 되면 토큰이 싸져 누구나 그렇게 일할 테니 지금 미래를 앞당겨 살라는 이야기이고, 레니는 이것을 토큰 맥싱이라고 불렀습니다. 탠은 5월 YC 팟캐스트 라이트콘에서도 자료 한 건에 만족하지 말고 20건을 모아 교차 확인하라며, 돈이 더 들어도 토큰 맥싱을 하라고 말했습니다.

> 토큰 지출은 입력에 가깝고, 진짜 결과는 실험입니다. 목표를 실험에 맞춘다면 그쪽이 결과를 더 잘 정의하는 방식일 것 같습니다.
> — 다이앤 펜, 앤트로픽 AI 연구·랩스 제품 책임자 (Lenny's Podcast)

그래도 직접 써 보는 일을 대신할 방법은 없다고 했습니다. 앤트로픽에서 가장 창의적인 사람들과 뛰어난 시제품 제작자들은 새 연구 모델이 나올 때마다 Claude와 많은 시간을 보내고, 기술이 이만큼 빨리 움직일 때는 직접 만져 보지 않고 완벽한 전략을 짜기 어렵다는 이유입니다. 그가 함께 꼽은 방법은 사내에서 공개적으로 일하기입니다. 제품이 몇 개 없던 초기에는 회사 거의 전체가 모인 슬랙 채널에서 Claude의 초기 버전을 시험했는데, 누군가 에세이 교정이나 이메일 문구 같은 쓰임새를 올리면 다른 사람들이 변형을 시도했고 요청 10번쯤 안에 새 쓰임새가 튀어나왔다고 합니다. 펜은 실험이 꼭 혼자 하는 운동은 아니라고 했습니다.

토큰을 얼마나 쓰느냐보다 무엇을 얻느냐를 보자는 말은 국내 행사에서도 나왔습니다. 7월 8일 오픈AI 서울 코덱스 밋업의 발표는 토큰을 아끼는 것보다 들인 비용에 비해 얻은 결과를 따지는 [가치 맥싱](/post/review-codex-five-ways-to-use)을 꼽았습니다. 6월 15일 한국에서 열린 오픈AI 행사에서는 한 참석자가 마크 첸 최고연구책임자에게 [토큰 맥싱보다 아웃컴 맥싱](/post/review-ideal-harness-is-no-harness)으로 가야 하지 않느냐고 물었고, 첸은 둘 다 맞지만 중요한 것은 결과라고 답했습니다.

## 평가가 새 PRD다

펜의 팀은 연구 조직 곁에서 일하는 제품 팀입니다. 비전과 컴퓨터 사용, 코딩과 에이전트 코딩, 도구 사용, 테스트 시점 연산(모델이 답을 내기 전에 더 오래 생각하게 하는 계산)처럼 사용자에게 바로 닿는 영역에서, 사용자 피드백을 연구자가 알아듣고 손댈 수 있는 형태로 옮겨 넘깁니다. claude.ai에서 Claude가 환각을 일으켰다는 피드백을 그대로 들고 가 고쳐 달라고 하면 연구자가 손쓸 방법이 마땅치 않기 때문입니다.

그래서 팀은 사용자가 동의한 기록을 열어 실패의 경로를 따라갑니다. Claude가 그 순간 도구를 불렀어야 했는지, 맞는 문서를 봤는데 틀린 사실을 뽑았는지를 가르면 앞의 경우는 도구 사용의 실패, 뒤의 경우는 검색과 종합의 실패가 되고, 정렬의 문제일 수도 있습니다. 펜은 픽셀을 붙들고 씨름하던 만큼 토큰도 붙들고 씨름하라고 했습니다. 예전 사용자 인터뷰에서 화면을 따라가며 흐름을 들었다면, 이제는 실패한 대화 기록을 깊이 읽는다는 겁니다.

> 우리 팀에는 평가가 새로운 PRD라는 말이 있습니다.
> — 다이앤 펜, 앤트로픽 AI 연구·랩스 제품 책임자 (Lenny's Podcast)

이 방식은 펜의 팀이 앤트로픽 안에서 처음 시작했다고 합니다. Claude 2 시절 Claude가 지시를 잘 따르지 않는다는 피드백이 많아 사용자들에게 어떤 문단을 줬고 무엇을 물었고 Claude가 어떻게 답했는지까지 캐물었더니, 불만의 80%쯤은 Claude가 JSON 형식을 제대로 쓰지 못하는 문제였습니다. 정해진 형식을 못 쓰면 API를 부르지도, 도구를 쓰지도 못하니 지금 Claude가 에이전트로 일하는 바탕이 되는 능력입니다. 팀은 Claude가 JSON을 틀리게 쓰는 예시 30~40개로 평가셋을 만들어 저장소에 넣었고, 새 버전의 Claude가 나올 때마다 이 평가를 돌립니다. 지금은 늘 100%나 99.9%가 나와 더는 문제로 남아 있지 않다고 했습니다.

레니는 이것을 PM을 위한 테스트 주도 개발이라고 불렀습니다. PRD도 여전히 씁니다. 앤트로픽은 모델마다 PRD를 쓰는데, 연구자보다는 늘어나는 제품 조직과 엔지니어링 팀, 법무와 안전 같은 이해관계자가 한 방향으로 노를 젓도록 목표를 모아 둔 기준 문서입니다. 컴퓨터 사용처럼 출시 전이라 사용자 불만이 쌓이지 않은 모호한 기회를 탐색할 때도 제품 비전을 담은 PRD가 쓸모 있다고 했고, 레니는 한 달 전 같은 방송에서 [PRD가 죽었다는 말은 틀렸다고 한](/post/podcast-lennys-andrew-ambrosino-product-work) 오픈AI 코덱스 앱의 앤드루 암브로시노와 같은 결론이라고 정리했습니다.

펜은 자기 팀의 채용 과정을 3년 동안 바꾸지 않았다고 했습니다. 먼저 보는 것은 첫 원리부터 따지는 사고로, 소비자 제품이나 B2B SaaS에서 하던 방식을 그대로 가져오는 대신 지금 이 사용자 집단과 이 기술에서 사용자 가치가 무엇인지 따지는 능력입니다. 경력이 긴 PM도 신입과 똑같은 온보딩을 거쳐 사용자 피드백을 읽고 고객을 만나며, 펜 자신도 모델이 나올 때마다 작업 흐름 한두 개를 직접 맡아 모델이 얼마나 빨리 나아지는지 감을 유지한다고 했습니다.

## 들쭉날쭉한 능력, 이번에는 글쓰기

AI가 쓴 글은 여전히 티가 난다는 레니의 말에 펜은 이 기술의 능력이 고르지 않고 들쭉날쭉하다(jagged)는 말로 답했습니다. 모델이 글은 잘 쓰는데 에이전트 일에 약하던 때는 도구를 제대로 부르는 쪽에 훈련을 모았고, 그 부분이 나아지자 이제 글쓰기가 가장 거친 부분으로 남았다는 겁니다. 그는 자기 팀과 연구 쪽에서 Claude의 글쓰기를 낫게 만드는 작업이 활발하다고 했고, 앞으로는 누가 썼는지보다 누가 검증하고 서명하는지가 중요해진다고 봤습니다.

펜은 월간 사업 보고서처럼 형식이 정해진 글은 Claude가 처음부터 끝까지 쓰고 자기는 검토하고 확인하는 쪽으로 가고 싶다고 했습니다. 판단이 들어가는 글은 반대로 자기 관점을 먼저 세운 뒤 Claude와 다듬습니다. 그에게는 생각하는 과정과 쓰는 과정이 붙어 있어서, Claude가 생각을 통째로 가져가지 않게 하려는 순서입니다.

그가 Claude에게 기대하는 것은 동의보다 반박입니다. 정렬과 안전 연구가 여기서 도움이 된다며, 다음 버전 Claude의 가격을 제대로 정하고 있는지 연구용 Opus에게 따져 보게 한 적도 있다고 했습니다. 관리자로서는 『결정적 순간의 대화(Crucial Conversations)』의 내용을 담은 스킬을 만들어, 어려운 대화를 앞두고 어느 정도 깊이로 말할지 Claude와 미리 맞춰 본다고 했습니다. 요즘 가장 아끼는 제품으로는 슬랙 채널에 Claude를 팀원처럼 들여 누구나 태그해 일을 맡기는 Claude Tag를 꼽았는데, 앤트로픽은 6월 23일 이 기능을 공개하며 제품 팀 코드의 65%를 사내 버전 Claude Tag가 만든다고 밝혔습니다.

## 이미 있는 안전장치와 예고한 안전장치

레니는 Mythos 계열처럼 뛰어난 모델에 제한이 붙으면 최신 모델을 안에서만 쓰는 연구소가 바깥보다 유리해진다고 짚었습니다. 펜은 정책과 수출통제는 담당자에게 맡기겠다며 제품 쪽 이야기로 답했습니다. Fable 이전 모델에는 대체 사용자 경험과 시스템이 약했고, 그래서 위험 소지가 있는 요청에도 사용자가 한 단계 아래 모델에게서 좋은 답을 받도록 대체 장치를 만들었다는 겁니다.

실제로 6월 9일 나온 Fable 5는 사이버 보안과 생물학 관련 요청을 Opus 4.8이 대신 답하게 했고, 수출통제가 풀린 뒤에는 새 분류기에 걸린 요청을 사용자에게 알린 뒤 Opus 4.8로 넘겼습니다. 7월 24일 Opus 5와 함께 안전 분류기에 걸린 API 요청을 다른 모델로 자동으로 넘기는 기능도 베타로 나왔습니다.

펜이 앞으로의 일로 예고한 것은 모델 안전장치 묶음(model safeguards package)의 개선으로, 앞으로 몇 주와 몇 달 동안 더 자주 보게 될 거라고 했습니다. 범용 기술은 가능한 한 많은 사람이 쓰게 하는 것이 목표이고, 안팎의 격차를 줄이는 일이 지금 최우선 과제 가운데 하나라는 말도 덧붙였습니다.

## 사람의 판단이 남는 곳

사람의 머리가 어디서 계속 쓸모 있겠느냐는 물음에 펜은 판단을 먼저 꼽았습니다. 수많은 뉘앙스와 경험이 쌓여 생기는 판단은 AI 시스템이 아직 사람만큼 겪어 보지 못한 영역이라는 이유이고, 끈기와 먼저 나서는 태도, 생물학과 생명과학 같은 분야의 전문성도 들었습니다. PM이 아직 필요하냐는 업계의 물음에는 사용자가 무엇을 이루려는지 세부까지 파고들어 실행할 수 있는 형태로 끌어올리는 사람이 오히려 더 필요하다고 답했습니다.

저는 이 대화에서 국내 PM이 바로 가져다 쓸 만한 것으로 JSON 사례의 순서를 꼽습니다. 모호한 불만을 사례 수준까지 캐묻고, 실패하는 예시 수십 개로 재현하고, 새 모델이 나올 때마다 같은 시험을 돌리는 일에는 연구 조직도 큰 토큰 예산도 들지 않기 때문입니다. 펜은 방송 끝에 제품 화면에서 누른 평가 버튼과 영업 담당자에게 남긴 모델 피드백이 자기에게까지 올라온다며 Claude가 어디서 무너지는지 알려 달라고 했고, 팀이 사람을 뽑고 있다고 덧붙였습니다.

읽어 주셔서 고맙습니다.

초이 드림
