# 토큰 100억 개를 쓰고 코드는 한 줄도 짜지 않았습니다
_코덱스 앱을 이끄는 앤드루 암브로시노는 이제 비싼 것이 안목과 큐레이션이라고 했습니다. 추론 비용은 3년 사이 1,000분의 1이 됐고, MIT 조사에서는 기업 95%가 생성형 AI로 아무 수익을 거두지 못했습니다._
- 매체: 초이의 뉴스레터 · 아티클
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-07-19
- 링크: https://choi-newsletter.com/post/review-taste-curation-cognitive-moat
- 답하는 질문: AI 시대 경쟁력은 어디서 나오나
- 직답: 같은 모델을 써도 결과는 무엇을 남기고 버릴지 고르는 안목에서 갈리며, 5만 달러 도구 대신 월 20달러 챗GPT로 돌아간 변호사가 그 예입니다.
- 출처: Lenny's Podcast, 앤드루 암브로시노 (오픈AI 코덱스 앱 리드) (https://www.youtube.com/watch?v=P3KDebPTUrw), 안드레 카파시, YC AI Startup School 강연 (2025년 6월) (https://www.youtube.com/watch?v=LCEmiRjPEtQ), Latent Space, 카파시 강연 슬라이드 정리 (https://www.latent.space/p/s3), 안드레 카파시 X (2023년 1월) (https://x.com/karpathy/status/1617979122625712128), 토비 뤼트케 X, 컨텍스트 엔지니어링 (2025년 6월) (https://x.com/tobi/status/1935533422589399127), 안드레 카파시 X, 컨텍스트 엔지니어링 (2025년 6월) (https://x.com/karpathy/status/1937902205765607626), a16z, LLMflation (2024년 11월) (https://a16z.com/llmflation-llm-inference-cost/), MIT NANDA, State of AI in Business 2025 (https://mlq.ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report.pdf), 안드레 카파시, LLM 위키 구성 (https://gist.github.com/karpathy/442a6bf555914893e9891c11519de94f), Forte Labs, Introducing the AI Second Brain (https://fortelabs.com/blog/introducing-the-ai-second-brain/), Correlation One, Your Knowledge Base Is the Moat (https://www.correlation-one.com/blog/your-knowledge-base-is-the-moat-why-95-of-enterprise-ai-fails-and-how-to-be-in-the-5), NVIDIA, Autoresearch 워크플로 데모 (https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/), 샘 올트먼, The Gentle Singularity (2025년 6월) (https://blog.samaltman.com/the-gentle-singularity)
> 같은 기술을 쓴다는 5만 달러짜리 계약서 분석 도구를 두고, 한 변호사는 월 20달러 챗GPT로 돌아갔습니다. 결과를 가른 것은 모델 밖에 있었습니다.

저는 매주 코덱스 토큰이 리셋되는 것을 지켜봅니다. 지난 한 주 두 계정으로 쓴 토큰이 **100억 개**쯤 되는데, 코드를 짜는 데는 한 줄도 쓰지 않았습니다. 자료를 모으고, 겹치는 내용을 걷어내고, 흩어진 개념을 다시 잇는 데 전부 썼습니다. 그 코덱스 앱을 만드는 사람도 요즘 비싸진 것은 코드가 아닌 다른 쪽이라고 말합니다.

## 토큰 100억 개가 들어간 곳

저는 초등학교 때 코딩을 처음 배웠고 소프트웨어학과를 나와 오래 코드를 짜 왔습니다. 그런 제가 지금 토큰 대부분을 쓰는 곳은 4월에 이미 9,000개를 넘긴 스레드 글을 옵시디언으로 옮겨 정리하는 일입니다. 무엇을 남기고 무엇을 버릴지, 어떤 자료를 어느 개념 옆에 붙일지를 하나하나 정합니다.

코딩 에이전트는 원래 코드를 뽑아내는 연료로 토큰을 씁니다. 저는 같은 도구를 제 머리로 들어올 재료를 다듬는 데 씁니다. 같은 도구를 쥐고도 어디에 겨누느냐에서 결과가 갈린다고 보기 때문입니다.

## 코덱스 앱 책임자가 꼽은 비싼 것

오픈AI에서 코덱스 데스크톱 앱의 제품과 엔지니어링을 이끄는 앤드루 암브로시노는 6월 레니스 팟캐스트에서 제품을 만드는 과정이 통째로 뒤집혔다고 했습니다. 예전에는 구현이 비싸서 문서와 조사, 프로토타입으로 앞단의 위험을 줄였는데, 이제 그 전제가 없어졌다는 이야기입니다.

> 구현은 더 이상 비싼 부분이 아닙니다. 비싼 것은, 감히 말하자면 안목입니다. 큐레이션 과정입니다.
> — 앤드루 암브로시노, 오픈AI 코덱스 앱 리드

그가 든 예는 이렇습니다. 기능 하나를 두고 시도가 90개씩 쏟아지면, 그중 무엇이 좋은지 골라 엮는 감각이 값을 갖습니다. 코덱스 앱의 코드는 이미 100% AI가 쓰고 있고, 팀 안의 질문도 AI가 코드를 몇 퍼센트 쓰느냐에서 그 코드를 사람이 감독했느냐로 옮겨 갔다고 했습니다. 오픈AI 안에서는 마케팅과 홍보, 재무, 법무 직원까지 코덱스 앱을 쓴다고 합니다. 코드를 보여 주고 명령마다 실행 승인을 묻는, 엔지니어가 아닌 사람에게는 불친절한 앱인데도 그렇습니다.

앤드루 암브로시노, 레니스 팟캐스트

도구를 파는 사람이 도구로 못 하는 일을 가장 비싸다고 부르니, 제 입장에 유리한 말이라는 의심은 나올 수 있습니다. 그래도 근거는 제품 바깥의 산수에 있습니다. 시도 90개를 만드는 비용이 0에 가까워질수록, 90개를 읽고 하나를 고르는 사람의 시간이 전체 공정에서 차지하는 비중은 커집니다.

## 만드는 값이 3년에 1,000분의 1로 내려갔습니다

만드는 일이 싸진 과정은 몇 개의 문장으로 따라갈 수 있습니다. 안드레 카파시는 2023년 1월 X에 가장 뜨거운 새 프로그래밍 언어는 영어라고 적었고, 2025년 6월 YC 강연에서는 프롬프트가 곧 프로그램인 시대를 소프트웨어 3.0이라고 불렀습니다.

젠슨 황은 2023년 5월 컴퓨텍스 기조연설에서 이제 모두가 프로그래머라고 했습니다. 만드는 능력의 상당 부분은 사람보다 모델 쪽에 있습니다. 암브로시노는 2월에 낸 코덱스 앱이 작년 11월에 나왔다면 시장에서 완전히 실패했을 것이고, 두 시점의 차이는 모델뿐이었다고 했습니다. 올해 2월 말 Gemini 3 서울 해커톤에서 만난 구글 딥마인드 개발자 커뮤니티 총괄 아밋 바디도 지금을 누구나 빌더가 되는 행동의 시대라고 불렀습니다.

값도 같은 방향으로 움직였습니다. a16z는 2024년 11월 분석에서 같은 성능을 내는 모델의 추론 비용이 해마다 10분의 1로 떨어져, 3년 사이 1,000분의 1이 됐다고 계산했습니다. 이름은 LLM 인플레이션을 비튼 LLMflation입니다.

![MMLU 42점 이상을 내는 가장 싼 모델의 100만 토큰당 가격이 GPT-3 60달러에서 라마 3.2 3B 수준까지 떨어진 그래프](https://d1lamhf6l6yk6d.cloudfront.net/uploads/2024/11/LLMflation-Inline-1.png)

가치는 희소성에서 나옵니다. 5년에서 10년을 배워야 넘던 진입 장벽이 말 몇 마디로 내려오면, 그 장벽을 넘느라 쌓은 경력의 값도 함께 내려갑니다. 토큰이 이만큼 싸지면 희소해지는 것은 토큰을 어디에 쓸지 정하는 판단이고, 암브로시노는 그것을 무엇이 신호이고 무엇이 잡음인지 가려내는 능력이라고 불렀습니다.

## 엑셀을 쓸 줄 안다고 재무팀에서 일하지는 못합니다

누구나 만들 수 있게 된 뒤 조직에서 먼저 흔들리는 것은 직무의 경계입니다. 암브로시노는 코덱스 팀에서 디자이너가 엔지니어의 말을 쓰고 PM이 코드를 짜는 일이 회사 어느 팀보다 먼저 일어났다고 했습니다. 이제 사람은 디자인이 끝나고 엔지니어링이 시작되는 경계보다, 자신이 일하는 지점들의 평균으로 정의된다는 설명입니다.

다만 그는 역할 자체를 없애는 데는 반대했습니다. 많은 회사가 제품 직무를 없애고 모두가 빌더가 된다고 말하는데, 그러면 수십 년 동안 쌓인 제품이라는 분야의 모범 사례가 나도 코드를 좀 짜 봤다는 이유로 통째로 버려진다는 겁니다.

> 엑셀을 쓸 줄 안다고 재무팀에서 일할 수 있는 것은 아닙니다.
> — 앤드루 암브로시노, 오픈AI 코덱스 앱 리드

도구를 다룰 줄 아는지로 역할을 가르던 기준은 무너지고 있지만, 그 분야에서 무엇이 좋은 결과인지 아는 판단은 도구와 함께 넘어오지 않습니다. 저는 안목을 이 판단의 다른 이름으로 봅니다. 누구나 만들 수 있게 된 뒤에 남는 차이는 무엇이 좋은지 아는 사람과 모르는 사람 사이에서 생깁니다.

## 코드는 채점되고 안목은 채점되지 않습니다

코드는 컴파일되는지, 돌아가는지로 채점됩니다. 암브로시노는 AI 연구소들이 코딩에 먼저 투자한 이유도 여기서 찾았습니다. 올바른 코드를 쓰는 능력은 AI 연구 자체를 빠르게 하니, 채점이 쉬운 쪽에 투자가 몰렸습니다.

디자인과 판단에는 그런 채점표가 없습니다. 무엇이 잘된 디자인인지 가르는 학습 루프를 만들기 어렵고, 사람의 안목이 그 피드백 구조의 일부라서 떼어 내 기계에 맡기기도 어렵다는 것이 그의 설명입니다. 디자인에는 새로움도 필요합니다. 작년에 새로 나온 웹사이트마다 리니어의 디자인을 베꼈는데, 모델이 매번 리니어 같은 사이트를 내놓는다면 그것을 잘했다고 부르기 어렵습니다.

같은 차이는 연구에서도 숫자로 나왔습니다. 모델이 분석 방법을 스스로 골라야 하는 [오픈AI의 연구 감각 시험](/post/paper-openai-genebench-pro-research-taste)에서 가장 높은 GPT-5.6 Sol도 28.7%에 그쳤고, 코딩 점수로는 프런티어 모델을 따라온 오픈웨이트 모델들은 0.6%에서 4.6%에 머물렀습니다. 정답이 하나인 코딩 문제에서는 격차를 좁힌 모델도, 분석 방법부터 골라야 하는 문제에서는 다시 크게 뒤처졌습니다.

![AI의 생성과 사람의 검증이 도는 순환을 그리고, 검증을 쉽고 빠르게 만들고 AI를 짧은 줄에 묶어 두라고 적은 카파시의 강연 슬라이드](https://substack-post-media.s3.amazonaws.com/public/images/5d4c0207-f4e5-4a7b-b69b-7a0717b55282_2048x1536.png)

카파시도 같은 강연에서 이 순환을 그렸습니다. AI가 생성하고 사람이 검증하는데, 코드 천 줄은 순식간에 나와도 버그가 없는지 확인하는 것은 사람이라 검증이 병목이 된다는 그림입니다. 그래서 검증을 쉽고 빠르게 만들고, AI는 짧은 줄에 묶어 두라고 했습니다.

암브로시노가 연구소들에 한 부탁도 같은 쪽을 가리킵니다. 모델이 코드를 지우는 일을 더 잘하게 해 달라는 부탁입니다. 지금 모델은 대체로 복잡도를 늘리기만 해서, 어떤 기능을 짓고 무엇을 버릴지 정하는 일은 아직 사람에게 남아 있습니다. 덜어낼 것을 고르는 일이 곧 큐레이션입니다.

## 같은 기술을 쓴다는 5만 달러와 20달러

도구가 같아도 결과가 갈린다는 것은 기업 조사에서도 나왔습니다. MIT의 프로젝트 NANDA가 2025년에 낸 보고서는 기업들이 생성형 AI에 300억~400억 달러를 쓰고도 95%가 아무 수익을 거두지 못했다고 적었습니다. 수백만 달러의 가치를 뽑아낸 파일럿은 5%였고, 보고서는 이 격차를 가른 것이 모델의 품질이나 규제보다 접근법이었다고 봤습니다. 공개된 AI 사업 300여 건을 훑고, 52개 조직을 인터뷰하고, 경영진 153명의 설문을 모은 조사라 회사의 공식 실적보다 당사자의 평가가 많이 섞여 있다는 점은 감안하고 읽을 숫자입니다.

보고서에 실린 한 기업 변호사의 사례가 이 차이를 보여 줍니다. 그의 회사는 계약서 분석 전용 도구에 5만 달러를 썼지만, 그는 초안을 쓸 때마다 챗GPT로 돌아갔습니다.

> 회사가 산 AI 도구는 요약이 딱딱하고 고칠 수 있는 게 별로 없습니다. 챗GPT로는 대화를 이끌면서 원하는 답이 나올 때까지 다듬을 수 있습니다. 공급사는 같은 기반 기술을 쓴다고 하는데 품질 차이가 느껴집니다.
> — 중견 로펌의 기업 변호사, MIT 보고서 인터뷰

월 20달러짜리 범용 도구가 몇 자릿수 더 비싼 전용 시스템보다 나았던 이유는 모델에 있지 않았습니다. 같은 기술 위에서 누가 대화를 이끌고, 무엇을 덧붙이고, 어디서 멈출지 정했느냐가 결과를 갈랐습니다.

보고서가 꼽은 근본 원인은 학습 격차입니다. 지금의 생성형 AI 도구는 맥락을 잊고, 배우지 못하고, 스스로 나아지지 않습니다. 그래서 중요한 업무에서는 응답자의 90%가 여전히 사람을 택했습니다. 맥락을 기억하지 못하는 도구에 매번 맥락을 대 주는 일은 사람에게 남았고, 변호사가 대화를 이끌며 한 일도 그것입니다.

같은 보고서에는 공식 LLM 구독을 산 회사가 40%인데, 조사한 회사의 90% 이상에서 직원들이 개인 AI 도구를 업무에 쓰고 있었다는 숫자도 있습니다. 위에서 깔아 준 도구는 겉돌고 아래에서 스스로 고른 도구가 일을 바꾼 셈이라, 저는 도입이 실패한 원인의 상당수가 모델 선택 밖에 있다고 봅니다. 사내망에서 외부 AI 접속을 막아 둔 회사라면 이 격차는 공식 도구의 채택률 통계에 아예 잡히지 않습니다.

## 무엇을 넣고 뺄지 고르는 일에 붙은 이름

이 고르는 일에는 작년 6월 이름이 붙었습니다. 쇼피파이 CEO 토비 뤼트케가 프롬프트 엔지니어링보다 컨텍스트 엔지니어링이라는 말이 좋다며, 과제를 풀 만하도록 모든 맥락을 대 주는 기술이라고 적었습니다.

6일 뒤 카파시가 이 표현에 힘을 실었습니다. 프롬프트라고 하면 짧은 지시문을 떠올리지만, 실제 서비스에서 하는 일은 다음 단계에 딱 맞는 정보로 컨텍스트 창을 채우는 섬세한 기술이라는 설명입니다.

두 사람의 말을 따라가면 무엇을 넣고 무엇을 뺄지 고르는 판단 자체가 안목입니다. 좋은 질문을 던지려면 좋은 자료가 먼저 갖춰져 있어야 하고, 그 자료를 갖추는 일이 큐레이션입니다. 그래서 답을 가르는 것은 프롬프트를 쓰는 재주보다 무엇을 읽고 무엇을 쌓아 왔는지입니다.

## 쌓아 둔 자료가 에이전트의 맥락이 됩니다

자료를 쌓아 두는 도구도 에이전트를 받아들이기 시작했습니다. 올해 2월 옵시디언이 1.12 업데이트에서 명령줄을 공식 지원하면서, Claude Code나 코덱스 같은 에이전트가 제 문서를 직접 읽고 회의록을 분석해 링크를 잇습니다. 4월에는 카파시가 기사와 논문, 이미지 같은 원자료만 던지면 LLM이 옵시디언에 위키를 세우고 개념을 분류하는 [LLM 위키 구성](https://gist.github.com/karpathy/442a6bf555914893e9891c11519de94f)을 공개했습니다. 이 구성을 학생용으로 옮긴 [실행 명세서](/post/review-examwiki-executable-spec)도 7월에 나왔습니다.

그래도 무엇을 한데 묶을지, 무엇이 중요한지 정하는 잣대는 사람이 세워 줘야 이 구조가 돌아갑니다. 티아고 포르테가 모으기, 정리, 압축, 표현이라고 이름 붙인 과정도 무엇을 남길지 고르는 사람의 판단을 축으로 움직이고, 그는 올해 3월 AI를 붙인 제2의 뇌가 이제 내 기준과 목표를 이미 아는 새 팀원처럼 움직인다고 적었습니다.

암브로시노가 자기 일을 코덱스로 자동화하는 방식도 큐레이션입니다. 아침마다 그가 속한 슬랙 채널 3,000개에서 주의가 필요한 것만 추린 브리핑을 받고, 처음 몇 번은 이번엔 이것을 덜 신경 써 달라는 식으로 말로 가르쳐 가며 다듬었다고 했습니다.

모델은 누구나 같은 것을 빌려 쓰는 상품이 됐지만, 쌓아 온 지식은 남이 라이선스할 수 없습니다. 코릴레이션 원의 한 분석은 AI가 이미 가진 우위를 복리로 불린다고 표현했고, 같은 모델을 붙여도 잘 정리된 자료를 가진 사람이 더 정확한 답을 얻는 이유도 여기 있습니다.

먼저 쌓은 사람에게 유리한 규칙이라는 반론은 맞습니다. 다만 축적의 단위가 연에서 주로 줄었습니다. 예전에는 몇 년 치 문서가 있어야 쓸 만한 참고 문서 묶음이 됐는데, 지금은 한 주 동안 읽은 것을 정리해 두는 습관만으로 에이전트에 넣을 맥락이 생깁니다.

## 병목은 무엇을 만들지로 넘어갑니다

7월 엔비디아가 공개한 자동 연구 데모가 이 흐름을 보여 줍니다. GPT-5.5를 쓴 코덱스에 목표와 5시간의 시간 예산만 주자, 에이전트가 색깔별로 별 개수를 세는 훈련 환경을 처음부터 짜고 Qwen3-VL-2B 모델의 정확도를 25.0%에서 96.9%로 올렸습니다. 쓴 장비는 L40S GPU 한 장이었습니다. 카파시가 오픈소스로 공개한 autoresearch 방식을 엔비디아의 NeMo 도구 위에 얹은 구성이고, 같은 에이전트는 논문에 나온 강화학습 알고리즘을 직접 구현해 10시간짜리 검증 학습까지 시작했습니다.

![흰 바탕에 색이 다른 별들이 흩어져 있고 아래에 색깔별 개수가 적힌, 코덱스가 만든 훈련 환경 화면](https://developer-blogs.nvidia.com/wp-content/uploads/2026/06/screenshot-example-generated-rl-environment-codex-2.webp)

이 데모에서 사람이 한 일은 목표와 예산을 정한 것입니다. 실험을 하나하나 돌보던 연구자의 일이 어떤 실험을 할지 고르는 쪽으로 옮겨 가는 흐름으로 저는 봤습니다. 과제도 에이전트가 직접 만든 합성 환경이라, 점수보다 과정이 보여 주는 것이 더 많습니다.

국내 현장에서도 같은 이야기를 들었습니다. 4월 오픈AI와 무신사가 연 행사에서 전준희 무신사 CTO는 코덱스를 도입한 뒤 팀이 코드 작성보다 설계와 검토에 집중하는 구조로 옮겨 갔고, 신입 채용에서도 AI 활용 능력을 본다고 했습니다.

신입에게 구현을 맡겨 실력을 키우던 국내 개발 조직의 육성 방식에는 숙제가 생깁니다. 구현 기간이 짧아지면 신입이 구현하면서 판단을 익힐 기회도 함께 줄어듭니다.

샘 올트먼은 작년 6월 에세이에서 앞으로는 좋은 아이디어가 한계가 될 것이라고 적었습니다. 스타트업 업계의 기술자들이 오랫동안 아이디어만 있는 사람들을 놀려 왔는데, 이제 그들에게 볕 들 날이 온 것 같다는 문장이 뒤따릅니다.

## 도구를 잘 다루는 능력은 다음 도구가 나오면 옅어집니다

안목이 영원히 사람에게 남는다고 단정하지는 않겠습니다. 디자인에도 잘잘못을 가르는 채점 루프가 생기면 그 경계는 다시 움직일 수 있습니다. 암브로시노도 10억 달러를 벌어 오라는 수준의 완전 자율이 오겠느냐는 질문에는, 자신은 절대라거나 반드시라고 말하는 사람이 아니라고 답했습니다.

그가 준 조언은 자기 작업 방식에 매이지 말고, 자기만 낼 수 있는 결과에 매이라는 것이었습니다. 피그마의 자동 레이아웃을 가장 잘 다룬다는 사실은 곧 의미가 옅어지는데, AI가 그 일도 더 잘하게 될 것이라는 이유였습니다.

지금 코덱스를 가장 잘 쓴다는 사실도 다음 도구가 나오면 같은 속도로 옅어집니다. 그래서 제가 토큰을 써서 쌓는 것은 코드보다 다음 병목에서도 남을 지식과, 그 지식을 고른 잣대입니다. 도구가 바뀌어도 옮겨 실을 수 있는 자산은 정리된 자료와 그것을 고른 기준뿐이라고 봅니다.

읽어 주셔서 고맙습니다.

초이 드림
