이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
안목이 영원히 사람의 영역으로 남지는 않는다
디자인에도 잘잘못을 가르는 채점 루프가 생기면 경계가 다시 움직입니다. 암브로시노도 완전 자율에 대해 never도 always도 말하지 않았습니다.
프롬프트 엔지니어링이 지시문을 잘 쓰는 일이라면, 컨텍스트 엔지니어링은 모델이 다음 단계를 풀 수 있도록 필요한 정보를 골라 컨텍스트 창을 채우는 일입니다. 무엇을 넣고 뺄지 고르는 판단 자체가 안목입니다.
단정할 수 없습니다. 코드는 컴파일과 실행으로 채점되지만 디자인과 판단에는 채점표가 없어 아직 자동화가 어렵습니다. 채점 루프가 생기면 경계는 다시 움직일 수 있고, 암브로시노도 절대와 반드시라는 말을 피했습니다.
생성형 AI에 투자하고도 측정할 수 있는 손익 효과를 얻지 못한 조직의 비율입니다. 보고서는 격차를 가른 것이 모델 품질이나 규제보다 접근법이라고 봤습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
세레브라스 사내 지식베이스에 하루 1만 5,000개 넘는 질문이 들어옵니다. 자료를 한곳에 옮기지 않고 각 도구에서 뽑아 Postgres 표 하나에 모으며, 코드는 grep과 임베딩을 함께 씁니다. 정확도와 비용은 공개하지 않았습니다.

모델을 고정한 채 하네스만 고쳐 SWE-bench 점수가 20%에서 50%로 올랐습니다. 앤트로픽 실험에서는 단독 실행이 20분·9달러에 고장 난 게임을, 하네스가 6시간·200달러에 플레이할 수 있는 게임을 냈습니다.
앤트로픽 Claude Code 팀이 7월 24일 Opus 5와 Fable 5용 시스템 프롬프트에서 80% 넘게 덜어내도 자사 코딩 평가에서 손실이 없었다고 밝혔습니다. 뒤집은 원칙 여섯 가지와, Free·Pro 기본 모델 Sonnet 5는 언급되지 않았다는 조건을 함께 짚었습니다.

세레브라스 사내 지식베이스에 하루 1만 5,000개 넘는 질문이 들어옵니다. 자료를 한곳에 옮기지 않고 각 도구에서 뽑아 Postgres 표 하나에 모으며, 코드는 grep과 임베딩을 함께 씁니다. 정확도와 비용은 공개하지 않았습니다.

모델을 고정한 채 하네스만 고쳐 SWE-bench 점수가 20%에서 50%로 올랐습니다. 앤트로픽 실험에서는 단독 실행이 20분·9달러에 고장 난 게임을, 하네스가 6시간·200달러에 플레이할 수 있는 게임을 냈습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
저는 초등학교 때 코딩을 처음 배웠고 소프트웨어학과를 나와 오래 코드를 짜 왔습니다. 그런 제가 지금 토큰 대부분을 쓰는 곳은 4월에 이미 9,000개를 넘긴 스레드 글을 옵시디언으로 옮겨 정리하는 일입니다. 무엇을 남기고 무엇을 버릴지, 어떤 자료를 어느 개념 옆에 붙일지를 하나하나 정합니다.
코딩 에이전트는 원래 코드를 뽑아내는 연료로 토큰을 씁니다. 저는 같은 도구를 제 머리로 들어올 재료를 다듬는 데 씁니다. 같은 도구를 쥐고도 어디에 겨누느냐에서 결과가 갈린다고 보기 때문입니다.
오픈AI에서 코덱스 데스크톱 앱의 제품과 엔지니어링을 이끄는 앤드루 암브로시노는 6월 레니스 팟캐스트에서 제품을 만드는 과정이 통째로 뒤집혔다고 했습니다. 예전에는 구현이 비싸서 문서와 조사, 프로토타입으로 앞단의 위험을 줄였는데, 이제 그 전제가 없어졌다는 이야기입니다.
구현은 더 이상 비싼 부분이 아닙니다. 비싼 것은, 감히 말하자면 안목입니다. 큐레이션 과정입니다.— 앤드루 암브로시노, 오픈AI 코덱스 앱 리드
그가 든 예는 이렇습니다. 기능 하나를 두고 시도가 90개씩 쏟아지면, 그중 무엇이 좋은지 골라 엮는 감각이 값을 갖습니다. 코덱스 앱의 코드는 이미 100% AI가 쓰고 있고, 팀 안의 질문도 AI가 코드를 몇 퍼센트 쓰느냐에서 그 코드를 사람이 감독했느냐로 옮겨 갔다고 했습니다. 오픈AI 안에서는 마케팅과 홍보, 재무, 법무 직원까지 코덱스 앱을 쓴다고 합니다. 코드를 보여 주고 명령마다 실행 승인을 묻는, 엔지니어가 아닌 사람에게는 불친절한 앱인데도 그렇습니다.
도구를 파는 사람이 도구로 못 하는 일을 가장 비싸다고 부르니, 제 입장에 유리한 말이라는 의심은 나올 수 있습니다. 그래도 근거는 제품 바깥의 산수에 있습니다. 시도 90개를 만드는 비용이 0에 가까워질수록, 90개를 읽고 하나를 고르는 사람의 시간이 전체 공정에서 차지하는 비중은 커집니다.
만드는 일이 싸진 과정은 몇 개의 문장으로 따라갈 수 있습니다. 안드레 카파시는 2023년 1월 X에 가장 뜨거운 새 프로그래밍 언어는 영어라고 적었고, 2025년 6월 YC 강연에서는 프롬프트가 곧 프로그램인 시대를 소프트웨어 3.0이라고 불렀습니다.
@karpathyX 게시물 · 원문 보기
젠슨 황은 2023년 5월 컴퓨텍스 기조연설에서 이제 모두가 프로그래머라고 했습니다. 만드는 능력의 상당 부분은 사람보다 모델 쪽에 있습니다. 암브로시노는 2월에 낸 코덱스 앱이 작년 11월에 나왔다면 시장에서 완전히 실패했을 것이고, 두 시점의 차이는 모델뿐이었다고 했습니다. 올해 2월 말 Gemini 3 서울 해커톤에서 만난 구글 딥마인드 개발자 커뮤니티 총괄 아밋 바디도 지금을 누구나 빌더가 되는 행동의 시대라고 불렀습니다.
값도 같은 방향으로 움직였습니다. a16z는 2024년 11월 분석에서 같은 성능을 내는 모델의 추론 비용이 해마다 10분의 1로 떨어져, 3년 사이 1,000분의 1이 됐다고 계산했습니다. 이름은 LLM 인플레이션을 비튼 LLMflation입니다.

가치는 희소성에서 나옵니다. 5년에서 10년을 배워야 넘던 진입 장벽이 말 몇 마디로 내려오면, 그 장벽을 넘느라 쌓은 경력의 값도 함께 내려갑니다. 토큰이 이만큼 싸지면 희소해지는 것은 토큰을 어디에 쓸지 정하는 판단이고, 암브로시노는 그것을 무엇이 신호이고 무엇이 잡음인지 가려내는 능력이라고 불렀습니다.
누구나 만들 수 있게 된 뒤 조직에서 먼저 흔들리는 것은 직무의 경계입니다. 암브로시노는 코덱스 팀에서 디자이너가 엔지니어의 말을 쓰고 PM이 코드를 짜는 일이 회사 어느 팀보다 먼저 일어났다고 했습니다. 이제 사람은 디자인이 끝나고 엔지니어링이 시작되는 경계보다, 자신이 일하는 지점들의 평균으로 정의된다는 설명입니다.
다만 그는 역할 자체를 없애는 데는 반대했습니다. 많은 회사가 제품 직무를 없애고 모두가 빌더가 된다고 말하는데, 그러면 수십 년 동안 쌓인 제품이라는 분야의 모범 사례가 나도 코드를 좀 짜 봤다는 이유로 통째로 버려진다는 겁니다.
엑셀을 쓸 줄 안다고 재무팀에서 일할 수 있는 것은 아닙니다.— 앤드루 암브로시노, 오픈AI 코덱스 앱 리드
도구를 다룰 줄 아는지로 역할을 가르던 기준은 무너지고 있지만, 그 분야에서 무엇이 좋은 결과인지 아는 판단은 도구와 함께 넘어오지 않습니다. 저는 안목을 이 판단의 다른 이름으로 봅니다. 누구나 만들 수 있게 된 뒤에 남는 차이는 무엇이 좋은지 아는 사람과 모르는 사람 사이에서 생깁니다.
코드는 컴파일되는지, 돌아가는지로 채점됩니다. 암브로시노는 AI 연구소들이 코딩에 먼저 투자한 이유도 여기서 찾았습니다. 올바른 코드를 쓰는 능력은 AI 연구 자체를 빠르게 하니, 채점이 쉬운 쪽에 투자가 몰렸습니다.
디자인과 판단에는 그런 채점표가 없습니다. 무엇이 잘된 디자인인지 가르는 학습 루프를 만들기 어렵고, 사람의 안목이 그 피드백 구조의 일부라서 떼어 내 기계에 맡기기도 어렵다는 것이 그의 설명입니다. 디자인에는 새로움도 필요합니다. 작년에 새로 나온 웹사이트마다 리니어의 디자인을 베꼈는데, 모델이 매번 리니어 같은 사이트를 내놓는다면 그것을 잘했다고 부르기 어렵습니다.
같은 차이는 연구에서도 숫자로 나왔습니다. 모델이 분석 방법을 스스로 골라야 하는 오픈AI의 연구 감각 시험에서 가장 높은 GPT-5.6 Sol도 28.7%에 그쳤고, 코딩 점수로는 프런티어 모델을 따라온 오픈웨이트 모델들은 0.6%에서 4.6%에 머물렀습니다. 정답이 하나인 코딩 문제에서는 격차를 좁힌 모델도, 분석 방법부터 골라야 하는 문제에서는 다시 크게 뒤처졌습니다.

카파시도 같은 강연에서 이 순환을 그렸습니다. AI가 생성하고 사람이 검증하는데, 코드 천 줄은 순식간에 나와도 버그가 없는지 확인하는 것은 사람이라 검증이 병목이 된다는 그림입니다. 그래서 검증을 쉽고 빠르게 만들고, AI는 짧은 줄에 묶어 두라고 했습니다.
암브로시노가 연구소들에 한 부탁도 같은 쪽을 가리킵니다. 모델이 코드를 지우는 일을 더 잘하게 해 달라는 부탁입니다. 지금 모델은 대체로 복잡도를 늘리기만 해서, 어떤 기능을 짓고 무엇을 버릴지 정하는 일은 아직 사람에게 남아 있습니다. 덜어낼 것을 고르는 일이 곧 큐레이션입니다.
도구가 같아도 결과가 갈린다는 것은 기업 조사에서도 나왔습니다. MIT의 프로젝트 NANDA가 2025년에 낸 보고서는 기업들이 생성형 AI에 300억~400억 달러를 쓰고도 95%가 아무 수익을 거두지 못했다고 적었습니다. 수백만 달러의 가치를 뽑아낸 파일럿은 5%였고, 보고서는 이 격차를 가른 것이 모델의 품질이나 규제보다 접근법이었다고 봤습니다. 공개된 AI 사업 300여 건을 훑고, 52개 조직을 인터뷰하고, 경영진 153명의 설문을 모은 조사라 회사의 공식 실적보다 당사자의 평가가 많이 섞여 있다는 점은 감안하고 읽을 숫자입니다.
보고서에 실린 한 기업 변호사의 사례가 이 차이를 보여 줍니다. 그의 회사는 계약서 분석 전용 도구에 5만 달러를 썼지만, 그는 초안을 쓸 때마다 챗GPT로 돌아갔습니다.
회사가 산 AI 도구는 요약이 딱딱하고 고칠 수 있는 게 별로 없습니다. 챗GPT로는 대화를 이끌면서 원하는 답이 나올 때까지 다듬을 수 있습니다. 공급사는 같은 기반 기술을 쓴다고 하는데 품질 차이가 느껴집니다.— 중견 로펌의 기업 변호사, MIT 보고서 인터뷰
월 20달러짜리 범용 도구가 몇 자릿수 더 비싼 전용 시스템보다 나았던 이유는 모델에 있지 않았습니다. 같은 기술 위에서 누가 대화를 이끌고, 무엇을 덧붙이고, 어디서 멈출지 정했느냐가 결과를 갈랐습니다.
보고서가 꼽은 근본 원인은 학습 격차입니다. 지금의 생성형 AI 도구는 맥락을 잊고, 배우지 못하고, 스스로 나아지지 않습니다. 그래서 중요한 업무에서는 응답자의 90%가 여전히 사람을 택했습니다. 맥락을 기억하지 못하는 도구에 매번 맥락을 대 주는 일은 사람에게 남았고, 변호사가 대화를 이끌며 한 일도 그것입니다.
같은 보고서에는 공식 LLM 구독을 산 회사가 40%인데, 조사한 회사의 90% 이상에서 직원들이 개인 AI 도구를 업무에 쓰고 있었다는 숫자도 있습니다. 위에서 깔아 준 도구는 겉돌고 아래에서 스스로 고른 도구가 일을 바꾼 셈이라, 저는 도입이 실패한 원인의 상당수가 모델 선택 밖에 있다고 봅니다. 사내망에서 외부 AI 접속을 막아 둔 회사라면 이 격차는 공식 도구의 채택률 통계에 아예 잡히지 않습니다.
이 고르는 일에는 작년 6월 이름이 붙었습니다. 쇼피파이 CEO 토비 뤼트케가 프롬프트 엔지니어링보다 컨텍스트 엔지니어링이라는 말이 좋다며, 과제를 풀 만하도록 모든 맥락을 대 주는 기술이라고 적었습니다.
@tobiX 게시물 · 원문 보기
6일 뒤 카파시가 이 표현에 힘을 실었습니다. 프롬프트라고 하면 짧은 지시문을 떠올리지만, 실제 서비스에서 하는 일은 다음 단계에 딱 맞는 정보로 컨텍스트 창을 채우는 섬세한 기술이라는 설명입니다.
@karpathyX 게시물 · 원문 보기
두 사람의 말을 따라가면 무엇을 넣고 무엇을 뺄지 고르는 판단 자체가 안목입니다. 좋은 질문을 던지려면 좋은 자료가 먼저 갖춰져 있어야 하고, 그 자료를 갖추는 일이 큐레이션입니다. 그래서 답을 가르는 것은 프롬프트를 쓰는 재주보다 무엇을 읽고 무엇을 쌓아 왔는지입니다.
자료를 쌓아 두는 도구도 에이전트를 받아들이기 시작했습니다. 올해 2월 옵시디언이 1.12 업데이트에서 명령줄을 공식 지원하면서, Claude Code나 코덱스 같은 에이전트가 제 문서를 직접 읽고 회의록을 분석해 링크를 잇습니다. 4월에는 카파시가 기사와 논문, 이미지 같은 원자료만 던지면 LLM이 옵시디언에 위키를 세우고 개념을 분류하는 LLM 위키 구성을 공개했습니다. 이 구성을 학생용으로 옮긴 실행 명세서도 7월에 나왔습니다.
그래도 무엇을 한데 묶을지, 무엇이 중요한지 정하는 잣대는 사람이 세워 줘야 이 구조가 돌아갑니다. 티아고 포르테가 모으기, 정리, 압축, 표현이라고 이름 붙인 과정도 무엇을 남길지 고르는 사람의 판단을 축으로 움직이고, 그는 올해 3월 AI를 붙인 제2의 뇌가 이제 내 기준과 목표를 이미 아는 새 팀원처럼 움직인다고 적었습니다.
암브로시노가 자기 일을 코덱스로 자동화하는 방식도 큐레이션입니다. 아침마다 그가 속한 슬랙 채널 3,000개에서 주의가 필요한 것만 추린 브리핑을 받고, 처음 몇 번은 이번엔 이것을 덜 신경 써 달라는 식으로 말로 가르쳐 가며 다듬었다고 했습니다.
모델은 누구나 같은 것을 빌려 쓰는 상품이 됐지만, 쌓아 온 지식은 남이 라이선스할 수 없습니다. 코릴레이션 원의 한 분석은 AI가 이미 가진 우위를 복리로 불린다고 표현했고, 같은 모델을 붙여도 잘 정리된 자료를 가진 사람이 더 정확한 답을 얻는 이유도 여기 있습니다.
먼저 쌓은 사람에게 유리한 규칙이라는 반론은 맞습니다. 다만 축적의 단위가 연에서 주로 줄었습니다. 예전에는 몇 년 치 문서가 있어야 쓸 만한 참고 문서 묶음이 됐는데, 지금은 한 주 동안 읽은 것을 정리해 두는 습관만으로 에이전트에 넣을 맥락이 생깁니다.
7월 엔비디아가 공개한 자동 연구 데모가 이 흐름을 보여 줍니다. GPT-5.5를 쓴 코덱스에 목표와 5시간의 시간 예산만 주자, 에이전트가 색깔별로 별 개수를 세는 훈련 환경을 처음부터 짜고 Qwen3-VL-2B 모델의 정확도를 25.0%에서 96.9%로 올렸습니다. 쓴 장비는 L40S GPU 한 장이었습니다. 카파시가 오픈소스로 공개한 autoresearch 방식을 엔비디아의 NeMo 도구 위에 얹은 구성이고, 같은 에이전트는 논문에 나온 강화학습 알고리즘을 직접 구현해 10시간짜리 검증 학습까지 시작했습니다.

이 데모에서 사람이 한 일은 목표와 예산을 정한 것입니다. 실험을 하나하나 돌보던 연구자의 일이 어떤 실험을 할지 고르는 쪽으로 옮겨 가는 흐름으로 저는 봤습니다. 과제도 에이전트가 직접 만든 합성 환경이라, 점수보다 과정이 보여 주는 것이 더 많습니다.
국내 현장에서도 같은 이야기를 들었습니다. 4월 오픈AI와 무신사가 연 행사에서 전준희 무신사 CTO는 코덱스를 도입한 뒤 팀이 코드 작성보다 설계와 검토에 집중하는 구조로 옮겨 갔고, 신입 채용에서도 AI 활용 능력을 본다고 했습니다.
신입에게 구현을 맡겨 실력을 키우던 국내 개발 조직의 육성 방식에는 숙제가 생깁니다. 구현 기간이 짧아지면 신입이 구현하면서 판단을 익힐 기회도 함께 줄어듭니다.
샘 올트먼은 작년 6월 에세이에서 앞으로는 좋은 아이디어가 한계가 될 것이라고 적었습니다. 스타트업 업계의 기술자들이 오랫동안 아이디어만 있는 사람들을 놀려 왔는데, 이제 그들에게 볕 들 날이 온 것 같다는 문장이 뒤따릅니다.
안목이 영원히 사람에게 남는다고 단정하지는 않겠습니다. 디자인에도 잘잘못을 가르는 채점 루프가 생기면 그 경계는 다시 움직일 수 있습니다. 암브로시노도 10억 달러를 벌어 오라는 수준의 완전 자율이 오겠느냐는 질문에는, 자신은 절대라거나 반드시라고 말하는 사람이 아니라고 답했습니다.
그가 준 조언은 자기 작업 방식에 매이지 말고, 자기만 낼 수 있는 결과에 매이라는 것이었습니다. 피그마의 자동 레이아웃을 가장 잘 다룬다는 사실은 곧 의미가 옅어지는데, AI가 그 일도 더 잘하게 될 것이라는 이유였습니다.
지금 코덱스를 가장 잘 쓴다는 사실도 다음 도구가 나오면 같은 속도로 옅어집니다. 그래서 제가 토큰을 써서 쌓는 것은 코드보다 다음 병목에서도 남을 지식과, 그 지식을 고른 잣대입니다. 도구가 바뀌어도 옮겨 실을 수 있는 자산은 정리된 자료와 그것을 고른 기준뿐이라고 봅니다.
읽어 주셔서 고맙습니다.
초이 드림