이 글 어땠어요?
캐스 코버렉은 가격이 절대 바뀌지 않는다고 약속할 수는 없다고 했습니다. 대신 Plus에 코덱스 사용량을 넣고, 더 필요한 사람은 크레딧으로 늘리는 방식을 유지하겠다고 했습니다.
코덱스와 ChatGPT Work 같은 에이전트 작업은 앱, CLI, IDE, 웹 어디서 쓰든 한도에서 빠지고 일반 ChatGPT 대화는 빠지지 않습니다. 이미지 생성과 파일 업로드, 음성은 한도가 따로 있습니다.
티보 소티오와 로맹 위에는 GPT-5.6 Sol Medium을 기본으로 권했습니다. Ultra는 기본으로 에이전트 4개를 돌리고, 과제에 따라 Medium보다 토큰을 5~10배 씁니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
오픈AI가 8월 25일 Build Week 우승작 8개를 발표했습니다. 186개국 4만 7,000명 가까이가 낸 8,000개 넘는 프로젝트 가운데 업무 부문 1위는 61세 수의사의 앱이었고, 우승작 대부분은 현장 판단을 모델에게 맡기지 않았습니다.

8월 4일 티보 소티오는 코덱스가 좋은 하네스인 것은 분명하지만 2~3개월 뒤면 원시적으로 보일 것이라고 적었습니다. 오픈AI는 6월 11일 클라우드 실행 환경 회사 Ona를 인수하기로 합의했고, 코덱스 주간 사용자는 3월 200만 명에서 6월 500만 명 이상으로 늘었습니다.
Jev로 PR 한 건을 검토하는 데 0.00007달러, 논문 1,018편을 분류하는 데 0.08달러가 들었습니다. 한데 같은 논문 파이프라인의 요약에는 3.99달러가 들었고, 여러 단계를 거치는 브라우저 과제는 20개 중 1개만 풀었습니다.
오픈AI가 8월 25일 Build Week 우승작 8개를 발표했습니다. 186개국 4만 7,000명 가까이가 낸 8,000개 넘는 프로젝트 가운데 업무 부문 1위는 61세 수의사의 앱이었고, 우승작 대부분은 현장 판단을 모델에게 맡기지 않았습니다.

8월 4일 티보 소티오는 코덱스가 좋은 하네스인 것은 분명하지만 2~3개월 뒤면 원시적으로 보일 것이라고 적었습니다. 오픈AI는 6월 11일 클라우드 실행 환경 회사 Ona를 인수하기로 합의했고, 코덱스 주간 사용자는 3월 200만 명에서 6월 500만 명 이상으로 늘었습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@OpenAIDevsX 게시물 · 원문 보기
AMA는 오픈AI 개발자 계정이 출시 당일 밤 예고했습니다. GPT-5.6이 나왔고 코덱스가 ChatGPT 안으로 들어왔으니 개발자들이 물을 게 많을 것이라며, 금요일 오전 9시 30분부터 10시 30분까지(태평양 시각) 답하겠다는 내용입니다. 공식 계정이 연 스레드 본문에는 매주 코덱스를 쓰는 사람이 500만 명을 넘어 3개월 전의 두 배가 됐고, 같은 기간 기능과 개선 150개를 내놨다는 숫자가 적혀 있었습니다.
답은 오픈AI 직원 8명이 달았습니다. 코덱스 팀의 캐스 코버렉, 브라우저 기능을 맡은 제임스 선, 개발자 경험 팀의 도미닉 쿤델과 로맹 위에, 연구자 잔비 칼라와 앨런 저우, 코덱스와 채팅 제품을 맡은 앤드루 암브로시노, 그리고 테드 샌더스입니다. 공식 계정은 직원이 답한 댓글마다 초록 동그라미를 달아 표시했습니다.
AMA 스레드의 질문은 댓글로 올라오고, 다른 사용자들이 추천을 눌러 순서를 매깁니다. 보관된 스레드에서 추천 수가 많았던 질문을 순서대로 놓으면 이렇습니다.
| 순위 | 질문 | 추천 | 답한 사람 |
|---|---|---|---|
| 1 | 월 20달러 코덱스 요금은 얼마나 지속 가능한가 | 109 | 캐스 코버렉, 테드 샌더스 |
| 2 | 윈도우에서 코덱스가 자기 샌드박스에 자꾸 막히는 이유 | 91 | 도미닉 쿤델 |
| 3 | 변경 기록 누락과 사용 한도 변동의 투명성 | 54 | 도미닉 쿤델 |
| 4 | 직원들은 어떤 모델과 추론 강도를 고르나 | 49 | 캐스 코버렉, 로맹 위에, 테드 샌더스 |
| 5 | Sol의 컨텍스트 창을 100만 토큰으로 늘릴 수 있나 | 46 | 앨런 저우 |
| 6 | 새 앱에서 채팅이 너무 깊이 숨어 있다 | 45 | 앤드루 암브로시노 |
| 7 | 티보는 왜 소셜미디어에서 인기인가 | 37 | 로맹 위에 |
| 8 | 예전 ChatGPT 데스크톱 경험을 살려 달라 | 33 | 도미닉 쿤델 |
새 모델이 나온 다음 날이었지만 상위 질문은 벤치마크 점수보다 요금과 한도, 윈도우와 앱 사용 경험에 몰렸습니다. 1위와 3위가 돈과 한도를 물었고, 4위는 사용량을 신경 쓰지 않아도 되는 직원들은 어떤 설정을 고르는지 물었습니다. 3위 질문자는 사용자들이 ccusage 같은 도구로 한도 변화를 확인했다며 한도를 어떻게 배분하는지 설명해 달라고 요구했습니다.
1위 질문은 월 20달러가 좋은 가격이지만 토큰 단위 요금제로 바뀌거나 가격이 크게 오를까 봐 걱정된다는 내용이었습니다. 캐스 코버렉은 걱정할 만하다고 인정하며 이렇게 답했습니다.
가격이 절대 바뀌지 않는다고 약속할 수는 없습니다. 다만 코덱스를 소수만 감당할 수 있는 도구로 만드는 것이 목표는 아닙니다.— 캐스 코버렉, 오픈AI 코덱스 팀
코버렉은 모델과 연산 비용, 쓰는 방식이 모두 빠르게 달라지는 중이라 가격 구조를 하나로 영원히 약속할 수는 없다고 했습니다. 대신 지금처럼 Plus 요금제에 코덱스 사용량을 넣고, 훨씬 많이 써야 하는 사람은 크레딧을 사서 한도 밖으로 늘리는 방식을 유지하겠다고 했습니다. 모든 사용자를 비싼 요금제로 밀어 넣지 않으려는 균형이라는 설명입니다.
테드 샌더스는 2년 전보다 같은 20달러로 얻는 가치가 훨씬 커졌고 그 흐름이 이어질 것이라고 답했습니다. 같은 날 조금 뒤 다른 질문에는 과제 하나에 드는 비용은 크게 내려가겠지만 AI가 할 수 있는 일이 늘면서 쓰는 돈은 늘어날 것이라고 했습니다. 그게 언젠가 가격 인상이 될지 요금 등급을 계속 늘리는 쪽이 될지는 모르겠다며, 2035년쯤이면 하루 종일 일을 시킬 수 없는 20달러가 초라해 보일 것이라고 덧붙였습니다.
코버렉은 무엇이 한도에서 빠지는지도 정리했습니다. 앱이든 CLI든 IDE든 웹이든 코덱스를 쓰면, ChatGPT Work와 함께 에이전트 사용량 하나로 묶여 한도에서 빠집니다. 일반 ChatGPT 대화는 여기에 들지 않고, 이미지 생성과 파일 업로드, 음성은 한도가 따로 있습니다. 같은 코덱스 작업이라도 작은 수정은 조금만 쓰고, 큰 코드베이스를 오래 붙잡는 작업은 훨씬 많이 쓴다고 했습니다.
3위 질문에 답한 도미닉 쿤델은 3개월 동안 기능을 150개 넘게 내놓느라 변경 기록이 굵직한 항목 위주였다고 인정했습니다. 버그로 사용량이 잘못 빠지면 최대한 빨리 고치고 리셋을 준다며, 한도를 몰래 바꾸지 않고 한도가 어떻게 소모되는지 더 잘 보이게 만들고 있다고 답했습니다.
한도 질문이 몰린 이유는 고를 수 있는 조합에 있습니다. GPT-5.6은 플래그십 Sol, GPT-5.5에 맞먹는 성능을 더 싸게 내는 Terra, 가장 빠르고 싼 Luna 세 모델로 나왔고, API 가격은 100만 토큰당 입력·출력 기준 Sol 5달러·30달러, Terra 2.5달러·15달러, Luna 1달러·6달러입니다. 여기에 Light부터 Ultra까지 추론 강도를 얹습니다. 오픈AI 발표문에 따르면 max는 xhigh보다 더 오래 생각하고, ultra는 기본으로 에이전트 4개를 동시에 돌려 토큰을 더 쓰는 대신 어려운 과제의 결과를 끌어올립니다.
@reach_vbX 게시물 · 원문 보기
AMA 8시간 30분 전에는 오픈AI의 VB 스리바스타브가 X에 추론 강도 안내를 올렸습니다. 일을 해내는 가장 낮은 설정에서 시작해 정말 필요할 때만 올리라는 내용이고, Light와 Low는 범위가 좁은 빠른 일, Medium은 계획과 분석, High와 xhigh는 여러 단계를 거치며 검증까지 필요한 일에 맞춘다고 했습니다. Max는 모델 하나가 어려운 문제 하나를 더 오래 파고, Ultra는 서브에이전트 여럿이 큰 문제를 나눠 동시에 풉니다. GPT-5.5에서 쓰던 강도를 그대로 옮기지 말고 익숙한 작업에서 한 단계 낮춰 시작하라는 권고도 붙었습니다.
소티오도 같은 날 아침 GPT-5.6 Sol Medium을 기본으로 쓰다가 정말 어려운 문제에서만 Extra High로 올리라고 권했습니다. 최고를 원하고 사용량이 빨리 닳아도 괜찮다면 Ultra가 괴물 같다고 했고, 과제 난이도에 따라 Medium과 Ultra의 토큰 사용량이 5~10배 차이 나는 일이 많다고 덧붙였습니다.
@thsottiauxX 게시물 · 원문 보기
AMA에서 직원들이 밝힌 선택도 비슷했습니다. 로맹 위에는 대부분 Sol Medium, 정말 어려운 일은 Ultra를 쓰고, 코딩이 아닌 짧은 일에는 Terra, Ultra를 돌릴 때 서브에이전트로는 Luna를 붙인다고 했습니다. 테드 샌더스는 거의 늘 Sol Medium이나 High를 쓰고, 오래 걸리거나 망치면 안 되는 일에만 xhigh로 올린다고 했습니다. 평가해 보면 추론 강도를 올릴수록 얻는 이득이 꽤 빨리 줄어든다는 설명이었고, 직원이라 토큰이 무제한이어서 빠른 모드는 항상 켜 둔다고 덧붙였습니다. 코버렉은 직접 쓰는 기준을 작업 종류별로 적었습니다.
| 작업 | 코버렉이 고르는 설정 |
|---|---|
| 작은 수정, 간단한 질문, 문서 정리, 탐색 | 빠르고 가벼운 모델, 낮은 추론 |
| 재현되는 작은 버그, 익숙한 코드베이스의 단순한 기능 | Sol, 중간 추론 |
| 원인이 모호한 버그, 낯선 저장소, 여러 곳을 건드리는 리팩터링 | Sol, 높은 추론 |
| 마이그레이션, 보안, 운영 장애, 틀리면 비싼 변경 | Sol Ultra에 높은 추론, 계획과 검증, 테스트까지 맡김 |
앱과 웹에서는 이 선택지를 슬라이더 하나로 줄였습니다. 쿤델에 따르면 슬라이더의 단계 대부분은 Sol의 추론 강도에 대응하고, 가장 낮은 단계만 Terra로 넘어갑니다. Luna는 코덱스에 서브에이전트를 쓰라고 시키면서 탐색처럼 최고 성능이 필요 없는 일을 맡길 때 쓰라고 했고, 화면 디자인 작업에는 Sol에 참고 이미지를 주는 방식을 권했습니다.

모델 셋에 추론 강도 일곱 단계가 얹히고, 가장 비싼 Ultra는 에이전트 4개를 동시에 돌립니다. 앤트로픽은 7월 7일 Claude Code의 모델과 노력 설정을 서로 다른 두 설정으로 나눠 설명했고, 오픈AI 앱은 둘을 슬라이더 하나에 묶었습니다. 자동으로 골라 주는 모드는 아직 없고, 코버렉은 사용자가 모델 라우팅 전문가가 될 필요는 없어야 한다며 똑똑한 자동 기본값 위에 직접 고르는 선택지를 남기는 쪽이 맞다고 했습니다.
AMA 예정 시간이 끝나고 30분쯤 지난 오전 10시 59분, 소티오가 X에 긴 글을 올렸습니다. 코덱스와 ChatGPT Work의 사용 한도를 초기화했고 그날 한 번 더 초기화하겠다며, 지난 24시간 동안 피드백을 읽고 사용 패턴을 보고 많은 사람과 이야기해 보니 제대로 하지 못한 것이 있었다고 적었습니다.
@thsottiauxX 게시물 · 원문 보기
그가 적은 잘못은 가장 많은 연산을 쓰는 설정을 너무 쉽게 고르게 해 놓고 사용 한도에 미치는 영향을 충분히 알리지 않았다는 것, 데스크톱 앱을 한 번에 바꿔 채팅과 프로젝트를 찾기 어렵게 만들었다는 것, 발표가 ChatGPT Work에 맞춰져 코덱스 팬들에게 코덱스가 사라질 것처럼 보였다는 것, 일부 멀티에이전트 작업 흐름에 퇴행이 생겼다는 것까지 네 가지입니다. 코덱스는 계속 간다는 문장도 따로 넣었습니다.
그날 바로 고치는 것으로는 두 번의 리셋, 불필요하게 비싼 설정으로 이끌지 않도록 기본값과 모델 선택 화면을 바꾸는 일, 플러그인 제출 문제 수정, 제품 안에서 코덱스를 보여 주는 방식 개선, 데스크톱 앱의 급한 문제 수정을 들었습니다. 다음 주에는 채팅과 프로젝트를 사이드바에 되돌리고, 사용량과 리셋 시점을 훨씬 잘 보이게 하고, ChatGPT Work와 코덱스를 언제 쓰는지 분명히 하겠다고 했습니다. 소티오는 그날 밤 10시 54분에도 한 번 더 리셋을 알렸습니다.
첫 번째 잘못은 AMA의 1위와 4위 질문과 곧바로 이어집니다. Ultra 한 번에 에이전트 4개가 돌고 Medium보다 토큰을 5~10배 쓰는데, 그 영향이 화면에 제대로 보이지 않았다는 것을 회사가 인정했습니다. 스레드에는 언리얼 엔진 도구를 불러오기만 해도 5시간 한도의 10~20%가 빠진다는 사용자와, 버그 22건을 X 게시물 링크와 함께 정리해 올린 사용자가 있었습니다. 제임스 선은 그 목록을 전부 슬랙으로 담당 팀에 넘겼다고 답했습니다.
| 날짜·시각(태평양 시각) | 있었던 일 |
|---|---|
| 7월 9일 오전 | GPT-5.6, ChatGPT Work, 새 데스크톱 앱 발표 |
| 7월 9일 오후 2시 24분 | 첫 전면 리셋 |
| 7월 9일 오후 6시 42분 | 레딧 AMA 스레드 개설, 질문 접수 |
| 7월 10일 오전 0시 56분 | VB 스리바스타브, 추론 강도 안내 |
| 7월 10일 오전 7시 2분 | 소티오, Sol Medium 기본 사용 권장 |
| 7월 10일 오전 9시 30분~10시 30분 | AMA 답변 |
| 7월 10일 오전 10시 59분 | 리셋과 잘못 네 가지 공지 |
| 7월 10일 오후 10시 54분 | 추가 리셋 |
리셋 이야기는 AMA 안에서도 나왔습니다. 티보가 왜 소셜미디어에서 인기냐는 질문에 로맹 위에는 개발자들 이야기를 직접 듣기를 좋아하고, 무엇보다 악명 높은 코덱스 리셋 버튼에 접근할 수 있기 때문이라고 답했습니다. 그 마법의 리셋 버튼 사진을 보여 달라는 댓글에는 쿤델이 진열장에 든 버튼 사진으로 답했습니다.

5위 질문은 GPT-5.4에서 쓸 수 있었던 100만 토큰 컨텍스트 창을 Sol에도 열어 달라는 요청이었습니다. 앨런 저우는 아주 긴 세션에서도 대화를 요약해 창을 비우는 압축이 꽤 잘 통한다며, 구체적인 약속은 못 하지만 피드백을 자세히 보겠다고만 답했습니다.
질문자가 전날 밤 다른 댓글에 적은 이유는 요금 문제였습니다. 서브에이전트를 거느린 지휘 에이전트가 압축을 거칠 때마다 10만~20만 토큰을 다시 채워 넣는데, 이 분량이 캐시 할인 없이 한도에서 빠진다는 겁니다. 100만 토큰 창이라면 같은 내용을 캐시에서 읽어 90% 할인을 받을 수 있다고 적었습니다. 모델의 긴 문맥 능력 자체는 올랐습니다. 오픈AI가 발표한 100만 토큰 그래프 탐색 평가(GraphWalks BFS)에서 Sol은 77.1%로 GPT-5.5의 45.4%보다 높았습니다.
속도 질문에는 로맹 위에가 답했습니다. 5.6이 5.5보다 훨씬 느리다는 질문에, 자기가 써 보면 Sol Medium이 대부분의 일에서 GPT-5.5보다 빠르고 Terra만으로도 5.5와 겨룰 만한 결과가 나온다고 했습니다. 약 1.5배 빠른 Fast 모드가 있고, 곧 Cerebras 칩에서 Sol을 초당 약 750토큰으로 돌리게 된다고도 했습니다. 소티오는 같은 날 아침 초당 750토큰으로 도는 Sol이라고 소개된 영상에 대해, 그 영상은 Cerebras 버전이 아니고 보통의 빠른 모드이며 초당 750토큰 넘게 돌리는 것은 차원이 다른 일이라고 바로잡았습니다.
평가를 겨냥한 질문도 있었습니다. 발표문은 GPT-5.6이 주요 코딩·에이전트 벤치마크에서 최고치를 냈다고 하는데, 독립 평가 기관 METR은 이 모델이 자기들의 에이전트 평가에서 부정행위를 한 비율이 지금까지 기록한 것 가운데 가장 높았다고 보고했으니 점수 상승의 얼마가 실력이냐는 질문입니다. 잔비 칼라는 평가 중 부정행위를 찾아 벌점을 주고, 외부 업체에 벤치마크를 따로 돌리게 해 결과를 검증한다고 답했습니다.
METR이 6월 26일 공개한 사전 평가 요약을 보면 숫자는 이렇게 갈립니다. 모델이 평가 환경의 버그를 파고들거나 금지된 방법을 쓴 시도를 실패로 치면, 사람 기준으로 몇 시간짜리 과제까지 절반 확률로 해내는지 재는 작업 시간 지평이 11.3시간(95% 신뢰구간 5~40시간)입니다. 같은 시도를 성공으로 치면 270시간을 넘고, 아예 빼면 71시간인데 신뢰구간이 13시간에서 1만 1,400시간까지 벌어집니다. METR은 이 가운데 어느 숫자도 Sol의 능력을 제대로 잰 값으로 보지 않는다고 적었고, 이 평가는 초기 테스터 후기와 함께 출시 전 평가를 다룬 글에서도 짚었습니다.
METR이 든 사례는 구체적입니다. 중간 제출물에 공격 코드를 넣어 숨겨진 테스트 정보를 빼내거나, 다른 과제에서는 기대 정답이 적힌 숨겨진 소스 코드를 꺼냈습니다. 그래도 METR은 오픈AI가 공유한 다른 점수와 장기 추세를 보면 Sol의 능력이 최고 수준을 크게 넘지 않는다고 판단했고, AI 연구개발을 완전히 자동화할 수준에는 못 미친다고 적었습니다.
오픈AI도 평가 문제를 스스로 공개한 적이 있습니다. AMA 이틀 전인 7월 8일, SWE-Bench Pro를 감사해 보니 과제의 약 30%가 깨져 있다고 추정하는 글을 냈습니다. 다음 날 발표문의 표에서 Sol은 이 벤치마크 64.6%로 Claude Fable 5의 80%에 졌습니다. 대신 Cursor가 공개한 자체 평가에서는 같은 과제의 비용이 Sol 5.22달러, Fable 5 17.32달러로 3배 넘게 차이 났고, 그 비교는 GPT-5.6 출시 발표를 다룬 글에 정리했습니다.
연구 조직이 모델을 어떻게 쓰는지도 칼라의 답에 나왔습니다. Sol이 Luna를 후속 학습시켰고, 연구자 대부분이 코덱스 스레드 여러 개를 동시에 돌려 가설을 검증하며 봇들이 밤낮없이 돈다고 했습니다. 발표문에는 재귀적 자기 개선의 진척을 재는 평가 묶음에서 Sol이 GPT-5.5보다 16.2점 높았다는 문장이 있습니다. AI의 미래가 두렵냐는 질문에 칼라는 기계가 사람을 돕는 좋은 미래가 올 확률을 85.424242%라고 장난스럽게 답했고, 걱정하는 것은 사회가 적응하는 속도라고 했습니다.
앱 질문은 출시 방식에 몰렸습니다. 예전 ChatGPT 데스크톱 경험을 살려 달라는 질문에 쿤델은 당분간 기존 앱을 나란히 쓰라며, 새 앱은 비개발자의 일까지 품도록 만들었고 오픈AI 안에서는 엔지니어 말고도 거의 모든 직원이 쓰고 있다고 답했습니다. 채팅이 너무 깊이 숨어 있다는 질문에 앤드루 암브로시노는 채팅을 어떻게 원하느냐고 되물었고, 두 시간쯤 뒤 소티오의 공지를 안내했습니다.
테드 샌더스의 답은 더 솔직했습니다. 앱이 코덱스에 ChatGPT를 억지로 붙인 것처럼 보인다는 긴 질문에, 솔직히 아직 알아 가는 중이라며 예전에는 앱과 하네스가 여럿이어서 사람들이 무엇을 써야 할지 몰랐고 사내 개발도 느렸다고 했습니다. 앱을 합치면서 당장은 불편하지만 길게 보면 그만한 가치가 있기를 바란다는 설명입니다.
윈도우와 리눅스 질문도 이어졌습니다. 코버렉은 팀의 개발과 테스트 환경이 주로 맥이어서 맥이 기능을 먼저 받아 왔다고 인정했고, 쿤델은 5.6부터 윈도우 샌드박스 안에서의 동작이 나아진다고 했습니다. 리눅스 앱은 제임스 선이 여러 번 만들고 있다고 답했지만 날짜는 내놓지 않았습니다. 하네스에서 무엇이 성능을 가장 끌어올렸느냐는 질문에 칼라는 슬랙과 깃허브, 노션 같은 커넥터를 꼽았고, 쿤델은 MCP 도구가 한도를 많이 먹으면 코덱스에게 CLI로 감싸 스킬로 만들게 하거나 그 도구만 단 전용 서브에이전트에 맡기라고 권했습니다.
한국에서 코덱스를 쓰는 사람도 같은 Plus 요금제와 같은 한도 안에서 씁니다. 이번 AMA로 분명해진 것은 가격을 약속하지 않는다는 점, 넘치는 사용량은 크레딧으로 푼다는 점, 에이전트 작업만 코덱스 한도에서 빠진다는 점입니다. 설정에서는 소티오와 위에, 샌더스가 모두 Sol Medium 안팎을 기본으로 꼽았고, Ultra는 에이전트 4개를 돌리며 토큰을 5~10배 쓴다는 숫자가 같은 날 나왔습니다.
소티오가 약속한 다음 조치는 채팅과 프로젝트의 사이드바 복원, 사용량과 리셋 시점 표시이고 기한은 다음 주였습니다. 월 20달러에 들어 있는 사용량이 화면에 어떻게 표시되는지 바뀌면 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림