이 글 어땠어요?
커널은 모델의 계산을 GPU에서 실제로 실행하는 코드입니다. 오픈AI는 Codex 안의 GPT-5.6 Sol이 프로덕션 커널을 자율적으로 다시 쓰고 최적화했고, 다른 커널 개선과 합쳐 종단 서빙 비용이 20% 줄었다고 밝혔습니다.
작은 초안 모델이 토큰 여러 개를 먼저 제안하고 본 모델이 한 번에 검사하는 방식입니다. 제안이 받아들여지면 본 모델 한 번의 계산으로 토큰 여러 개가 나와 순차 계산이 줄어듭니다. Sol은 자기 초안 모델을 수백 번 실험해 토큰 생성 효율을 15% 넘게 올렸습니다.
프롬프트 캐시입니다. 캐시된 입력은 일반 입력의 10분의 1 가격이고, 기록을 뒤에만 덧붙이고 도구 순서를 고정하는 규칙은 자체 에이전트에도 옮길 수 있습니다. 29CM은 같은 원리로 캐시 적중률 98%, 비용 64% 절감을 보고했습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
GPT-5.6 출시 다음 날 열린 코덱스 AMA에서 추천 1~3위 질문은 요금, 윈도우 샌드박스, 한도의 투명성이었습니다. Ultra는 Medium보다 토큰을 5~10배 쓰고, 소티오는 한도 영향을 알리지 않았다고 인정했습니다.

7월 8일 서울 코덱스 밋업 질의응답에서 오픈AI 발표자는 CLI를 없애지 않고 실험 기능을 CLI에서 먼저 낸다고 답했습니다. Terminal-Bench 2.1에서 코덱스 CLI와 GPT-5.5는 83.4%, 같은 모델을 공용 하네스에 얹으면 78.2%였습니다.
GPT-5.6 Sol은 ARC-AGI-1·2에서 96.5%·92.5%를 받고도 ARC-AGI-3에서는 7.8%에 그쳤습니다. 오픈AI가 사고 기록을 유지하고 압축을 켜자 공개 세트 점수는 13.3%에서 38.3%로 올랐고 출력 토큰은 6분의 1이 됐습니다.
GPT-5.6 출시 다음 날 열린 코덱스 AMA에서 추천 1~3위 질문은 요금, 윈도우 샌드박스, 한도의 투명성이었습니다. Ultra는 Medium보다 토큰을 5~10배 쓰고, 소티오는 한도 영향을 알리지 않았다고 인정했습니다.

7월 8일 서울 코덱스 밋업 질의응답에서 오픈AI 발표자는 CLI를 없애지 않고 실험 기능을 CLI에서 먼저 낸다고 답했습니다. Terminal-Bench 2.1에서 코덱스 CLI와 GPT-5.5는 83.4%, 같은 모델을 공용 하네스에 얹으면 78.2%였습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
글은 오픈AI 기술 스태프 다섯 명이 썼습니다. 그중 필리프 틸레(Philippe Tillet)는 오픈AI가 관리하는 오픈소스 GPU 프로그래밍 언어 Triton을 처음 만든 사람이고, 이번 글에는 GPT-5.6을 Triton과 Gluon으로 커널을 쓰고 고치는 데 능하도록 훈련했다는 대목이 나옵니다.
오픈AI는 글 첫머리에 지난 4년 동안 활성 사용자 10억 명, 기업 고객 200만 곳 넘게 늘었다고 적었습니다. 이어 모델 수요가 용량보다 빠르게 커지는 연산 부족의 시대에는 효율이 모든 시스템 설계의 중심이라며, 추론 인프라의 주된 목표를 같은 하드웨어로 더 많은 토큰을 내보내는 것으로 정했습니다. 지능과 응답 속도, 가용성, 안정성은 그대로 지킨다는 조건이 붙었습니다.
사내 수요도 빠르게 늘었습니다. 오픈AI는 7월 9일 GPT-5.6 출시 발표문에서 지난 6개월 동안 사내 코딩 추론에 쓰는 연산 비중이 100배, 에이전트가 쓰는 토큰이 약 22배로 늘었다고 밝혔습니다. 데이터센터를 새로 짓는 속도가 이 수요를 따라가지 못하면, 이미 깔린 GPU에서 토큰을 더 뽑아내는 것이 남는 방법입니다.
오픈AI는 그 결과를 모델별 가격과 성능으로 설명했습니다. 최대 추론 설정의 Sol은 Artificial Analysis 코딩 에이전트 지표에서 Claude Fable 5를 절반이 안 되는 비용으로 앞서고, Terra는 지능 평가에서 GPT-5.5만큼의 성능을 절반 가격에 내고, Luna는 Sol보다 80% 싸다는 설명입니다. 7월 16일 기준 API 가격표(100만 토큰당)로 보면 이 설명이 그대로 맞아떨어집니다.
| 모델 | 입력 | 캐시된 입력 | 출력 |
|---|---|---|---|
| GPT-5.6 Sol | 5달러 | 0.5달러 | 30달러 |
| GPT-5.6 Terra | 2.5달러 | 0.25달러 | 15달러 |
| GPT-5.6 Luna | 1달러 | 0.1달러 | 6달러 |
| GPT-5.5 | 5달러 | 0.5달러 | 30달러 |
Terra는 GPT-5.5의 정확히 절반이고, Luna는 입력과 출력 모두 Sol의 5분의 1입니다. 캐시된 입력은 세 모델 모두 일반 입력의 10분의 1로 매겨졌습니다.
모델이 답을 만들 때마다 GPU는 입력을 다음 토큰 예측으로 바꾸는 계산(포워드 패스)을 합니다. 이 계산을 GPU 위에서 실제로 실행하는 코드가 커널입니다. 연산 하나하나가 빨라도 데이터를 메모리 사이로 너무 많이 옮기거나, 연산끼리 서로 기다리거나, 데이터를 비효율적으로 배치하면 GPU가 놀게 됩니다.
오픈AI에 따르면 GPT-5.6 Sol은 미리 계산해 둘 수 있는 일, 아예 안 해도 되는 일, 나란히 돌릴 수 있는 일을 찾아냈고, Codex 안에서 프로덕션 커널을 자율적으로 다시 쓰고 최적화했습니다. 오픈AI는 GPT-5.6을 Triton과 Gluon으로 커널을 쓰고 고치는 데 능하도록 훈련했다고 밝혔고, Sol이 이끈 다른 커널 개선까지 합쳐 종단 서빙 비용이 20% 줄었습니다. Sol이 쓴 커널이 맞는지는 오픈소스 검증 도구 FpSan(부동소수점 검사기)으로 확인했다고 덧붙였습니다.
Triton의 시작은 2019년 틸레가 하버드 대학교의 H. T. 쿵, 데이비드 콕스와 함께 낸 논문입니다. 논문 초록의 첫 문제의식은 cuBLAS나 cuDNN 같은 GPU 제조사의 기성 라이브러리를 쓸 수 없는 연산은 전문가가 직접 커널을 짜지 않으면 GPU를 제대로 쓰지 못한다는 것이었습니다. 7년 뒤 같은 사람이 공동 저자로 이름을 올린 글에서, 그 커널을 짠 쪽은 모델이었습니다.
추측 디코딩(speculative decoding)은 작은 초안 모델이 다음에 올 토큰 여러 개를 먼저 제안하고, 본 모델이 그 제안을 한 번에 검사하는 방식입니다. 신입이 문장 몇 개를 먼저 써 오면 선임이 한 번에 훑어 맞는 부분을 통과시키는 것과 비슷합니다. 제안이 받아들여지면 본 모델이 한 번 계산해 토큰 여러 개를 내놓으므로, 비싼 순차 계산이 줄어듭니다.
오픈AI는 GPT-5.6 Sol이 자기 초안 모델을 직접 개선했다고 밝혔습니다. 초안 모델의 크기와 구조, 기능을 바꾸는 실험을 수백 번 설계해 돌렸고, 초안 모델 학습을 띄우고 지켜보다 하드웨어 고장이나 학습 불안정이 생기면 스스로 개입했습니다. 그 결과 토큰 생성 효율이 15% 넘게 올랐습니다.
모델이 다른 모델을 손본 사례는 이것만이 아닙니다. 7월 10일 Codex 팀이 연 레딧 AMA에서 연구자 잔비 칼라는 Sol이 Luna의 후속 학습을 맡았다고 확인했습니다. 플래그십 모델이 가장 작은 모델을 가르치고, 자기 옆에 붙어 초안을 써 주는 작은 모델까지 스스로 다듬은 겁니다. 모델을 감싼 시스템을 모델이 고치는 이 흐름은 릴리안 웽이 재귀적 자기개선을 다룬 글에서 가까운 미래의 자기개선이 시작될 곳으로 꼽은 영역이기도 합니다.
추론 스택에서 오픈AI가 꼽은 첫 사례는 부하 분산입니다. 요청은 지역과 남은 용량, 가속기 종류에 따라 전 세계 데이터센터로 나뉘고, 한 클러스터 안에서는 부하와 컨텍스트 길이, 캐시 여부에 따라 모델 인스턴스로 나뉩니다. Sol은 실제 트래픽을 분석해 그동안 놓친 쏠림을 찾고 새 라우팅 전략을 시험했으며, 오픈AI는 이 개선만으로도 서빙 비용이 극적으로 줄었다고 적었습니다. 얼마나 줄었는지는 숫자로 밝히지 않았습니다.
KV 캐시 구성도 Sol이 맡았습니다. KV 캐시는 모델이 앞서 읽은 토큰의 중간 계산 결과를 저장해 두는 메모리로, 새 입력을 처음 읽을 때 한 번에 계산해 만들고 답을 쓰는 동안 계속 읽고 늘립니다. 배치 크기와 샤딩(모델과 데이터를 여러 GPU에 나눠 싣는 방식), KV 캐시 관리의 최적값은 입력과 출력 길이, 캐시 적중률에 따라 달라지는데, 경우의 수가 너무 많아 그동안은 대략의 경험 규칙에 맡겨 왔습니다. 이번에는 Sol이 실제 워크로드를 분석해 후보 설정을 만들고 평가해, 상황마다 설정을 맞췄습니다.
에이전트 하네스는 모델과 도구, 사용자 환경을 잇는 실행 틀입니다. Codex는 사용자 요청 한 번을 처리하면서 소스 코드를 열어 보고, 배포 이력을 뒤지고, 장애 보고서를 읽고, 파일을 고치고, 테스트를 돌립니다. 단계마다 모델 요청이 붙기 때문에, 과제 하나에 요청이 30번 들어가면 요청마다 1초씩만 더 걸려도 30초가 쌓입니다.
오픈AI는 이 하네스를 Rust로 짰습니다. 되풀이되는 구간에 든 비용은 한 번의 요청 안에서 여러 번 치르게 되고, 여기서 아낀 시간과 연산은 요청 수만큼 곱해집니다. 하네스가 이 비용을 줄이는 방법은 두 가지였습니다.
먼저 컨텍스트가 부풀지 않게 막습니다. 에이전트에게 도구와 스킬, 플러그인, 대화 기록을 많이 줄수록 모델이 읽을 앞머리가 저절로 길어지고, 비용이 오르고 모델의 주의가 흩어집니다. 그래서 하네스는 연동 앱과 MCP 도구, 스킬, 플러그인을 필요할 때만 드러나게 하고, 도구 출력은 모델이 따로 요청하지 않으면 기본 1만 토큰에서 자릅니다.
하네스의 또 다른 장치는 프롬프트 캐시입니다. 에이전트 루프는 같은 지시문과 대화 기록, 도구 정의를 한 번의 요청 안에서도 여러 번 GPU로 보냅니다. 프롬프트 캐시는 앞서 처리한 앞부분의 계산 결과를 저장해 두었다가, 앞부분이 똑같은 요청이 오면 다시 계산하지 않고 쓰는 장치입니다.
그래서 하네스는 모델이 보는 기록을 뒤에만 덧붙이는 방식으로 다룹니다. 새 메시지와 도구 결과, 환경 변화는 끝에 붙이고 앞쪽에는 끼워 넣지 않습니다. 도구 목록은 늘 같은 순서로 내놓고, 승인 정책 같은 실행 설정은 도구 정의에 넣지 않고 실행 시점에 적용합니다. 오픈AI는 이 설계 덕분에 Codex와 ChatGPT Work의 캐시 적중률이 높게 유지된다고 밝혔습니다.
이 규칙은 가격표에 그대로 걸려 있습니다. 캐시된 입력은 일반 입력의 10분의 1 가격이라, Sol 기준으로 100만 토큰에 5달러가 들 앞부분이 캐시에 맞으면 0.5달러로 끝납니다. 도구 목록 순서가 한 번 바뀌면 그 뒤의 기록 전체가 캐시에서 빠지고 다시 제값을 치르게 됩니다. GPT-5.6부터는 개발자가 캐시를 직접 지정하는 기능도 생겼고, 캐시에 새로 쓰는 입력은 일반 입력의 1.25배로 따로 매겨졌습니다.
같은 규칙을 국내 팀이 먼저 적용한 기록도 있습니다. 무신사의 29CM 가격 팀은 7월 7일 테크 블로그에 LLM 비용을 64% 줄인 과정을 올렸습니다. 대시보드를 만들어 보니 상품 속성을 뽑는 API 하나가 전체 토큰의 약 92%를 쓰고 있었고, 이 API는 호출할 때마다 약 1만 5,000토큰짜리 같은 시스템 프롬프트 뒤에 약 2,000토큰의 상품 정보만 바꿔 붙여 보내고 있었습니다.
29CM은 고정된 시스템 프롬프트와 바뀌는 메시지를 나누고 캐시 지점을 넣었고, 캐시 적중률 98%와 비용 64% 절감으로 이어졌습니다. 이 팀이 정리한 캐시를 깨는 실수 목록에는 시스템 프롬프트 안의 타임스탬프, 매번 달라지는 JSON 키 순서와 함께 도구 정의 순서 변경이 들어 있었고, 해법은 순서를 알파벳순으로 고정하는 것이었습니다. 오픈AI가 도구 목록을 늘 같은 순서로 내놓는 이유와 같습니다.
AI에게 자기가 돌아가는 인프라를 맡긴 일은 이번이 처음이 아닙니다. 딥마인드는 2016년 7월 구글 데이터센터 센서 수천 개의 기록으로 학습한 신경망이 냉각에 쓰는 에너지를 40% 줄였다고 발표했습니다. 전력 손실 등을 감안하면 데이터센터 전체 전력 효율(PUE)의 오버헤드가 15% 줄었습니다.
작년 5월 구글 딥마인드의 코딩 에이전트 알파이볼브는 한 단계 더 들어갔습니다. 데이터센터 작업을 배치하는 보그의 규칙을 새로 찾아 구글 전 세계 연산 자원의 평균 0.7%를 1년 넘게 되찾았고, 제미나이 구조의 주요 행렬곱 커널을 23% 빠르게 해 제미나이 훈련 시간을 1% 줄였습니다. 커널 최적화에 드는 시간은 전문가의 몇 주에서 자동 실험 며칠로 줄었다고 적었습니다.
| 시기 | 누가 | 맡긴 일 | 발표한 효과 |
|---|---|---|---|
| 2016년 7월 | 딥마인드 | 데이터센터 냉각 제어 | 냉각 에너지 40% 절감 |
| 2025년 5월 | 알파이볼브 | 작업 배치 규칙, 제미나이 커널 | 연산 자원 0.7% 회수, 커널 23% 가속, 훈련 시간 1% 단축 |
| 2026년 7월 | GPT-5.6 Sol | 서빙 커널, 자기 초안 모델, 부하 분산, KV 캐시 설정 | 종단 서빙 비용 20% 절감, 토큰 생성 효율 15% 이상 |
딥마인드와 알파이볼브가 손댄 곳이 데이터센터와 훈련이었다면, 오픈AI 글의 Sol은 지금 사용자에게 답을 내보내는 자기 서빙 경로를 고쳤습니다. 2021년 5월 네이버가 하이퍼클로바를 공개할 때 앞세운 숫자는 GPT-3의 1,750억 개보다 많은 매개변수 2,040억 개였고, 5년 뒤 오픈AI 기술 글이 앞세운 숫자는 서빙 비용 20% 절감이었습니다.
공개된 절감률은 모두 오픈AI가 스스로 잰 값이고, 같은 조건으로 밖에서 재현한 숫자는 아직 없습니다. 20%에는 Sol이 다시 쓴 커널과 다른 커널 개선이 함께 들어 있어 Sol이 기여한 비율이 나뉘어 있지 않고, 종단 서빙 비용의 기준이 되는 워크로드와 기간도 적혀 있지 않습니다. 부하 분산은 극적으로 줄었다는 말만 있고 숫자가 없습니다.
오픈AI의 두 발표 사이에도 차이가 있습니다. 7월 9일 출시 글타래에서는 Sol이 같은 지표에서 Fable 5보다 비용이 약 3분의 1 적다고 적었는데, 20일 뒤 기술 글에서는 최대 추론 설정의 Sol이 절반이 안 되는 비용으로 앞선다고 적었습니다. 두 문장 사이에 무엇이 달라졌는지는 설명이 없습니다.
@OpenAIX 게시물 · 원문 보기
모델에게 프로덕션 코드를 맡긴 과정도 일부만 공개됐습니다. 오픈AI는 FpSan 같은 검증 도구에 크게 투자했다고 밝혔지만, 사람이 어느 단계에서 커널 변경을 검토하고 승인했는지는 적지 않았습니다. 6월 26일 나온 GPT-5.6 시스템 카드에는 사내 에이전트 코딩에서 Sol이 제한을 우회한 비율이 0.00026에서 0.00251로 GPT-5.5의 약 10배라고 적혔고, 7월 10일에는 맷 슈머가 Sol의 서브에이전트가 정리 명령으로 자기 맥의 홈 폴더를 지웠다고 알렸습니다.
API로 오픈AI 모델을 쓰는 국내 서비스에 가장 먼저 닿는 것은 캐시 가격입니다. 캐시된 입력이 10분의 1 가격이라 앞부분을 지키는 설계만으로 청구서가 달라지고, 오픈AI가 공개한 규칙(기록은 뒤에만 덧붙이기, 도구 순서 고정, 실행 설정은 도구 정의 밖에, 도구 출력 상한)은 자체 에이전트에도 그대로 옮길 수 있습니다. 29CM의 64%는 같은 원리를 자기 서비스에 먼저 적용해 얻은 숫자입니다.
모델과 추론 강도를 고르는 데도 참고할 숫자가 나왔습니다. 세바스찬 라시카가 정리한 GPT-5.6 라인업의 성능 대비 비용 그래프에서는 가장 작은 Luna를 가장 높은 추론 강도로 돌리면 Sol Medium급 성능이 약 3분의 1 비용에 나왔습니다. 같은 Sol 안에서도 Codex를 총괄하는 티보 소티오는 과제 난도에 따라 Medium과 Ultra의 토큰 소모가 5~10배 벌어진다고 밝혔습니다.
@thsottiauxX 게시물 · 원문 보기
오픈AI는 글 끝에 이런 개선을 더 싸고 더 널리 쓸 수 있는 지능으로 사용자에게 돌려주겠다고 적었습니다. 20% 줄어든 서빙 비용이 가격표에 언제, 얼마나 반영될지는 적혀 있지 않고, 7월 16일 기준 가격표는 7월 9일 출시 때와 같았습니다.
읽어 주셔서 고맙습니다.
초이 드림