이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
오픈 웨이트와 폐쇄형의 평균 간격이 다시 3개월 안쪽으로 좁아진다
자체 채점 기준을 가진 조직이 가운데 구간 모델로 비용을 먼저 낮춘다
Epoch AI가 2025년 3월 벤치마크 여섯 개를 분석한 결과, 정해 둔 성능을 내는 최저 API 가격은 과제에 따라 해마다 9배에서 900배, 중앙값으로 50배씩 떨어졌습니다. 박사급 과학 문제에서 GPT-4 수준을 내는 가격은 해마다 40배씩 내려갔습니다. 공개 API 가격 기준이라 직접 돌릴 때의 실비와는 다릅니다.
Epoch AI는 RTX 5090 같은 게임용 GPU 한 장(2,500달러 미만)으로 6~12개월 전 최전선 성능과 맞먹는 모델을 돌릴 수 있다고 정리했습니다. 다만 작은 오픈 모델은 특정 벤치마크에 맞춰졌을 가능성이 커서, 실제 업무에서 느끼는 시차는 더 길 수 있다고 덧붙였습니다.
Epoch AI 능력 지수로 2026년 1월 이후 가장 강한 오픈 웨이트 모델은 폐쇄형 최전선을 평균 4개월 차로 따라왔고, 2023년 1월부터 2025년 10월까지는 평균 3개월이었습니다. 두 선은 일정한 간격을 두고 함께 오르고 있습니다.
쉬운 질의는 작은 모델로, 어려운 질의만 큰 모델로 보내는 라우팅이 대표적인 방법입니다. 어려운 질의를 가려내는 데도 비용이 들어서, 값싼 대리 지표나 확신도 기준을 쓰고 재시도율과 확신도 분포를 함께 기록합니다. 자기 업무에 맞는 채점 기준이 있으면 어느 모델이 충분한지 직접 잴 수 있습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
엔비디아가 허깅페이스를 129억 달러에 인수하기로 합의했다고 디인포메이션이 8월 26일(미국 시각) 보도했습니다. 연환산 매출 1억 5,000만 달러의 약 86배이고, 같은 날 엔비디아는 분기 데이터센터 매출 890억 달러를 발표했습니다.

딥시크가 7월 31일 V4-Flash 정식판을 API와 MIT 가중치로 공개했습니다. 코딩 에이전트 평가 DeepSWE가 7.3에서 54.4로 올랐고, 요금은 100만 토큰당 출력 0.28달러 그대로입니다. 무엇을 더 학습시켰는지는 밝히지 않았습니다.
오픈AI가 7월 30일 GPT-5.6 Luna 가격을 100만 토큰당 입력 0.2달러, 출력 1.2달러로 80% 내렸습니다. B200 8장 노드를 1년 빌리는 약 60만 달러면 Luna 출력 토큰 약 5,022억 개를 삽니다.

엔비디아가 허깅페이스를 129억 달러에 인수하기로 합의했다고 디인포메이션이 8월 26일(미국 시각) 보도했습니다. 연환산 매출 1억 5,000만 달러의 약 86배이고, 같은 날 엔비디아는 분기 데이터센터 매출 890억 달러를 발표했습니다.

딥시크가 7월 31일 V4-Flash 정식판을 API와 MIT 가중치로 공개했습니다. 코딩 에이전트 평가 DeepSWE가 7.3에서 54.4로 올랐고, 요금은 100만 토큰당 출력 0.28달러 그대로입니다. 무엇을 더 학습시켰는지는 밝히지 않았습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
Epoch AI는 2025년 3월 벤치마크 여섯 개에서 최신 모델들이 세운 점수를 기준선으로 고정하고, 그 점수를 내는 데 드는 최저 API 가격이 어떻게 변했는지 추적했습니다. 보통의 벤치마크가 성능을 재는 데 비해 이 측정은 성능을 고정하고 값을 잽니다. 같은 실력이 싸지는 속도를 재는 방식입니다.

하락 속도는 과제와 기준점에 따라 해마다 9배에서 900배까지 벌어졌고, 중앙값은 50배였습니다. 박사급 과학 문제에서 GPT-4 수준을 내는 가격은 해마다 40배씩 떨어졌습니다. Epoch AI는 가장 빠른 하락이 2024년 이후에 몰려 있어 그 속도가 계속될지는 덜 분명하다고 적었고, 2024년 이전 자료를 빼고 다시 재면 하락 속도가 전반적으로 더 빨라진다고도 밝혔습니다. 토큰을 훨씬 많이 쓰는 추론 모델은 이 분석에서 뺐습니다.
이 곡선에는 조건이 하나 붙습니다. Epoch AI가 모은 것은 첫 공급사의 API 가격이나 여러 공급사 가격의 중앙값이고, 같은 모델을 직접 돌릴 때의 실비는 담기지 않았습니다. 사업자가 붙인 가격표에는 연산 원가 말고도 점유율을 사려는 판단과 상위 요금제로 끌어올리려는 설계가 함께 들어갑니다. 자체 호스팅을 검토하는 팀이 이 곡선을 그대로 자기 원가 계획표에 옮기면 계산이 어긋나는 이유입니다.
값이 떨어지는 곡선 옆에는 기기가 따라잡는 곡선이 있습니다. Epoch AI는 2025년 8월, 엔비디아 RTX 5090 같은 최고급 게임용 GPU 한 장(2,500달러 미만)으로 불과 6~12개월 전 최전선 성능과 맞먹는 모델을 누구나 내려받아 돌릴 수 있다고 정리했습니다. 크기를 가리지 않은 오픈 웨이트 모델이 5~22개월 뒤처진다는 앞선 추정과도 맞는 결과입니다.

같은 그래프의 2025년 구간에는 LG AI연구원의 EXAONE 4.0 32B가 게임용 GPU 한 장에 들어가는 오픈 모델의 상위 점으로 찍혀 있습니다. 국내 모델도 이 곡선의 앞줄에 선 적이 있고, 이 구간에서는 모델 크기가 작아도 파라미터당 성능이 높은 쪽이 앞섭니다. 그래프는 RTX 4090 시절에는 280억 개 이하, RTX 5090 시절에는 400억 개 이하 파라미터의 모델이 게임용 GPU 한 장에 들어간다고 봤습니다. Epoch AI는 단서도 붙였습니다. 작은 오픈 모델은 특정 벤치마크에 맞춰 다듬어졌을 가능성이 커서, 실제 업무에서 느끼는 시차는 이보다 길 수 있다는 것입니다.
구글이 4월 아파치 2.0 라이선스로 공개한 Gemma 4는 이 흐름을 한 회사의 모델 안에서 보여 줍니다. 구글은 픽셀 팀과 퀄컴, 미디어텍과 함께 작은 모델을 휴대전화에서 인터넷 없이 돌도록 설계했다고 밝혔습니다. 그 가운데 E4B는 추론 때 쓰는 유효 파라미터가 45억 개(임베딩 포함 80억 개)인데, 모델 카드의 비교표에서 1년 전 플래그십 Gemma 3 27B를 대부분의 시험에서 앞섰습니다.
| 시험 | Gemma 4 E4B | Gemma 3 27B |
|---|---|---|
| 박사급 과학 문제(GPQA Diamond) | 58.6% | 42.4% |
| 종합 지식(MMLU Pro) | 69.4% | 67.6% |
| 수학 경시(AIME 2026, 도구 없이) | 42.5% | 20.8% |
| 코딩(LiveCodeBench v6) | 52.0% | 29.1% |
| 에이전트 과제(Tau2) | 42.2% | 16.2% |
유효 파라미터가 6분의 1인 모델이 1년 전 최상급을 과학 문제에서 16점 넘게 앞섰습니다. 다만 구글이 자사 모델을 잰 숫자이고, 비교 대상 Gemma 3 27B는 생각하는 단계를 끈 상태로 쟀다는 조건이 붙어 있습니다. 이런 상승분은 대부분 증류와 데이터 품질에서 나옵니다. 증류는 큰 모델이 먼저 익힌 것을 작은 모델에 옮겨 담는 학습 방법이라, 기기 안 모델의 상승은 최전선 모델의 진전을 뒤따라 옵니다.
Epoch AI는 5월 29일, 2026년 1월 이후 가장 강한 오픈 웨이트 모델이 폐쇄형 최전선 모델을 자체 종합 지표인 Epoch 능력 지수(ECI)에서 평균 4개월 차로 따라왔다고 발표했습니다. 두 진영의 평균 점수 차는 8점으로, GPT-5와 GPT-5.5 사이의 차이와 비슷합니다. 2025년 10월 분석에서는 2023년 1월부터 2025년 10월까지 평균 3개월이었으니, 간격은 올해 들어 조금 벌어졌습니다.

간격은 0으로 줄지 않고, 두 선은 일정한 시차를 두고 함께 올라갑니다. 7월 16일 문샷AI가 공개한 2.8조 파라미터 Kimi K3는 독립 채점 기관 지수에서 Fable 5와 GPT-5.6 Sol 다음 3위에 올랐고, 가중치는 7월 27일까지 풀겠다고 했습니다. 그 과정은 Kimi K3 공개를 정리한 글에 있습니다. 같은 간격을 능력 지수 대신 사이버 공격 과제로 잰 영국 AI보안연구소의 측정은 중국 오픈 모델과 폐쇄형의 해킹 실력 차를 다룬 글에서 다뤘습니다.
오픈 웨이트가 곧 따라잡으니 폐쇄형 모델에 돈을 낼 이유가 사라진다는 반론도 나옵니다. 그런데 평균 간격이 3개월에서 4개월로 한 번 벌어진 것처럼, 오픈 웨이트에 올린 제품은 자기 성능의 위쪽 한계를 최전선 모델의 출시 일정에 맡겨 둔 상태가 됩니다. 그 조건은 어느 계약서에도 적히지 않습니다.
기기 쪽 끝과 최상위 쪽 끝은 무엇에 돈을 내는지가 분명합니다. 기기 안 모델은 개인정보가 밖으로 나가지 않고 인터넷이 끊겨도 돌며 호출할 때마다 드는 돈이 없습니다. 최상위 모델은 지금 다른 방법으로는 안 되는 일을 해 줍니다. 문제는 그 사이, 기기 안 모델보다 훨씬 똑똑하지만 최상위에는 못 미치는 구간입니다.
파는 쪽은 이 구간에 이름을 붙이기 시작했습니다. 오픈AI는 7월 9일 GPT-5.6을 내면서 플래그십 Sol과 중간 등급 Terra, 경량 Luna를 세대와 상관없이 따로 발전하는 능력 등급의 이름으로 내놓았고, Terra와 Luna가 Fable 5를 약 16분의 1 비용으로 앞선다는 결과를 발표문 앞에 세웠습니다. 가격을 토큰 단가보다 과제 하나를 끝내는 비용으로 비교하는 방식은 GPT-5.6 출시와 과제당 비용을 다룬 글에 정리했습니다. 7월 한 달 사이 나온 가격표만 봐도 가운데 구간의 값은 빠르게 촘촘해졌습니다.
| 모델 (7월 기준) | 입력 100만 토큰 | 출력 100만 토큰 |
|---|---|---|
| 앤트로픽 Fable 5 | 10달러 | 50달러 |
| 오픈AI GPT-5.6 Sol | 5달러 | 30달러 |
| SpaceXAI Grok 4.5 | 2달러 | 6달러 |
| 오픈AI GPT-5.6 Luna | 1달러 | 6달러 |
Cursor와 함께 학습한 Grok 4.5는 출력 가격이 앤트로픽 Opus 4.8의 4분의 1이었고, 그 경위는 Grok 4.5 출시와 가격 경쟁을 다룬 글에 있습니다. 최상위와 경량 사이의 출력 가격 차는 이 표에서만 8배가 넘고, 그 사이를 어느 모델이 채우느냐에 따라 같은 업무의 월 비용이 몇 배씩 달라집니다.
사는 쪽의 문서는 아직 이 속도를 따라가지 못합니다. 국내 조직의 AI 도입 품의서는 대개 모델 이름과 토큰 단가로 적히고, 기기 안 모델은 단말 사양으로, 최상위 모델은 공급사 계약으로 적힙니다. 오픈 웨이트를 직접 올려 쓰는 가운데 구간을 고른 팀은 서버와 운영 인력, 평가 비용을 따로 적어야 하는데, 이를 묶어 적을 항목이 조달 서식에 없는 경우가 많습니다. 금융위원회가 2024년 8월 망분리 개선 로드맵으로 금융권의 생성형 AI 활용에 길을 열었지만, 조달과 보안 심사가 모델 교체 주기를 따라가지 못하면 가운데 구간의 모델은 문서 위에서 계속 이름 없는 선택지로 남습니다.
가운데 구간을 제품으로 풀려는 시도가 라우팅입니다. 쉬운 질의는 작은 모델로, 어려운 질의만 큰 모델로 보내는 방식으로, 오픈AI는 2025년 8월 GPT-5에서 대화의 종류와 복잡도, 도구 필요 여부를 보고 빠른 모델과 추론 모델 가운데 하나를 고르는 실시간 라우터를 제품 안에 넣었고, 이 라우터는 사용자가 모델을 직접 바꾸는 순간 같은 실제 신호로 계속 학습한다고 설명했습니다. 앤트로픽 개발자 플랫폼 책임자들은 7월 팟캐스트에서 샌드박스는 외부 인프라에도 열지만 다른 회사 모델로 작업을 나눠 보내는 라우팅은 하지 않겠다고 밝혔습니다. 그 대담은 앤트로픽 플랫폼 팀의 팟캐스트를 다룬 글에 있습니다.
라우팅이 어려운 이유는 가려내는 비용입니다. 어려운 질의인지 알려면 어느 정도는 풀어 봐야 하는데, 풀어 보는 순간 아낀 비용이 줄어듭니다. 그래서 구현은 질의 길이나 분야 태그, 과거 실패 이력 같은 값싼 대리 지표에 기대거나, 작은 모델로 먼저 답을 만든 뒤 확신도가 낮을 때만 큰 모델로 다시 보내는 방식을 씁니다.
두 방식은 서로 다른 곳에서 틀립니다. 대리 지표는 짧고 평범해 보이는 어려운 질의를 작은 모델에 그대로 흘려보내고, 확신도 방식은 작은 모델이 틀린 답에 높은 확신을 붙이면 그대로 통과시킵니다. 앞의 실패는 사용자가 알아채지만 뒤의 실패는 아무도 알아채지 못해서, 라우팅을 붙인 팀에게는 절감액보다 재시도율과 확신도 분포를 기록하는 일이 먼저 옵니다.
같은 실력의 값이 해마다 수십 배씩 떨어지면 특정 모델의 우위는 몇 달 만에 사라집니다. 남는 것은 그 모델에 무엇을 넣고 어떻게 재느냐입니다. 사내 데이터와 사용 기록, 업무 규칙, 그리고 모델의 답이 맞았는지 자동으로 가려 주는 채점기는 가격 곡선을 따라 싸지지 않습니다. 사티아 나델라가 기업이 AI에 돈을 내면서 고유 지식까지 넘기는 구조를 「역방향 정보 역설」이라 부르고 자기 학습 루프를 되찾자고 한 주장은 나델라의 역설을 다룬 글에서 다뤘습니다.
Epoch AI가 가격을 잰 여섯 벤치마크 가운데 다섯은 정답을 자동으로 채점하는 시험이고, 나머지 하나는 사람 투표로 순위를 매기는 챗봇 아레나입니다. 가격 곡선이 보여 주는 것은 자동으로 채점할 수 있는 과제에서의 실력이 싸지는 속도이고, 사람이 매번 읽고 판단해야 하는 업무에서도 같은 속도로 값이 떨어진다는 근거는 이 자료에 없습니다. 그래서 자기 업무에 맞는 채점 기준을 가진 조직은 싸진 모델이 그 업무에 충분한지 직접 재서 끌어올 수 있고, 기준이 없는 조직은 공급자의 벤치마크 발표를 기다리게 됩니다.
확인되지 않은 것도 남아 있습니다. 연 50배라는 중앙값이 자체 호스팅 실비에서도 성립하는지는 공개 API 가격만 모은 이 자료로 알 수 없고, 오픈과 폐쇄의 간격이 다시 좁아질지는 두 번의 분석만으로 판정되지 않습니다. Gemma 4의 숫자도 구글이 자사 모델을 잰 결과입니다. 셋 가운데 하나만 달라져도 가운데 구간의 가격 계산은 다시 짜야 합니다.
읽어 주셔서 고맙습니다.
초이 드림