# 논문 1,018편 분류는 8센트, 요약은 3.99달러… 출력 공짜 모델 Jev
_TypeSafe가 9월 15일 공개한 판단 전용 모델 Jev로 3일 동안 사례 15건이 나왔고, 비용을 밝힌 8건은 모두 1달러 아래였습니다. 같은 기록에는 넘겨받은 큰 모델이 비용의 96%를 쓴 파이프라인과 긴 과제 20개 중 1개만 푼 결과도 들어 있습니다._
- 매체: 초이의 뉴스레터 · 아티클
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-09-20T12:00
- 링크: https://choi-newsletter.com/post/review-jev-agent-cost-collapse
- 답하는 질문: TypeSafe Jev 가격과 정확도
- 직답: Jev는 입력 100만 토큰당 0.042달러에 출력이 무료이고, 외부 측정에서 6~25배 빨랐지만 정확도를 몇 점 내준 기록도 있었습니다.
- 출처: TypeSafe AI, Introducing System One Models & Jev (2026-09-15) (https://typesafe.ai/blog/introducing-system-one-models-and-jev), TypeSafe 문서, Models (jev-1.13 가격·한도·언어) (https://docs.typesafe.ai/models), TypeSafe 문서, Jev 1.13 jaggedness (2026-09-17 검토) (https://docs.typesafe.ai/model-jaggedness/jev-1.13), 디오고 알메이다 X, Jev 공개 (2026-09-15) (https://x.com/CompleteSkeptic/status/2099925682726002904), Every, Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds (2026-09-15) (https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds), @elvissun X, 뉴스 384건 비교 (2026-09-18) (https://x.com/elvissun/status/2100951347080421409), @redp314 X, PR 검토 (2026-09-17) (https://x.com/redp314/status/2100585126652481915), @nutlope X, 논문 1,018편 분류 (2026-09-17) (https://x.com/nutlope/status/2100426999546184123), @nutlope X, 사기 메일 판별과 Kimi K3 넘기기 (2026-09-17) (https://x.com/nutlope/status/2100614659690713543), @gregpr07 X, 장기 브라우저 과제 1/20 (2026-09-19) (https://x.com/gregpr07/status/2101166460534153250), @Bailey_Jennings X, ONET 직업 분류 비교 (2026-09-17) (https://x.com/Bailey_Jennings/status/2100593904949096696), @cramforce X, Vercel 분류기 평가 (2026-09-16) (https://x.com/cramforce/status/2100269198727602468), @alxai_ X, Good Start Labs 채점 비교 (2026-09-15) (https://x.com/alxai_/status/2099933126705164701), WindTunnel, WebMCP 벤치마크 (https://webmcp.com/benchmark)
> Jev로 PR 한 건을 검토하는 데 0.00007달러, 논문 1,018편을 분류하는 데 0.08달러가 들었습니다. 한데 같은 논문 파이프라인의 요약에는 3.99달러가 들었고, 여러 단계를 거치는 브라우저 과제는 20개 중 1개만 풀었습니다.

AI 스타트업 TypeSafe가 9월 15일(미국 시각) 판단 전용 모델 Jev를 내놓은 뒤, 3일 동안 X에는 이 모델로 만든 활용 사례가 잇달아 올라왔습니다. 제가 9월 19일 스레드에 정리한 15건 가운데 비용을 밝힌 8건은 모두 1달러를 넘지 않았고, PR 한 건 검토에는 0.00007달러가 들었습니다. Jev는 문장을 쓰지 않고 정해 준 선택지 가운데서 고르는 모델이라, 입력 100만 토큰에 0.042달러를 받고 출력에는 요금을 매기지 않습니다.

공개 영상은 창업자 디오고 알메이다가 자기 계정에 직접 올렸습니다. 그는 오픈AI에서 ChatGPT의 바탕이 된 2022년 InstructGPT 논문을 함께 쓴 연구자이고, 게시물은 「ChatGPT를 함께 만든 뒤」 초인적인 채팅 모델이 왜 AGI로 이어지지 않았는지 계속 자문했다는 말로 시작합니다. 2년 동안 외부에 알리지 않고 새 학습법 RLCD와 새 모델을 만들었고, 기존 LLM보다 20~200배 빠르며 출력 토큰을 받지 않아 40~400배 싸다는 것이 발표의 요지였습니다.

## 문장을 쓰지 않는 모델

지금의 LLM은 답을 토큰 하나씩 이어 붙여 만듭니다. 다음 토큰은 앞 토큰을 보고 정해지니 답이 길수록 시간이 늘고, TypeSafe가 정리한 표로는 출력 토큰 값이 입력 토큰의 5배 안팎입니다. 소프트웨어가 이 답을 쓰려면 문장에서 값을 뽑아내고 형식이 맞는지 다시 검사하는 코드도 붙여야 합니다.

Jev는 이 과정을 건너뜁니다. 개발자가 상태(문서나 기록 같은 입력)와 함께 질문을 정해진 형식으로 보내면, Jev는 선택지마다 확률을 매겨 한 번에 돌려줍니다. 질문은 여러 선택지 가운데 하나를 고르는 것, 등급을 매기는 것, 예·아니요의 확률을 묻는 것 세 가지입니다. 답이 정해 둔 형식을 벗어날 수 없어서 TypeSafe는 형식 오류가 수학적으로 불가능하다고 적었고, 응답 시간은 70~500밀리초라고 밝혔습니다.

값의 차이도 여기서 나옵니다. TypeSafe가 정리한 LLM 입력값은 100만 토큰에 0.20~10달러인데 Jev는 0.042달러라, 입력만 놓고 봐도 5배에서 240배 가까이 쌉니다. 입력의 5배 안팎인 출력값은 아예 받지 않고, 10억 토큰으로 환산하면 42달러입니다.

AI 전문 매체 Every가 든 예가 쉽습니다. 고객 문의에 우선순위를 매기는 소프트웨어가 「이 고객은 화가 났는가」라고 물으면 Jev는 0.9 같은 확률을 돌려주고, 프로그램은 그 값을 보고 문의를 관리자에게 올리거나 뒤로 미룹니다. 채팅 모델이라면 「네, 이 고객은 매우 화가 난 것 같습니다」 같은 문장을 돌려줘 숫자를 기다리던 프로그램이 멈출 수 있습니다.

![보안 경보 한 건을 분류, 처리 결정, 격리, 대응 절차 네 단계로 처리하는 흐름도. 단계마다 예·아니요, 점수, 선택형 질문이 붙어 있습니다.](https://framerusercontent.com/images/ih1bFwZGYJxlnijbTuXx3f9NeM.png)

이름에도 계산이 들어 있습니다. 모델 계열 이름 「System One」은 대니얼 카너먼이 빠르고 직관적인 사고를 부른 시스템 1에서 따왔고, Jev는 19세기 경제학자 윌리엄 스탠리 제번스에서 따왔습니다. TypeSafe는 증기기관의 효율이 오르자 석탄 수요가 늘었듯, 지능의 값이 10분의 1로 내려갈 때마다 쓸 곳은 그보다 몇 자릿수 더 늘어날 것이라고 적었습니다. 값이 내려가면 쓰는 양이 더 빨리 늘어난다는 이 역설은 [a16z의 소프트웨어 매도 차트](/post/review-a16z-software-selloff-jevons)를 다룰 때도 나왔습니다.

## 3일 동안 올라온 15건

비용과 시간이 가장 또렷하게 적힌 사례는 아침 뉴스 384건입니다. 9월 18일 홍보 업무용 도구를 만드는 @elvissun은 Jev가 그날 아침 뉴스 384건을 24.9초에 읽고 브랜드 15곳에 어떤 기사를 활용할지 골라 주는 데 0.19달러가 들었다고 올렸습니다. 같은 피드를 같은 시간에 돌린 Claude Opus 5는 384건 가운데 4건을 처리하고 0.77달러를 썼습니다.

그가 계산한 기사 한 건당 비용 차이는 약 390배입니다. 3시간여 뒤 그는 이 시연을 실제 서비스로 내놨다고 알리며, 들어오는 뉴스 신호 약 200건을 8초에 약 1센트로 걸렀고 자체 평가에서 놓친 기사가 없었다고 덧붙였습니다.

PR 한 건에 0.00007달러가 든 사례는 회계 소프트웨어 회사 Dext의 응용 AI 책임자 파올로 로손(@redp314)이 9월 17일 올렸습니다. 코드 변경분을 붙여 넣으면 Jev 호출 한 번에 하드코딩된 비밀 키, SQL 인젝션, 인증 코드 수정, 테스트 삭제, API 호환성 깨짐 같은 14가지 검사가 확률로 돌아오고, 코드는 이 값을 모아 차단·보안 검토·사소한 지적·병합 가운데 하나로 판정합니다.

중요한 검사의 확률이 0.35~0.65 사이로 애매하면 추측하지 않고 사람이나 큰 모델에 넘기도록 짰습니다. 그가 적은 값으로 PR 1,000건 검토는 7센트이고, 같은 일을 Opus 5에 맡기면 약 14.5달러입니다. 나머지 13건은 아래 표에 모았습니다. 사례 이름을 누르면 만든 사람의 원본 게시물로 이동합니다.

| 사례 | 걸린 시간·비용 | 만든 사람 |
| --- | --- | --- |
| [가상 소비자 150명에게 질문 12개씩](https://x.com/ytiskw/status/2100474943154827344) | 약 5초, 1.8엔(일본과 미국 사이 지연 포함) | @ytiskw |
| [브라우저로 항공편 검색](https://x.com/gregpr07/status/2100411066966749359) | 약 7초, 0.0039달러 | @gregpr07 |
| [지원자 한 명과 기업 400곳 비교](https://x.com/sarvagya_kul/status/2100980770206879849) | 12초, 0.0005달러 | @sarvagya_kul |
| [음성으로 Mac 조작](https://x.com/instantricecook/status/2100814590300889426) | 말을 마치기 전에 앱 실행 | @instantricecook |
| [Monad 블록마다 매수·매도하는 봇](https://x.com/jarrodwatts/status/2100356151468585346) | 300밀리초 블록마다 주문 | @jarrodwatts |
| [37개 브랜드 광고 724개 분류](https://www.threads.com/@choi.openai/post/DdcjAJ8CWFa) | 40초, 0.09달러 | @TheMattBerman |
| [Super Mario Bros. 실시간 플레이](https://x.com/faadilhshaik/status/2100086301894881578) | 성공률 약 4번 중 1번 | @faadilhshaik |
| [말과 손가락으로 캔버스 조작](https://x.com/jackcheng/status/2100729670991802386) | 판단 한 번 167밀리초 | @jackcheng |
| [단어 수백 개 가운데 골라 문장 만들기](https://x.com/hi_im_isaac_/status/2100408276949385668) | 다음 단어를 매번 선택 | @hi_im_isaac_ |
| [json-render로 웹 화면 구성](https://x.com/ctatedev/status/2101022101750571357) | 밀리초 단위 렌더링 | @ctatedev |
| [AI 논문 1,018편을 24개 주제로 분류](https://x.com/nutlope/status/2100426999546184123) | 편당 중앙값 256밀리초, 0.08달러 | @nutlope |
| [Minecraft 24시간 생방송](https://x.com/jarrodwatts/status/2100674934582263895) | 엔더 드래곤을 목표로 한 번에 한 동작씩 결정 | @jarrodwatts |
| [잠재 고객 700명 대상 메시지 반응 예측](https://x.com/romanbuildsaas/status/2100891604735099103) | 40초, 0.09달러 | @romanbuildsaas |

표의 사례들은 모두 짧은 판단을 여러 번 되풀이합니다. 게임은 매 순간 다음 동작을, 트레이딩 봇은 300밀리초마다 사고팔지를, 분류기는 문서마다 주제를 고릅니다. TypeSafe가 공개한 DOOM 시연도 같은 구조인데, 1초에 10번 불러도 비용은 시간당 약 7달러였습니다.

## 3일 만에 15건이 쌓인 경로

15건 가운데 첫 사례는 한국 시각 9월 16일 오후 올라온 Super Mario Bros. 플레이였고, 17일과 18일에는 하루 대여섯 건씩 이어졌습니다. Jev는 대기자 명단으로 시작했습니다. TypeSafe는 공개 직후부터 명단에서 사람들을 한 무더기씩 풀어 줬고, 공개 이틀째에는 Vercel의 AI Gateway에서도 Jev를 쓸 수 있게 했습니다. 트레이딩 봇을 만든 @jarrodwatts는 다음 날 접근권이 없는 사람도 이 게이트웨이로 누구나 쓸 수 있다고 알렸습니다. 9월 19일 기준 TypeSafe 문서에는 수요가 매우 많아 요청 한도(분당 1,200건)가 예고 없이 달라질 수 있고, 대형 GPU 계약이 들어오는 대로 사용자를 더 받겠다는 공지가 있었습니다.

사례를 올린 쪽의 사정도 게시물에 드러납니다. 9월 18일 저녁 올라온 잠재 고객 700명 사례와 19일 새벽 올라온 기업 400곳 사례는 「JEV is INSANE」으로 시작해 몇 초 만에 예측하고 신뢰도를 매기고 불일치를 찾았다는 문장 틀이 거의 같습니다. 700명 사례를 올린 영업 자동화 도구 Gojiberry의 창업자는 바로 이어진 글에서 영상이 실제 제품 화면이 아닌 콘셉트 미리보기라고 밝혔습니다. 9월 20일 새벽 그는 Jev 이야기를 X에 올려 조회 35만 회와 평소보다 2,000명 넘는 웹사이트 방문을 얻었다며, Jev가 2주 뒤 낡은 도구가 되더라도 잃는 것은 몇 시간뿐이니 이 파도를 타라고 적었습니다.

## 계산서에 적힌 값과 빠진 값

1,018편을 0.08달러에 분류했다는 게시물은 모델 호스팅 회사 투게더 AI의 개발자 경험 책임자 하산(@nutlope)이 올렸고, 계산서 전체를 함께 적었습니다. 논문마다 먼저 DeepSeek V4 Flash로 요약을 만들었고, 요약에 든 비용이 3.99달러였습니다. 파이프라인 전체 약 4.07달러 가운데 Jev가 쓴 돈은 2% 남짓이고, 그는 모든 일을 한 모델에 맡기는 대신 단계마다 다른 모델을 쓰는 쪽으로 가고 있다고 봤습니다.

그가 같은 날 늦게 올린 사기 메일 판별은 더 자세합니다. Jev가 메일 100통을 1.42초에 분류했고, 확신이 95%에 못 미친 31통은 Kimi K3로 넘겨 다시 판단하게 했습니다. 두 모델을 합친 결과는 100통 중 96통 정답, 16초, 약 0.071달러였습니다.

한데 비용을 나눠 보면 0.068달러가 Kimi K3, 0.003달러가 Jev였습니다. 메일의 31%를 넘겨받은 큰 모델이 비용의 96%를 썼습니다. PR 검토에서 확률이 애매한 검사를 사람이나 큰 모델로 넘긴 구조도 같고, TypeSafe 문서도 확신도를 기준으로 넘길지 정하는 방식을 설계 방식의 하나로 소개합니다. 이런 구조에서 전체 비용을 정하는 것은 Jev의 단가보다 넘겨지는 비율과 넘겨받는 모델의 값입니다.

그래서 건당 단가를 볼 때는 무엇을 한 단위로 세는지부터 확인하게 됩니다. 우버가 에이전트 비용을 병합된 PR 한 건, 리뷰 한 건처럼 끝낸 일의 단위로 잰 것도 같은 이유였고, 그 방식은 [우버의 비용 절감 기록](/post/review-uber-software-factory-cost)에 있습니다.

## 정확도는 얼마를 내주나

TypeSafe가 공개한 비교는 자기에게 유리한 조건을 먼저 밝힙니다. 발표 영상에서 같은 고객 상황과 질문 27개를 받은 Jev는 0.114초 만에 답을 모두 돌려줬고, GPT-5.6 Terra는 8.566초 동안 답을 출력했습니다. 회사는 이 입력이 짧고 밀도 높은 문단이라 Jev에 유리하게 보인다고 적었고, 두 모델의 판단이 갈린 것은 이탈 가능성 항목 하나였다고 밝혔습니다.

더 긴 비교는 실무형 업무 흐름 네 개를 코드로 짜 두고 모델마다 같은 흐름을 돌린 뒤, GPT-6 Astra와 Claude Fable 5.1의 답을 평균한 값을 기준 답으로 삼아 얼마나 가까운지 쟀습니다. 네 흐름 가운데 가장 단순한 것이 앞에서 본 보안 경보 처리 흐름입니다.

![업무 흐름 네 개의 평균 정확도와 흐름당 비용을 로그 척도로 찍은 산점도. Jev는 정확도 약 68%에 비용이 가장 낮은 왼쪽 끝에 있고, 비슷한 정확도의 다른 모델들은 오른쪽으로 비용이 더 높습니다.](https://framerusercontent.com/images/z4Uu1YpJeEZPBSMTCMI0CN2PX0.png)

그래프에서 Jev는 정확도가 비슷한 모델들보다 흐름당 비용이 두 자릿수 가까이 낮습니다. TypeSafe는 홈페이지에 적은 「193.6배 빠르고 444.6배 싸다」가 이 평가에서 나왔고 실제로는 높은 쪽 값일 것이라고 적었습니다. 평가 흐름을 자기 팀원이 만들어 편향이 있을 수 있고, 기준 답이 오픈AI와 앤트로픽 모델 쪽으로 기울어 있으며, 속도는 미국 서부 해안에서 노트북으로 쟀고, 가격에 보조금이 없다는 것은 증명할 수 없다는 단서도 같은 글에 있습니다.

외부 측정도 대체로 같은 방향이었습니다. 다만 정확도 몇 점을 내주고 속도와 값을 얻은 기록이 함께 나왔습니다.

| 측정한 곳 | Jev | 비교 대상 |
| --- | --- | --- |
| Every, 글 결함 찾기 12개 지문 | 결함 7개 중 6개, 중앙값 0.35초 | Fable 5.1(높은 추론) 7개 모두, 8.83초 |
| 구인 플랫폼 Snagajob 제품 담당자, 직업 분류(ONET) | 정확 일치 80.5%, 건당 약 0.2초, 100만 건 122달러 | GPT-5.6 Luna 84.9%, 약 2초, 482달러 |
| Vercel, 기존 분류기 평가 | 평가 만점, 6배 빠름 | Gemini 2.5 Flash Lite |
| Good Start Labs, 채점 | Fable 5.1과 10번 중 9번 일치, 채점 비용 약 200분의 1 | Fable 5.1 |

Every 대표 댄 시퍼가 직접 돌린 이 시험에서 Jev는 Fable 5.1보다 약 25배 빠르고 비용은 약 580분의 1이었습니다. Jev가 놓친 결함은 부모와 교직원이 함께 가르치는 공용 일정표라는 문장이었습니다. 일정표를 가르친다는 설명 없는 동작을 Fable은 잡았고, Jev는 세 번 돌려 세 번 다 놓쳤습니다. 자기 글 27편과 AI 문체로 쓴 대조 글 10편에 질문 21개씩, 777개 판단을 0.7초 안에 받아 본 Every의 마이크 테일러도 실제 서비스에 넣기 전에는 더 꼼꼼한 정확도 검증을 거치겠다고 적었습니다.

## 오래 생각해야 하는 일에서는 막혔습니다

항공편 검색을 7초에 끝낸 브라우저 자동화 회사 Browser Use의 창업자 그레고르 주니치(@gregpr07)는 이틀 뒤 다른 숫자를 올렸습니다. 여러 단계를 거쳐야 하는 긴 과제 20개에서 Jev 에이전트는 1개를 풀었고, BrowserCode와 GPT-5.6 Luna 조합은 17개를 풀었습니다.

그의 설명으로는 브라우저 조작이 상태 공간을 뒤지는 복잡한 탐색이라, 오래 생각하거나 되돌아가야 할 때가 많고 추론 능력이 없는 모델은 아직 그 일을 하지 못합니다. 다음 날 그는 Jev가 글을 쓰지 못하고, 아직 화면을 보지 못하며, 미리 정해 준 동작 가운데서만 고를 수 있다는 목록을 「씁쓸한 사실」이라며 올렸고, 그러면서도 이 속도가 브라우저 자동화의 새 가능성을 보여 줬다고 덧붙였습니다. 9월 18일 공개된 웹 에이전트 벤치마크 윈드터널에서도 Jev와 Mercury 2.5 조합은 웹페이지 구조를 직접 읽어 조작할 때 49개 과제 중 25개를 풀었고, 사이트가 도구를 내준 WebMCP 방식에서 49개를 모두 풀었습니다. 이 벤치마크는 [AI가 웹사이트를 쓰는 세 가지 방법을 다룬 글](/post/review-three-paths-agents-reach-the-web)에 정리했습니다.

게임 기록도 같은 쪽을 가리킵니다. 체스에서 Jev는 수마다 약 0.3초, 0.0001달러 미만을 썼지만 수마다 5.8초와 약 0.008달러를 쓴 GLM 5.3에게 29수 만에 체크메이트를 당했습니다. Minecraft 생방송의 Jev는 48시간이 넘도록 돌을 캐지 못해 제작자가 월드를 초기화했고, 다시 시작한 뒤에야 돌 곡괭이를 만들었습니다. Super Mario Bros.의 성공률 약 4번 중 1번은 만든 사람이 직접 밝힌 값입니다.

TypeSafe도 9월 17일 기준 문서에 jev-1.13이 약한 곳을 적어 뒀습니다. 질문을 글자 그대로 읽고, 개수를 세거나 날짜 앞뒤를 비교하는 일을 믿을 만하게 하지 못하며, 여러 단계를 건너 추론해야 하는 질문과 관계없는 내용이 가득한 긴 입력에 약합니다. 셈과 날짜 비교는 코드에서 하고, 문장이 필요하면 생성형 모델을 쓰라는 것이 회사의 권고입니다.

## 한국 팀이 따져 볼 것

Jev는 지금 조기 접근과 Vercel AI Gateway로 쓸 수 있고, 값은 입력 10억 토큰에 42달러입니다. 한 번 요청에 넣을 수 있는 분량은 6만 4,000토큰이고 입력은 텍스트만 받습니다. 서비스가 미국 서부에 있어서 일본에서 가상 소비자 설문을 돌린 @ytiskw도 5초에는 일본과 미국 사이의 지연이 들어 있다고 적었습니다.

TypeSafe 문서는 영어가 주 학습 언어이고 정확도도 영어에서 가장 좋으며, 한중일 문자를 포함한 다른 언어는 처리하지만 같은 수준은 아니라고 적었습니다. 한국어 문의나 문서를 분류하려면 자기 데이터로 먼저 재 보고, 확신도가 낮게 나오는 비율을 봐야 넘겨받는 모델의 비용까지 계산할 수 있습니다. 회사는 고객 요청을 학습에 쓰지 않는다고 밝혔고, 기업 고객에게는 데이터를 남기지 않는 옵션을 둡니다.

저는 9월 16일 이 모델을 처음 소개하며 프로그램에 AI를 붙이는 방식이 꽤 달라질 것 같다고 적었습니다. 3일 동안 쌓인 15건과 반대 기록을 함께 놓으면 그 쓰임새는 짧고 정해진 판단을 코드 안에서 수없이 되풀이하는 일이고, 긴 추론과 글쓰기는 여전히 큰 모델이 맡습니다. TypeSafe는 가격이 앞으로 내려갈 것으로 본다고 했고, 이미지 입력은 아직이라고 적었습니다.

읽어 주셔서 고맙습니다.

초이 드림
