이미지: Perplexity
이 글 어땠어요?
요청의 자료(state)를 배열로 보내고 그 안에 PNG·JPEG·WebP 이미지를 base64 데이터 URL로 넣습니다. 웹 주소는 받지 않고, 한 장은 32×32픽셀 조각 2,048개(1440×1440 정도)까지입니다.
파이썬 3.12 이상과, 가중치 약 49GiB에 작업 메모리를 더 올릴 수 있는 CUDA GPU가 필요합니다. 가중치는 아파치 2.0, 학습·서빙 코드는 MIT 라이선스입니다.
퍼플렉시티는 한국어 점수를 내지 않았습니다. 여러 언어 독해 시험 Belebele 500문항에서 94.00%로 Jev(95.00%)보다 1%포인트 낮았고, 언어 구성은 밝히지 않았습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
TypeSafe의 판단 전용 모델 Jev가 공개 5일 만인 9월 20일 모든 개발자에게 열렸습니다. 그사이 X에 올라온 데모는 사례 모음 사이트에 모인 것만 194개였고, Jev처럼 선택지에 확률을 매기는 공개 모델도 4개 나왔습니다.

퍼플렉시티가 7월 15일 샌드박스 플랫폼 SPACE를 공개했습니다. 2월 외부 업체로 시작한 Computer의 트래픽을 전부 옮겼고, 샌드박스 생성 지연은 중앙값 185밀리초에서 60밀리초로 줄었습니다.
클라우드플레어가 10월 2일 0시 34분 결정 모델 Clef를, AWS가 30분쯤 뒤 Strands Decider 2B를 오픈소스로 냈습니다. Jev 공개 16일, 오픈AI Decisions API 발표 이틀 만입니다.

TypeSafe의 판단 전용 모델 Jev가 공개 5일 만인 9월 20일 모든 개발자에게 열렸습니다. 그사이 X에 올라온 데모는 사례 모음 사이트에 모인 것만 194개였고, Jev처럼 선택지에 확률을 매기는 공개 모델도 4개 나왔습니다.

퍼플렉시티가 7월 15일 샌드박스 플랫폼 SPACE를 공개했습니다. 2월 외부 업체로 시작한 Computer의 트래픽을 전부 옮겼고, 샌드박스 생성 지연은 중앙값 185밀리초에서 60밀리초로 줄었습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@perplexitydevsX 게시물 · 원문 보기
퍼플렉시티 개발자 계정 @perplexitydevs의 발표는 세 문장이었습니다. Decisions API를 소개하고, 이 API가 글 대신 정해 둔 답들에 대한 확률 분포를 내도록 학습한 멀티모달 결정 모델 pplx-decider-v1-27b로 돌아간다고 밝힌 뒤, 값은 입력 100만 토큰당 0.04달러이고 벤치마크 종합 점수는 85.71%라고 적었습니다. 첨부한 표에는 시험 11개의 문항 수와 Jev, 바탕 모델, 퍼플렉시티 모델의 점수가 나란히 실렸습니다.
결정 모델은 글을 쓰지 않고, 개발자가 정해 준 선택지마다 확률을 매겨 돌려주는 모델입니다. 클라우드플레어가 같은 날 0시 34분 Clef를, AWS가 30분쯤 뒤 Strands Decider 2B를 낸 데 이어 3시간이 채 안 돼 세 번째 모델이 나왔습니다. 결정 모델의 쓰임과 Clef·Strands의 구조는 앞선 글에 정리했고, 이 글은 퍼플렉시티 모델이 값과 성능, 이미지 판정에서 무엇이 다른지를 따라갑니다.

10월 2일 새벽에 나온 결정 모델을 시각순으로 놓으면 이렇습니다.
| 한국 시각(10월 2일) | 있었던 일 |
|---|---|
| 0시 34분 | 클라우드플레어, Clef·Clef-flash 공개 |
| 1시 전후 | AWS, Strands Decider 2B 공개 |
| 3시 24분 | 퍼플렉시티, Decisions API와 pplx-decider-v1-27b 발표 |
| 6시 24분 | 허깅페이스에 pplx-decider-v1-27b 저장소 생성 |
TypeSafe가 9월 15일(미국 시각) Jev를 내놓은 뒤 오픈AI는 9월 29일 DevDay에서 GPT-6 Luna 기반 Decisions API를 제한 프리뷰로 공개했고, 값은 아직 밝히지 않았습니다. 저는 9월 30일과 10월 2일 두 번이나 스레드 첫 문장을 「정말 모든 게 Jev가 되고 있습니다」로 열었는데, 퍼플렉시티가 함께 공개한 학습 코드의 패키지 이름도 autojev입니다. 모델 저장소의 고지 파일(NOTICE)은 이 모델이 큐원·TypeSafe와 제휴 관계가 없고 두 곳의 보증도 받지 않았다고 따로 적었습니다.
챗 모델에 「이 티켓이 급한가」를 물으면 문단 하나가 돌아옵니다.— 퍼플렉시티, Decisions API 쿡북
퍼플렉시티 쿡북은 결정 모델이 필요한 이유를 이 문장으로 시작합니다. 문단 속 「예」나 「아마도」를 읽어 내는 코드를 짜기 어려워 JSON을 요구하고, 형식이 깨지면 다시 요청하고, 그래도 모델이 얼마나 확신했는지는 모른다는 설명입니다. 결정 모델은 문단 대신 확률을 돌려줘서 기준값과 비교하는 한 줄로 분기를 끝내게 합니다.
값과 입력 한도를 네 모델과 오픈AI의 API로 나란히 놓으면 이렇습니다.
| 모델(만든 곳) | 입력 100만 토큰당 | 10억 토큰 | 이미지 입력 | 요청당 입력 한도 |
|---|---|---|---|---|
| pplx-decider-v1-27b(퍼플렉시티) | 0.04달러 | 40달러 | 받음 | 26만 2,144토큰 미만 |
| Jev 1.13(TypeSafe) | 0.042달러 | 42달러 | 안 받음 | 6만 4,000토큰 |
| Clef-flash(클라우드플레어) | 0.09달러 | 90달러 | 요청당 4장 | 6만 5,536토큰 |
| Clef(클라우드플레어) | 0.24달러 | 240달러 | 요청당 4장 | 6만 5,536토큰 |
| Decisions API(오픈AI) | 미공개 | 미공개 | 받음 | 미공개 |
퍼플렉시티와 Jev는 출력 토큰에 값을 받지 않고, 퍼플렉시티는 요청당 수수료도 없습니다. Jev의 6만 4,000토큰은 상태(state, 판단할 자료)와 질문을 모두 합친 한도이고 상태와 가장 긴 질문 하나는 3만 2,000토큰까지라, 퍼플렉시티의 26만 2,144토큰은 Jev 요청 한도의 약 4배입니다. 한 요청에 긴 계약서나 대화 기록을 통째로 넣는 일에서는 단가 차이 0.002달러보다 이 한도 차이가 먼저 걸립니다.
체감 단위로 바꾸면 이렇습니다. 퍼플렉시티 쿡북의 고객 문의 분류 예제에서 티켓 한 건은 입력 590~659토큰이었으니, 같은 크기의 문의 100만 건을 분류하는 입력 요금은 24~26달러 안팎입니다. 2020년 9월 국내 개발자 커뮤니티 GeekNews가 전한 GPT-3 API의 첫 요금은 200만 토큰에 100달러, 100만 토큰당 50달러였고, 퍼플렉시티 결정 모델의 입력 단가는 그 1,250분의 1입니다. 다만 GPT-3는 글을 써서 돌려줬고 결정 모델은 선택지에 확률만 매기니, 두 숫자가 같은 일에 붙은 값은 아닙니다.
처리량에는 다른 한도가 붙습니다. 퍼플렉시티는 모든 요금제에서 조직당 초당 10건으로 요청 수를 묶었고, 큰 요청이 몰리면 토큰 한도도 따로 겁니다. 9월 29일(미국 시각) 보관된 TypeSafe 문서에 적힌 Jev의 한도는 분당 1,200건(초당 20건)과 초당 25만 토큰이었고, TypeSafe는 수요에 따라 한도가 바뀔 수 있다고 덧붙였습니다. 퍼플렉시티는 요청 하나에 질문을 128개까지 묶을 수 있어, 같은 자료에 여러 판단을 물을 때는 요청 수를 줄일 수 있습니다.
퍼플렉시티 문서는 9월 30일 직접 잰 응답 시간을 입력 크기별로 적었습니다. 입력이 수백 토큰이면 2초 안에 답했고, 약 9만 토큰은 5초, 약 19만 토큰은 14초, 한도 바로 아래는 23초가 걸렸습니다. 제때 답하지 못한 요청은 1분쯤 뒤 504 오류로 끝나고, 문서의 예제는 클라이언트 대기 시간을 30초로 잡았습니다.
쿡북의 티켓 분류에서는 590~659토큰짜리 요청 대부분이 150~250밀리초에 끝났고, 쿡북은 티켓 한 건마다 수백 밀리초를 잡고 직접 재 보라고 권합니다. 클라우드플레어가 발표 글에서 잰 응답 시간 중앙값은 Clef 209밀리초, Clef-flash 39밀리초, Jev 524밀리초였습니다. 오픈AI의 티보 소티오는 자사 Decisions API를 처음부터 끝까지 몇백 밀리초 안에 결정하도록 맞췄다고 밝혔습니다.
요청에는 판단할 자료(state)와 이름을 붙인 질문들을 함께 보냅니다. 자료는 문자열이나 JSON 객체, 텍스트와 이미지를 섞은 배열이고, 질문은 세 종류입니다.
| 질문 유형 | 묻는 것 | 돌려받는 것 | 한도 |
|---|---|---|---|
| noul | 예·아니요, 또는 확인할 진술 | '예'일 확률(0~1) | 해당 없음 |
| choice | 정해 둔 선택지 중 하나 | 선택지마다 확률, 가장 높은 선택지, 확신도 | 선택지 1~255개 |
| score | 순서가 있는 평가 단계 | 단계마다 확률, 기대 점수, 확신도 | 단계 최대 10개 |
문서의 예제는 「소리는 좋은데 2주 만에 배터리가 충전되지 않는다」는 헤드폰 리뷰 하나에 세 질문을 한 번에 물었습니다. 결함을 보고한 리뷰일 확률은 0.94, 감정은 '긍정과 불만이 섞임'이 0.95였고, 심각도는 '외관 문제(0)·불편(1)·사용 불가(2)' 가운데 기대 점수 1.78이 나왔습니다. 입력은 367토큰, 출력은 3토큰이었습니다.
확신도(confidence)는 가장 높은 확률과 다른 값입니다. 같은 예제에서 감정 질문의 1위 확률은 0.95였지만 확신도는 0.93이었고, 문서는 2위 선택지가 가까울수록 확신도가 내려간다고 설명합니다. 같은 요청도 가끔 소수점 아래 두 번째 숫자가 달라질 수 있어, 문서는 기준값을 여유 있게 잡으라고 안내합니다.
선택지 상한 255개는 모델 구조와 맞물려 있습니다. 고지 파일에 따르면 퍼플렉시티는 큐원에서 글을 만드는 출력부를 떼고 선택지 255개를 읽는 판독부를 달았고, 설정 파일에는 A부터 JT까지 255개의 선택지 기호가 들어 있습니다. 확률이 실제 정답률에 맞도록 따로 떼어 둔 보정용 데이터로 맞춘 온도 값(2.2076)도 함께 저장돼 있습니다.
이미지는 자료 배열 안에 base64 데이터 URL로 넣습니다. PNG·JPEG·WebP만 받고, 웹 주소를 주면 API가 이미지를 가져오지 않고 400 오류를 돌려줍니다. 이미지는 32×32픽셀 조각으로 나눠 읽고 한 장에 2,048조각까지 받기 때문에, 1440×1440이나 2048×1024는 들어가지만 1600×1310은 넘칩니다.
넘치는 이미지에는 함정이 하나 있습니다. 문서에 따르면 크기를 넘긴 이미지는 400 오류로 바로 거절되지 않고, 1분쯤 기다린 뒤 504 시간 초과로 끝납니다. 문서는 보내기 전에 크기를 줄이라고 안내합니다.
퍼플렉시티 시험에서 이미지는 100만 화소당 입력 약 1,000토큰이었습니다. 1440×1440 화면 한 장(약 207만 화소)이면 2,000토큰 남짓이고, 이런 화면 1만 장을 판정해도 입력 요금은 1달러가 안 됩니다. 허깅페이스의 실행 예제는 이미지를 넣으면 주된 색이 빨강·초록·파랑·기타 가운데 무엇인지 묻는 질문을 기본으로 돌립니다.
다른 모델과 견주면 이미지를 받는 방식이 갈립니다. Clef는 요청당 이미지 4장(장당 4MiB·1,600만 화소)까지 받고 역시 웹 주소는 받지 않습니다. Jev는 텍스트만 받아서, TypeSafe 문서는 이미지와 음성, 영상을 미리 글이나 구조화한 값으로 바꿔 보내라고 안내합니다.

퍼플렉시티가 공개한 시험 11개에 무엇을 재는 시험인지 붙여 문항 수 순으로 놓으면 이렇습니다.
| 시험 | 무엇을 재나 | 문항 | Jev | Qwen3.8-27B | pplx-decider |
|---|---|---|---|---|---|
| RAGTruth | 검색 자료에 없는 내용을 지어냈는지 | 1,500 | 77.27% | 61.53% | 88.80% |
| WinoGrande | 상식으로 대명사가 가리키는 대상 고르기 | 1,000 | 90.70% | 73.10% | 83.30% |
| FinancialPhraseBank | 금융 뉴스 문장의 긍정·부정 | 999 | 76.98% | 75.68% | 84.18% |
| BBH | 여러 단계 추론이 필요한 어려운 문제 | 750 | 94.27% | 72.80% | 82.80% |
| ContractNLI | 계약서가 주어진 진술을 뒷받침하는지 | 510 | 77.45% | 80.78% | 80.78% |
| TabFact | 표에 비춰 문장이 참인지 | 500 | 89.80% | 78.60% | 90.60% |
| Circa | 돌려 말한 대답의 뜻 | 500 | 84.60% | 87.00% | 89.20% |
| Belebele | 여러 언어 독해 | 500 | 95.00% | 93.20% | 94.00% |
| TruthfulQA binary | 흔한 오해에 넘어가지 않는지 | 500 | 92.00% | 82.80% | 85.40% |
| JudgeBench | 다른 모델 답의 옳고 그름 판정 | 350 | 78.57% | 68.86% | 78.29% |
| JevBench public hard | Jev 벤치마크 공개 과제 중 어려운 문제 | 101 | 73.27% | 72.28% | 70.30% |
| 종합 | 7,210 | 84.51% | 74.76% | 85.71% |
종합 점수는 7,210문항 전체에서 맞힌 문항의 비율입니다. 표의 점수와 문항 수를 곱해 보면 퍼플렉시티 모델은 6,180문항, Jev는 6,093문항을 맞혀 차이는 87문항이었습니다. 문항이 가장 많은 RAGTruth(1,500문항, 전체의 21%)에서 퍼플렉시티 모델이 Jev보다 11.53%포인트 높아, 이 시험 하나에서만 173문항을 더 맞혔습니다.
| 계산 방식 | Jev | pplx-decider |
|---|---|---|
| 문항 수로 가중(퍼플렉시티 종합) | 84.51% | 85.71% |
| 시험 11개 단순 평균 | 84.54% | 84.33% |
| RAGTruth 뺀 5,710문항 | 86.41% | 84.90% |
| 더 높았던 시험 수 | 6개 | 5개 |
시험 11개를 같은 비중으로 평균하면 Jev가 0.21%포인트 앞서고, RAGTruth를 빼면 1.51%포인트 앞섭니다. 퍼플렉시티 모델이 앞선 RAGTruth, TabFact, ContractNLI, FinancialPhraseBank, Circa는 주어진 문서·표·문장 안에서 판단 근거를 찾는 시험입니다. Jev가 앞선 WinoGrande, BBH, TruthfulQA는 자료 밖의 상식이나 여러 단계 추론을 요구합니다.
BBH의 흐름은 다른 회사가 잰 표에서도 같았습니다. 앞선 글에서 다룬 클라우드플레어 측정에서 같은 Qwen3.8-27B 출신 Clef는 73.7점, Jev는 92.9점이었고, 퍼플렉시티 측정에서는 퍼플렉시티 모델 82.80%, Jev 94.27%였습니다. 재는 회사가 달라도 Jev는 두 번 모두 90점대를 냈고, 큐원 27B에서 출발한 두 결정 모델은 10%포인트 넘게 뒤졌습니다.
바탕 모델과 견주면 미세조정의 효과도 시험마다 달랐습니다. RAGTruth는 27.27%포인트 올랐지만 ContractNLI는 80.78%로 바탕 모델과 같았고, JevBench 공개 과제 중 어려운 문제는 바탕 모델(72.28%)보다 낮은 70.30%였습니다. 퍼플렉시티 모델 점수는 퍼플렉시티 API로 잰 값이고, 모델 카드에는 시험에 쓴 지시문이나 설정이 실려 있지 않습니다.
퍼플렉시티 쿡북은 가상의 SaaS 회사에 들어온 지원 티켓 12건으로 이 API를 시험한 기록을 실었습니다. 티켓마다 요청 하나로 사람이 나서야 하는지, 무엇을 요구하는지(선택지 7개), 피해가 얼마나 큰지(4단계)를 한꺼번에 묻고, 숫자에 따라 긴급 처리·검토·대기열·자동 답변·종료로 나눠 보냅니다. 12건 가운데 3건만 웹 검색과 도구를 쓰는 퍼플렉시티 Agent API로 넘어갔고, 9건은 프런티어 모델을 한 번도 거치지 않았습니다.
시간을 재 보면 큰 모델 쪽에 대부분이 몰립니다. 분류 요청 12건은 모두 합쳐 약 2.5초였고 대부분 150~250밀리초에 끝났지만, 첫 요청이나 가끔 몇 초 걸리는 요청도 있었습니다. 넘어간 3건까지 처리한 실행은 17.2초였는데 그 가운데 15.6초가 Agent API 요청 세 번에 들었습니다. 실행 시간의 91%가 큰 모델 세 번에 든 구조는 Jev로 메일을 거르던 파이프라인에서 넘겨받은 큰 모델이 비용의 96%를 쓴 기록과 닮았습니다.
기준값을 어디에 두느냐도 결과를 갈랐습니다. 다크 모드 기능을 요청한 티켓(T-1004)의 '사람이 나서야 하나' 확률은 9월 29일 다섯 번 돌린 결과가 0.29, 0.29, 0.31, 0.31, 0.32였고, 처음 기준값 0.30에서는 같은 티켓이 자동 답변과 대기열을 오갔습니다. 퍼플렉시티는 기준값을 이 무리에서 떨어진 0.35로 올렸고, 9월 30일 13번 실행 가운데 11번은 표가 한 글자도 다르지 않았으며 나머지 두 번은 숫자가 최대 0.06 움직였습니다.
확신도가 낮아도 다른 숫자가 길을 정한 경우도 있습니다. 작업 공간을 실수로 지운 티켓(T-1007)은 요구 분류의 확신도가 0.51(1위 확률 0.58)에 그쳤지만, 가장 심한 단계일 확률이 0.85여서 긴급 처리로 넘어갔습니다. 쿡북은 이런 결과 파일을 남겨 두면 나중에 기준값을 맞출 때 그대로 라벨 데이터가 된다고 적었습니다.
모델 이름은 27B인데 허깅페이스에 올라온 파라미터 수는 260억 8,533만 개입니다. 고지 파일은 글을 만드는 출력부를 떼고 선택지를 읽는 판독부를 달았다고 적었고, 설정 파일의 어휘 수(24만 8,320개)와 은닉 차원(5,120)을 곱한 원래 출력부 크기는 약 12억 7,000만 개입니다. 바탕 모델의 몸통과 시각 처리부, 판독부는 지도 미세조정(SFT)으로 함께 고쳤습니다.
직접 돌리려면 파이썬 3.12 이상과, 가중치 약 49GiB에 작업 메모리를 더 올릴 수 있는 CUDA GPU가 필요합니다. 메모리 48GB짜리 GPU 한 장에는 가중치조차 다 들어가지 않고, 80GB급 GPU라야 작업 메모리까지 함께 올라갑니다. 학습과 서빙 코드(source 폴더)는 MIT 라이선스로 따로 공개돼 자기 데이터로 다시 학습할 수도 있습니다. 퍼플렉시티는 8월 19일에도 같은 Qwen3.8-27B를 4비트(NVFP4)로 줄여 Perplexity Computer의 DGX Spark 장비에서 돌리던 체크포인트를 허깅페이스에 올린 적이 있습니다.
API와 직접 실행은 계산이 다릅니다. API는 입력 100만 토큰당 0.04달러에 조직당 초당 10건 한도가 걸리고, 직접 돌리면 한도 대신 GPU를 빌리거나 사는 값이 듭니다. 문서를 사내망 밖으로 보낼 수 없는 금융·공공 고객에게는 가중치 쪽이 후보가 되고, 앞선 글에서 다룬 국내 다키클라우드도 한국어 결정 모델을 만든 이유로 망 분리를 들었습니다.
퍼플렉시티는 한국어 점수를 따로 내지 않았습니다. 여러 언어 독해 시험 Belebele 500문항에서 94.00%로 Jev(95.00%)보다 1%포인트 낮았고, 어떤 언어가 몇 문항 들어갔는지는 밝히지 않았습니다. 한국어로 잰 숫자는 앞선 글에서 다룬 다키클라우드의 측정이 있는데, Jev는 처음 보는 한국 정책 문서 119문항 가운데 93.3%를 맞혔습니다.
Decisions API는 따로 신청하지 않아도 모든 퍼플렉시티 API 키로 부를 수 있습니다. 오픈AI는 아직 Decisions API의 값을 정하지 않았고, 그 값이 나오면 다섯 선택지의 단가를 다시 맞춰 보겠습니다.
읽어 주셔서 고맙습니다.
초이 드림