토큰 지출
토큰 사용량 · 토큰 소비량 · 토큰 단가
기업이 모델 API에 쓰는 돈과 그 바탕이 되는 토큰 사용량입니다. a16z 집계에서 기업 사이의 토큰 지출 격차는 600배까지 벌어졌습니다. 사용량 자체는 불이 켜져 있다는 표시일 뿐이어서, 사업 성과와 잇는 작업은 따로 남습니다.
‘토큰 지출’ 이 나오는 글6
Opus 5.5 "작업비 40% 절감", 최고 설정에선 Opus 5와 비슷했습니다
앤트로픽이 9월 22일 Opus 5.5를 내며 기본 설정 작업비가 40% 준다고 밝혔습니다. AA 측정에서 medium은 39% 줄었고 max는 2% 늘었으며, 같은 날 나온 GPT-6 Sol·Luna는 과제당 비용이 47%·62% 줄었습니다.

같은 값의 Opus 5가 36% 더 쓴 이유, 앤트로픽의 비용 줄이는 법
앤트로픽이 9월 8일 Claude 비용을 성능 손해 없이 줄이는 방법을 공개했습니다. 단가가 같은 Opus 4.8과 Opus 5 사이에서도 옛 프롬프트를 그대로 쓰자 티켓당 비용이 36% 올랐고, 29CM는 같은 캐시 원칙으로 LLM 비용을 64% 줄였습니다.

분기 매출 26억 달러에 설비 64억 달러, 코어위브만 주가가 17% 빠졌습니다
코어위브는 2분기 매출 25억 7,500만 달러를 내며 설비에 64억 2,200만 달러를 썼습니다. a16z의 8월 14일 차트에는 네오클라우드의 성장과 비용, 아틀라시안의 반등, 600배로 벌어진 기업 간 AI 지출, 앤트로픽의 보상이 함께 담겼습니다.

Pro는 감감무소식, 구글이 3주 만에 반값 제미나이 3.7 Flash 공개
구글이 8월 13일 제미나이 3.7 Flash를 공개했습니다. 3.6 Flash 이후 3주 만이고 모델 카드는 구조와 학습 데이터가 3.6 Flash와 같다고 적었습니다. 입력 0.75달러·출력 3.75달러는 연말까지의 도입 가격이고 내년부터 두 배가 됩니다.

"토큰은 입력, 결과는 실험" 평가를 새 PRD라 부르는 앤트로픽 첫 기술 PM
앤트로픽 첫 기술 PM 다이앤 펜이 7월 26일 Lenny's Podcast에서 팀 안에서는 평가가 새 PRD로 통한다고 밝혔습니다. 토큰 맥싱 유행에는 토큰은 입력이고 목표로 삼을 결과는 실험이라고 답했고, 올해 2분기에만 2024년 1년보다 많은 모델을 냈다고 했습니다.

소프트웨어 몸값은 2014년으로, 사용자당 AI 토큰은 11개월 새 3배로
소프트웨어 주식의 현금흐름 배수가 2014년 수준까지 내려왔고, 상위와 하위 종목의 수익률 격차는 약 50%포인트로 벌어졌습니다. 오픈라우터 사용자당 토큰 사용량은 11개월 새 225% 늘었습니다.

함께 나오는 용어5
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 프롬프트 캐싱반복되는 프롬프트 앞부분의 계산을 저장해 이후 요청에서 재사용하는 기능입니다. 시스템 지침이나 도구 설명처럼 바뀌지 않는 입력이 대상이 될 수 있습니다. 최종 답변 자체의 재사용과는 다르며, 일치 조건·유효 시간·쓰기와 읽기 요금은 제공자와 모델에 따라 확인해야 합니다.
- 캐시 적중요청에 쓸 수 있는 데이터나 계산 결과를 캐시에서 찾아 재사용한 경우입니다. 언어 모델의 프롬프트 캐시에서는 반복되는 입력 앞부분의 계산을 재사용하며, 이전 최종 답변을 그대로 돌려준다는 뜻은 아닙니다. 시간과 비용의 절감 폭은 캐시 종류, 재사용 범위와 서비스의 과금 조건에 따라 다릅니다.
- 추론 강도모델이 과제에 얼마나 많은 계산과 검증을 쓰도록 할지 조절하는 설정입니다. 높은 값은 토큰 사용량과 실행 시간을 늘릴 수 있지만 정답을 보장하지 않습니다. 지원 단계와 적용 범위는 모델·제품별로 다릅니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
