캐시 적중
cache hit · 캐시 히트 · 캐시 적중 입력
요청에 쓸 수 있는 데이터나 계산 결과를 캐시에서 찾아 재사용한 경우입니다. 언어 모델의 프롬프트 캐시에서는 반복되는 입력 앞부분의 계산을 재사용하며, 이전 최종 답변을 그대로 돌려준다는 뜻은 아닙니다. 시간과 비용의 절감 폭은 캐시 종류, 재사용 범위와 서비스의 과금 조건에 따라 다릅니다.
‘캐시 적중’ 이 나오는 글3
논문원 논문 공개 AI
100만 토큰을 0.9GB에, 딥시크 V4.1 논문이 KV 캐시를 줄인 방법
딥시크 V4.1-Flash 보고서가 9월 17일 arXiv에 올라왔습니다. 전역 KV 캐시는 토큰당 890바이트로 V4-Flash의 4분의 1, SSD에 두는 캐시는 8분의 1이고, 문맥을 4K에서 1M으로 늘려도 토큰 하나 생성 계산은 4분의 1만 늘었습니다.

14분
소식AI
딥시크 "V4.1-Flash가 V4-Pro 앞서"… MIT 공개하고 요금 인하
딥시크가 9월 10일 552B MoE 모델 V4.1-Flash를 MIT 라이선스로 공개했습니다. 토큰당 KV 캐시는 V4-Flash의 약 4분의 1이고, 오프피크 요금은 캐시 적중 입력 0.003달러, 출력 0.6달러로 8월보다 내렸습니다.

15분
아티클AI
같은 값의 Opus 5가 36% 더 쓴 이유, 앤트로픽의 비용 줄이는 법
앤트로픽이 9월 8일 Claude 비용을 성능 손해 없이 줄이는 방법을 공개했습니다. 단가가 같은 Opus 4.8과 Opus 5 사이에서도 옛 프롬프트를 그대로 쓰자 티켓당 비용이 36% 올랐고, 29CM는 같은 캐시 원칙으로 LLM 비용을 64% 줄였습니다.

16분
함께 나오는 용어5
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- KV 캐시이미 읽은 토큰의 계산 결과를 저장해 두는 메모리입니다. 긴 대화에서 속도를 지켜주지만, 길어질수록 메모리를 많이 먹습니다.
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
