프롬프트 캐싱
prompt caching · 캐시 적중률 · 캐시된 입력
반복되는 프롬프트 앞부분의 계산을 저장해 이후 요청에서 재사용하는 기능입니다. 시스템 지침이나 도구 설명처럼 바뀌지 않는 입력이 대상이 될 수 있습니다. 최종 답변 자체의 재사용과는 다르며, 일치 조건·유효 시간·쓰기와 읽기 요금은 제공자와 모델에 따라 확인해야 합니다.
‘프롬프트 캐싱’ 이 나오는 글2
소식AI
손 안 대고 일 시키는 ChatGPT 음성, 승인만은 화면에서 누릅니다
오픈AI가 9월 23일 ChatGPT 음성에 플러그인을 붙이고 웹·모바일 Work에서도 음성을 열었습니다. 승인이 필요한 행동은 말로 못 하고 화면에서 누릅니다. 하루 앞선 캐싱 개선은 30분 안에 다시 보낸 같은 입력을 최대 90% 할인합니다.

14분
함께 나오는 용어5
- 캐시 적중요청에 쓸 수 있는 데이터나 계산 결과를 캐시에서 찾아 재사용한 경우입니다. 언어 모델의 프롬프트 캐시에서는 반복되는 입력 앞부분의 계산을 재사용하며, 이전 최종 답변을 그대로 돌려준다는 뜻은 아닙니다. 시간과 비용의 절감 폭은 캐시 종류, 재사용 범위와 서비스의 과금 조건에 따라 다릅니다.
- 추론 강도모델이 과제에 얼마나 많은 계산과 검증을 쓰도록 할지 조절하는 설정입니다. 높은 값은 토큰 사용량과 실행 시간을 늘릴 수 있지만 정답을 보장하지 않습니다. 지원 단계와 적용 범위는 모델·제품별로 다릅니다.
- 토큰 지출기업이 모델 API에 쓰는 돈과 그 바탕이 되는 토큰 사용량입니다. a16z 집계에서 기업 사이의 토큰 지출 격차는 600배까지 벌어졌습니다. 사용량 자체는 불이 켜져 있다는 표시일 뿐이어서, 사업 성과와 잇는 작업은 따로 남습니다.
- LLM수천억 개 단어를 학습해 다음 토큰을 예측하는 모델입니다. 질문에 답하고 글을 쓰고 코드를 짜는 일이 모두 '다음에 올 말 맞히기'에서 나옵니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.

