KV 캐시
KV cache
이미 읽은 토큰의 계산 결과를 저장해 두는 메모리입니다. 긴 대화에서 속도를 지켜주지만, 길어질수록 메모리를 많이 먹습니다.
‘KV 캐시’ 이 나오는 글4
논문원 논문 공개 AI
100만 토큰을 0.9GB에, 딥시크 V4.1 논문이 KV 캐시를 줄인 방법
딥시크 V4.1-Flash 보고서가 9월 17일 arXiv에 올라왔습니다. 전역 KV 캐시는 토큰당 890바이트로 V4-Flash의 4분의 1, SSD에 두는 캐시는 8분의 1이고, 문맥을 4K에서 1M으로 늘려도 토큰 하나 생성 계산은 4분의 1만 늘었습니다.

14분
소식AI
딥시크 "V4.1-Flash가 V4-Pro 앞서"… MIT 공개하고 요금 인하
딥시크가 9월 10일 552B MoE 모델 V4.1-Flash를 MIT 라이선스로 공개했습니다. 토큰당 KV 캐시는 V4-Flash의 약 4분의 1이고, 오프피크 요금은 캐시 적중 입력 0.003달러, 출력 0.6달러로 8월보다 내렸습니다.

15분
아티클AI
GPT-5.6이 자기 GPU 코드를 고쳐 오픈AI 서빙 비용이 20% 줄었습니다
GPT-5.6 Sol이 다시 쓴 커널로 종단 서빙 비용이 20% 줄고, 스스로 개선한 초안 모델로 토큰 생성 효율이 15% 넘게 올랐습니다. 하네스는 도구 출력을 기본 1만 토큰에서 자르고 기록을 뒤에만 덧붙여, 일반 입력의 10분의 1 가격인 캐시를 지킵니다.

11분
소식AI
GPU 파는 엔비디아가 ‘에이전트 병목은 CPU’라며 Vera를 앞세웠습니다
에이전트는 모델 추론 사이사이에 도구 호출과 코드 실행을 CPU에서 차례로 처리합니다. 조지아공대와 인텔 연구진은 이 구간이 전체 지연의 최대 90.6%를 차지한다고 쟀고, 엔비디아는 7월 7일 코어 수 대신 코어 하나의 속도를 높인 Vera를 앞세웠습니다.

8분
함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 캐시 적중요청에 쓸 수 있는 데이터나 계산 결과를 캐시에서 찾아 재사용한 경우입니다. 언어 모델의 프롬프트 캐시에서는 반복되는 입력 앞부분의 계산을 재사용하며, 이전 최종 답변을 그대로 돌려준다는 뜻은 아닙니다. 시간과 비용의 절감 폭은 캐시 종류, 재사용 범위와 서비스의 과금 조건에 따라 다릅니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
