지연
latency · 레이턴시 · 응답 지연
어떤 시작점부터 정한 결과가 나타날 때까지의 지연 시간입니다. 네트워크의 편도·왕복 시간, 모델의 첫 토큰 시간, 답변 전체 완료 시간은 서로 다릅니다. 비교할 때는 시작과 끝의 기준, 캐시와 부하 조건을 맞추고 평균뿐 아니라 오래 걸린 요청의 분포도 확인해야 합니다.
‘지연’ 이 나오는 글9
추론하고도 0.32초, 인셉션이 전화 상담용 Mercury Voice를 내놨습니다
인셉션이 9월 29일(미국 시각) 음성 에이전트용 Mercury Voice를 정식 출시했습니다. 추론을 마치고 첫 답변 토큰까지 중앙값 320밀리초(회사 측정)이고, 값은 100만 토큰당 입력 0.40·출력 1.50달러에 출시 할인 50%입니다.

메타 1Pbps 해저케이블 Petal, 용량은 2배로 늘고 35ms는 그대로
메타가 9월 21일 미국과 프랑스를 잇는 1Pbps 해저케이블 Petal을 발표했습니다. 2029년 가동 목표로 용량은 지금 최고 수준의 2배지만, 광섬유 1km당 5마이크로초인 전파 지연은 그대로여서 대서양 편도는 약 35ms입니다.

엔비디아 GPU로 초당 1,107토큰, 에르몬 "더 병렬적인 해법이 이긴다"
확산 모델 연구자 스테파노 에르몬이 9월 18일 No Priors에서 한 번에 여러 토큰을 만드는 확산 언어 모델이 추론에서 유리하다고 말했습니다. 그가 이끄는 Inception의 Mercury 2.5는 엔비디아 GPU에서 초당 1,107토큰을 낸다고 회사가 밝혔습니다.

고칠수록 무너지던 AI 그림, 오픈AI Images 2.5가 Arena 1·2위
매주 30억 장 넘는 ChatGPT 이미지 생성에 9월 8일 새 기본 모델 Images 2.5가 들어왔습니다. Arena에서 GPT-Image-2보다 텍스트→이미지는 40점, 다중 이미지 편집은 81점 올랐고, 세 부문 1~3위가 모두 오픈AI 모델입니다.

"헌법 문구는 그대로인데 견제가 멈춘다", AI 연구자들의 제도 잡지
AI 시대의 제도를 제안하고 반박하는 글만 싣겠다는 Pax Machina가 8월 4일 창간사를 냈습니다. 충성스러운 AI 대리인 수천 명을 거느린 대통령을 가정하고, 사람의 한계가 떠받치던 견제 장치가 어디서 멈추는지 묻습니다.

GPU보다 대기열이 먼저 찼다, 오픈AI GPT-Live 6개월 제작기
오픈AI가 8월 3일 GPT-Live 실시간 시스템을 6개월 동안 만든 과정을 공개했습니다. 미디어 경로와 추론 로직을 Python에서 Go로 다시 써 새 시스템의 p95 지연이 옛 시스템 p50 수준으로 내려왔고, 연결 준비 왕복은 6번에서 1번으로 줄었습니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 음성 모델말을 알아듣는 인식과 소리를 만드는 합성을 맡는 모델입니다. 받아쓰기가 운영체제 기본 기능으로 들어갔고, 20명이 동시에 말해도 화자를 가려내는 서비스가 시간당 0.18달러 선에서 나왔습니다.
- 툴 호출모델이 검색·계산기·API 같은 외부 도구를 불러 쓰는 기능입니다. 에이전트가 실제 일을 하려면 꼭 필요합니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
