딥리서치
Deep Research · 심층 조사
검색을 수십 번 반복해 출처가 붙은 보고서를 만드는 에이전트 기능입니다. 조사 절차를 하네스로 짜던 방식에서 그 절차 자체를 모델에 학습시키는 방식으로 옮겨 갔습니다. 퍼플렉시티 WANDR 평가에서는 대상을 빠짐없이 찾는 과제를 통과한 곳이 일곱 곳 가운데 한 곳이었습니다.
‘딥리서치’ 이 나오는 글2
논문AI
덜어 낼 줄 아는 에이전트, 텐센트가 32K 창으로 128K 창을 앞섰습니다
텐센트 Youtu Lab이 8월 28일 공개한 ContextPilot은 EMNLP 2026 본회의에 채택됐습니다. 평균 55만 토큰짜리 문서 더미에서 답을 찾는 BrowseComp+에서 원래 Qwen3-14B는 6.27점, ContextPilot은 55.50점이었습니다.

17분
논문AI
직접 만든 리서치 시험에서 1위, 퍼플렉시티도 7개 중 1개만 완벽했습니다
퍼플렉시티가 7월 14일 리서치 에이전트 벤치마크 WANDR를 공개했습니다. 상용 시스템 6개 가운데 1위인 자사 Search as Code도 hard F1 0.133으로, 대상 7개 중 1개 정도만 근거까지 완전한 점수를 받았습니다.
함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 컨텍스트 윈도우모델이 한 번에 읽고 기억할 수 있는 토큰 수입니다. 이걸 넘으면 앞부분을 잊거나 잘라야 해서, 긴 문서·긴 작업의 병목이 됩니다.
- 파라미터모델 안의 숫자(가중치) 개수입니다. '7B'는 70억 개를 가리키고, 대체로 클수록 똑똑하지만 비쌉니다.
- 강화학습답을 내게 하고 점수(보상)를 매겨, 점수가 높은 쪽으로 모델을 조금씩 옮기는 학습입니다. RLHF 는 사람 선호를, GRPO 는 여러 답을 서로 비교한 상대 점수를 보상으로 씁니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.

