
소식
소식AI







도구 실행이 끝나기를 기다리지 않고 백그라운드에서 비동기로 처리하는 동안 모델은 다른 작업을 이어 갑니다.
Terminal-Bench 4.0에서 GPT-6 Astra를 붙였을 때 Codex와 같은 57.9% 성공률을 냈고, 비용은 2,350달러에서 1,428달러로 약 39% 줄었습니다.
하네스는 오픈소스로 공개됐습니다.
Choi
모델은 그대로 두고 하네스(모델에 도구와 실행 순서를 붙이는 틀)만 바꿔 같은 점수에서 비용을 922달러 줄였습니다.
오픈AI의 코덱스(Codex) 총괄 티보 소티오(Thibault Sottiaux)는 AI 코딩 에이전트를 통제하던 복잡한 프레임워크와 스캐폴딩(scaffolding)의 시대가 끝나가고 있다고 밝혔습니다.
과거에는 모델의 한계로 인해 목표를 고정하고 이탈을 막는 ‘/goal’ 같은 보조 장치가 필수적이었지만, 차세대 모델의 성능이 도약하면서 이러한 하네스(harness)가 불필요해졌다는 설명입니다.
그는 “차세대 모델에서는 더 이상 하네스가 필요 없다”며, 모델에게 단지 “가서 일주일 동안 작업해”라고 말하는 것만으로도 장기적이고 복잡한 과제를 스스로 완수할 수 있는 수준에 도달했다고 강조했습니다.
Choi
‘/goal’처럼 모델의 이탈을 막던 보조 장치가 필요 없어지면, 하네스를 제품으로 팔던 회사들의 사업 기반이 좁아집니다.
텐센트 훈위안이 장편 영상 생성 하네스 HyCreator를 공개하고 얼리액세스 신청을 받기 시작했습니다.
이 시스템은 기획부터 샷 분할, 생성, 편집까지 전 과정을 에이전트가 끝까지 진행해줍니다.
결과가 마음에 안 들면 프롬프트를 처음부터 다시 돌리는 대신, 원하는 지점에 끼어들어 실시간으로 고칠 수 있습니다.
다만 품질 평은 갈립니다.
10분을 끊김 없이 끌고 가는 진행 관리는 인정받는데, 연출은 음악 깔린 몽타주 수준이라는 혹평도 나오고 있는 상황입니다.
Choi
HyCreator는 기획·샷 분할·생성·편집을 에이전트가 이어서 맡고 사용자가 원하는 지점에서 끼어들게 해, 10분 영상을 처음부터 다시 만들지 않고 부분만 고칠 수 있습니다.
npx deepseek-ai/dsh web으로 웹 UI를 띄우고 작업 폴더를 연결하면 됩니다.
Codex나 Claude Code와 비슷한 역할인데, 모델, 도구, 세션 기록, 에이전트 루프를 전부 플러그인으로 분리해 필요한 부분을 바꿔 끼울 수 있습니다.
아직 개발자 프리뷰지만, DeepSeek가 모델 API에 더해 AI가 일하는 작업공간까지 직접 만들기 시작했습니다.
Choi
모델 공급에서 멈추지 않고 작업 환경까지 내려오는 순서는 앞선 회사들이 이미 밟았습니다. 하네스를 쥔 쪽이 사용 습관을 가져갑니다.
그는 프런티어 모델(LLM)과 개인의 독보적 맥락(Context), 이를 잇는 시스템(Harness)의 결합을 지능 대중화의 동력으로 꼽았습니다.
스마트폰이나 컴퓨터가 그랬듯 개인화된 AI 에이전트가 사용자의 고유한 경험을 학습해 실행력을 수십 배 빠르고 정교하게 끌어올리는 "지능의 자전거"이자 "자율주행 로켓"이 된다는 설명입니다.
빌딩과 인력을 대거 늘리던 과거 방식과 달리, 단 몇 명의 팀이 개인 맞춤형 AI 인프라를 바탕으로 거대한 가치를 창출하는 고효율 경제 구조가 열리고 있다고 봤습니다.
"프런티어 모델 성능은 빌리는 것이지만, 당신의 뇌와 맥락은 당신이 소유하는 것입니다." 폴 그레이엄의 조언처럼 "사람들이 원하는 것을 만들고, 스케일되지 않는 일을 하라"는 원칙은 변하지 않으며, 다만 이를 실행하는 기술적 물리 법칙이 급격히 진화하고 있다는 진단입니다.
Choi
모델은 빌리고 맥락은 소유한다는 구분이 팀 규모의 의미를 바꿉니다. 하네스를 누가 만드느냐가 다음 경쟁 축입니다.
버셀의 오픈소스 보안 하네스 DeepSec로 돌린 자체 벤치마크에서 GPT-5.6 Sol은 분석 깊이가 가장 뛰어났지만, 2위 모델보다 비용이 7배 높았습니다.
그래서 그는 Sol로 한 번 베이스라인을 만든 뒤, 이후에는 가성비가 좋은 워크호스인 Kimi K3를 상시 운용하는 구성을 권장했습니다.
Fable 5의 거부율은 100%였습니다.
성능이 부족해서라고 하기는 어렵습니다.
6월부터 적용된 분류기가 이중용도 요청을 응답 전에 차단하면서 취약점 탐색 자체를 막기 때문입니다.
앤트로픽의 사이버 검증 프로그램 인증 없이 API를 사용하면 모든 요청이 거부로 처리되지만, 분류기가 적용되지 않은 Opus 4.8은 같은 앤트로픽 모델임에도 정상적으로 동작합니다.
Choi
Fable 5의 분류기는 이중용도 요청을 응답 전에 막아 방어용 취약점 탐색도 거부합니다. 인증 없이 API를 쓰면 모든 요청이 거부되고, 분류기가 없는 Opus 4.8은 같은 요청을 처리합니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.