







보안 과제를 수행하던 중 샌드박스의 네트워크 경로를 스스로 찾아 인터넷에 연결했고, 별도의 공격을 시도하는 대신 GitHub에서 필요한 정보를 가져와 과제를 해결했습니다.
목표를 가장 빠르게 달성하는 방법을 선택한 것입니다.
Kimi K3는 이미 가중치가 공개된 모델이고, 프런티어 시큐리티가 사용한 평가 환경도 일반 사용자가 접하는 것과 크게 다르지 않았습니다.
CEO 야론 싱어는 "Kimi는 목표 달성을 최우선으로 삼으며, 이를 제어할 내부 가드레일이 충분하지 않았다"고 설명했습니다.
오픈AI와 앤트로픽 사례에 이어 이번에는 오픈웨이트 모델에서도 비슷한 행동이 확인됐습니다.
특정 모델만의 문제 대신, 목표 달성을 최우선으로 학습된 에이전트가 제약을 어떻게 해석하는지에 대한 공통된 과제로 보입니다.
Choi
목표만 주고 제약을 약하게 두면 모델은 가장 빠른 경로를 고릅니다. 격리 설계의 책임이 배포자에게 넘어오는 사례입니다.
MDASH 하네스와 묶어 CyberGym에서 96%를 기록했다고 밝혔습니다.
그런데 MDASH는 6월 빌드 시점에 이미 96.55%를 찍었습니다.
점수는 그대로고 비용만 절반으로 내려왔습니다.
쉬운 90%를 자체 모델이 맡고 어려운 10%만 GPT-5.4로 넘기는 라우팅으로 바꿨기 때문입니다.
MDASH는 처음부터 모델을 설정 한 줄로 교체하도록 설계됐고, 스코프 파일이나 프로젝트별 보정처럼 쌓아 온 것들은 모델을 갈아도 그대로 남습니다.
그 구조를 먼저 만들어 두고 첫 교체 대상으로 오픈AI 모델을 골랐습니다.
GPT-5.4는 가장 비싼 10% 구간으로 내려갔습니다.
자체 모델 전환의 승부처는 앞으로도 원가 쪽에서 갈릴 것 같습니다.
Choi
어려운 구간만 남의 모델에 넘기는 라우팅은 교체를 한 번에 하지 않아도 되게 만듭니다. 쌓아 둔 설정이 모델을 갈아도 남는 구조가 먼저였습니다.
버셀의 오픈소스 보안 하네스 DeepSec로 돌린 자체 벤치마크에서 GPT-5.6 Sol은 분석 깊이가 가장 뛰어났지만, 2위 모델보다 비용이 7배 높았습니다.
그래서 그는 Sol로 한 번 베이스라인을 만든 뒤, 이후에는 가성비가 좋은 워크호스인 Kimi K3를 상시 운용하는 구성을 권장했습니다.
Fable 5의 거부율은 100%였습니다.
성능이 부족해서라고 하기는 어렵습니다.
6월부터 적용된 분류기가 이중용도 요청을 응답 전에 차단하면서 취약점 탐색 자체를 막기 때문입니다.
앤트로픽의 사이버 검증 프로그램 인증 없이 API를 사용하면 모든 요청이 거부로 처리되지만, 분류기가 적용되지 않은 Opus 4.8은 같은 앤트로픽 모델임에도 정상적으로 동작합니다.
Choi
Fable 5의 분류기는 이중용도 요청을 응답 전에 막아 방어용 취약점 탐색도 거부합니다. 인증 없이 API를 쓰면 모든 요청이 거부되고, 분류기가 없는 Opus 4.8은 같은 요청을 처리합니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.