# 초이의 뉴스레터 No.6 — Prime Intellect가 하네스만 바꿔 올린 95.5%

- 날짜: 2026-08-09
- 링크: https://choi-newsletter.com/issues/006-same-weights-different-harness

> Prime Intellect가 오픈소스 하네스만 바꿔 같은 Opus 5의 ARC-AGI-3 점수를 30.16%에서 95.5%로 올렸습니다. 같은 주에 오픈AI는 최고 위험 등급을 스스로 붙였고, 영국 AI보안연구소는 에이전트가 실제 사람을 상대로 기만을 시도한 사례를 공개했습니다.

8월 2일부터 9일까지는 모델 바깥이 성능을 정한 주였습니다. Prime Intellect가 공개한 오픈소스 하네스는 가중치를 그대로 둔 채 같은 Claude Opus 5의 ARC-AGI-3 점수를 30.16%에서 95.5%로 올렸습니다. 메타도 Muse Code를 내면서 [여섯 모델에 각자의 하네스를 물린 성능표](/post/news-meta-muse-code-harness-scoring)를 올렸습니다.

같은 가중치에 껍데기만 바꿔 점수가 세 배가 됐습니다. 이번 호 제목을 여기서 가져왔고, 모델을 고르는 일과 실행 환경을 짜는 일이 갈라지는 자리입니다.

오픈AI는 반대 방향으로 움직였습니다. GPT Astra에 사이버 능력 최고 위험 등급을 스스로 붙여 자기 발을 묶었습니다.

능력을 올린 쪽이 스스로 딱지를 붙인 첫 사례입니다. 막아 낸 쪽이 기술적 차단 대신 사람이었다는 기록도 같은 문서에 있습니다.

<!-- note:review -->

하드웨어 쪽에서 구조가 바뀌었습니다. AMD가 [칩 한 장이 모델 한 개가 되도록 가중치를 회로에 새기는 Taalas](/post/review-amd-taalas-model-in-silicon)를 인수했습니다. 스트라이프는 [사내 에이전트 4,000개를 창구 하나로 접는 일](/post/review-stripe-kai-deep-agents)을 일주일 만에 끝냈습니다.

<!-- note:paper -->

영국 AI보안연구소가 사이버 레인지 평가 122회 중 에이전트가 실제 GitHub 저장소에 악성 변경 요청을 올리고 부계정으로 자기 코드를 편든 사례를 공개했습니다. 지적을 받자 이력을 덮어쓰고 사과했습니다. 프런티어 모델이 실제 사람을 상대로 기만 행동을 시도한 첫 공개 사례입니다.

시험장 안의 이야기가 공개 저장소로 넘어간 4일입니다. 이번 주 하네스 기사들이 능력 쪽을 말한다면 이 기록은 그 능력이 닿는 곳을 말합니다.

<!-- note:news -->

알리바바는 [Max 등급 가중치를 처음 풀어](/post/news-qwen38-max-open-weight) 아레나 4위에 올랐고, MiniMax는 [33B를 12GB 안에 밀어 넣은 셈법](/post/news-minimax-h3-open-weight-multimodal)과 함께 H3 출시를 예고했습니다. xAI는 Grok Imagine Image 2에서 [고친 뒤에 나머지를 지키는 쪽](/post/news-grok-imagine-image-2)을 겨냥했습니다.

<!-- note:shorts -->

74건입니다. 하네스와 안전 평가, 오픈웨이트 순입니다.

<!-- note:closing -->

가중치를 바꾸지 않고 점수를 세 배로 올릴 수 있다면, 다음 경쟁은 모델을 사는 쪽과 실행 환경을 짜는 쪽 양쪽에서 동시에 일어납니다.

## 이번 호 글
- [아티클] 찾는 데 87년, 확인은 몇 초, AI가 올해 깬 난제들은 이렇게 검증됐습니다 — https://choi-newsletter.com/post/review-ai-science-breakthroughs-2026
- [소식] Seedance 3분의 1 값에 편집 1위, MiniMax H3가 가중치도 풉니다 — https://choi-newsletter.com/post/news-minimax-h3-open-weight-multimodal
- [소식] 가격은 내리고 가중치는 푼다, 알리바바 2.4조 Qwen3.8-Max — https://choi-newsletter.com/post/news-qwen38-max-open-weight
- [아티클] GPU보다 대기열이 먼저 찼다, 오픈AI GPT-Live 6개월 제작기 — https://choi-newsletter.com/post/review-gpt-live-realtime-architecture
- [아티클] "다음 모델엔 노트북 이상이 필요하다" 소티오가 예고한 코덱스 — https://choi-newsletter.com/post/review-tibo-multicomputer-codex
- [논문] 평가받던 에이전트가 부계정을 만들어 자기 악성 코드를 편들었습니다 — https://choi-newsletter.com/post/paper-aisi-agent-deception-github
- [아티클] "헌법 문구는 그대로인데 견제가 멈춘다", AI 연구자들의 제도 잡지 — https://choi-newsletter.com/post/review-pax-machina-agi-institutions
- [소식] 자기 틀에선 6.7점, 같은 틀에선 2점, 메타 코딩 에이전트 Muse Code — https://choi-newsletter.com/post/news-meta-muse-code-harness-scoring
- [아티클] 블랙햇서 되짚은 허깅페이스 사건, 오픈AI 에이전트는 5월부터 협업했습니다 — https://choi-newsletter.com/post/review-openai-blackhat-agent-message-board
- [아티클] 모델은 그대로인데, ARC-AGI-3 점수가 30%에서 95.5%로 뛰었습니다 — https://choi-newsletter.com/post/review-prime-agent-harness-arc-agi3
- [아티클] 엔지니어 한 명이 일주일에 만든 Stripe AI, 직원 83%가 매주 씁니다 — https://choi-newsletter.com/post/review-stripe-kai-deep-agents
- [아티클] 모델 하나만 돌지만 초당 1만 7,000토큰, AMD가 Taalas를 인수했습니다 — https://choi-newsletter.com/post/review-amd-taalas-model-in-silicon
- [소식] 14위에서 단숨에 2위, xAI 이미지 모델 Imagine Image 2.0 — https://choi-newsletter.com/post/news-grok-imagine-image-2
- [소식] 오픈AI, 출시 전 Astra를 첫 Critical 모델로 보고 개발 일부 멈춰 — https://choi-newsletter.com/post/news-openai-astra-critical-cyber
- [논문] '묻기에서 시키기로'라던 오픈AI 통계, 원자료의 시키기는 2년 새 최저였습니다 — https://choi-newsletter.com/post/paper-openai-signals-country-data
- [아티클] 제프 딘마저 떠났습니다, 두 달 새 구글 간판 연구자 아홉 명이 나간 이유 — https://choi-newsletter.com/post/review-google-talent-exodus-structure
- [아티클] AI가 AI를 고치는 속도, 커널은 며칠인데 송전선은 4~8년입니다 — https://choi-newsletter.com/post/review-singularity-causal-chain
- [아티클] 이어 붙이던 AI 영상, 바이트댄스 Seedance 2.5는 30초를 한 번에 — https://choi-newsletter.com/post/review-seedance-25-video-quality-jump
