# "CLI는 없애지 않는다" 오픈AI가 서울 코덱스 밋업 질의응답에서 내놓은 답
_사이드챗, 에이전트의 자유, 벤치마크, 일자리를 물은 20분 질의응답을 정리했습니다. 답마다 코덱스 변경 기록과 Terminal-Bench·METR 자료를 붙여 이미 제품에 들어온 것과 아직 확인할 수 없는 것을 나눴습니다._
- 매체: 초이의 뉴스레터 · 아티클
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-07-08
- 링크: https://choi-newsletter.com/post/review-codex-meetup-qa
- 답하는 질문: 오픈AI 코덱스 CLI 없어지나
- 직답: 오픈AI 발표자는 서울 밋업에서 CLI를 없애지 않고 새 실험 기능도 CLI에서 먼저 내놓는다고 답했습니다.
- 출처: OpenAI 개발자 문서, Codex 변경 기록 (https://developers.openai.com/codex/changelog), OpenAI 개발자 문서, Auto-review (https://developers.openai.com/codex/sandboxing/auto-review), OpenAI 개발자 문서, Remote connections (https://developers.openai.com/codex/remote-connections), OpenAI 개발자 문서, AGENTS.md 안내 (https://developers.openai.com/codex/guides/agents-md), OpenAI API 문서, Compaction (7월 10일 보관본) (https://web.archive.org/web/20260710111317/https://developers.openai.com/api/docs/guides/compaction), Terminal-Bench 2.1 리더보드 (7월 9일 보관본) (https://web.archive.org/web/20260709181004/https://www.tbench.ai/leaderboard/terminal-bench/2.1), METR, Task-Completion Time Horizons of Frontier AI Models (https://metr.org/time-horizons/), arXiv 2307.03172, Lost in the Middle (Liu 외, 2023) (https://arxiv.org/abs/2307.03172), OpenAI 팟캐스트 6화, Codex and the future of coding with AI (2025년 9월) (https://www.youtube.com/watch?v=OXOypK7_90c), 티보 소티오 X, 권한 프로필 (6월 30일) (https://x.com/thsottiaux/status/2071636285807059315), 티보 소티오 X, 로컬·원격 작업 넘기기 (6월 20일) (https://x.com/thsottiaux/status/2068120572673077274), GitHub, openai/codex (https://github.com/openai/codex)
> 7월 8일 서울 코덱스 밋업 질의응답에서 오픈AI 발표자는 CLI를 없애지 않고 실험 기능을 CLI에서 먼저 낸다고 답했습니다. Terminal-Bench 2.1에서 코덱스 CLI와 GPT-5.5는 83.4%, 같은 모델을 공용 하네스에 얹으면 78.2%였습니다.

7월 8일 저녁 서울 강남에서 열린 오픈AI 코덱스 밋업에 다녀왔습니다. 발표가 끝나고 20분 동안 이어진 질의응답에서 오픈소스 하네스 개발자, 프로덕션 팀 리드, 학생이 차례로 질문했고, 발표자는 CLI를 없애지 않고 새 실험 기능도 CLI에서 먼저 내놓는다고 답했습니다. 질문은 사이드챗에서 벤치마크, 일자리까지 넓게 흩어졌지만, 모델이 일을 대부분 맡게 된 지금 사람이 무엇을 쥐고 있느냐는 물음으로 모였습니다.

같은 밋업의 발표에서 나온 코덱스 사용법 다섯 가지를 먼저 정리한 글입니다.

현장에서 받아 적은 답에는 오픈AI 개발자 문서와 코덱스 변경 기록, 공개 리더보드를 하나씩 붙였습니다. 발표자가 말한 기능 가운데 상당수가 이미 5월과 6월 업데이트로 제품에 들어와 있었고, 숫자로 확인되는 답과 아직 확인할 방법이 없는 답도 갈렸습니다.

## 사이드챗은 터미널 탭을 하나 더 여는 것과 무엇이 다른가

첫 질문은 사이드챗이 터미널 탭 두 개를 띄워 쓰는 것과 무엇이 다르냐는 것이었습니다. 발표자는 사이드챗이 원래 스레드를 통째로 복제한 임시 스레드라고 답했습니다. 새 탭에서 연 대화는 빈 맥락에서 출발해 프로젝트 사정을 처음부터 다시 들어야 하지만, 사이드챗은 메인 대화에 쌓인 맥락을 물려받은 채 곁가지 질문을 처리합니다.

이 기능은 6월 들어 ChatGPT 모바일 앱의 코덱스 화면에도 들어왔습니다. 6월 15일 업데이트는 실행 중인 스레드와 사이드챗, 서브에이전트의 상태 표시를 손봤고, 6월 22일 업데이트는 사이드챗을 입력창 위에 별도 대화로 띄웠습니다. 폰에서도 곁가지를 물어본 뒤 본래 작업으로 돌아올 수 있습니다.

사이드챗과 함께 자주 거론되는 기능이 컴팩션(자동 압축)입니다. 대화가 컨텍스트 창(모델이 한 번에 읽을 수 있는 분량) 한도에 가까워지면 코덱스가 세션을 압축하고 새 창에서 작업을 이어 갑니다. 2025년 9월 15일 코덱스 CLI 변경 기록에는 한도에 가까워지면 세션을 자동으로 요약한다고 적혀 있습니다.

오픈AI API 문서는 압축 결과를 앞선 상태와 추론을 더 적은 토큰으로 다음 실행에 넘기는 암호화 항목이라고 설명합니다. 같은 문서는 이 항목을 사람이 해석할 수 없는 불투명(opaque) 항목이라고 밝힙니다. 사이드챗은 사람이 곁가지를 따로 떼어 내는 도구이고, 컴팩션은 무엇을 남길지 모델이 정한 뒤 그 결과를 사람이 읽을 수 없는 형태로 넘기는 도구입니다.

## 에이전트에게 자유를 어디까지 주는가

두 번째 질문은 에이전트에게 스스로 풀 자유를 줄지, 정해 둔 단계만 따르게 할지 기준이 무엇이냐는 것이었습니다. 질문자는 규칙을 너무 많이 넣었더니 오히려 해답을 놓치더라는 경험담도 덧붙였습니다. 발표자는 이 문제를 제약 최적화 문제라고 부르고, 사용자가 편하게 느끼는 범위를 조금씩 넓혀 가는 것이 답이라고 했습니다.

**발표자가 현장에서 쓰는 세 가지 방법**

1. **오토 리뷰** 서브에이전트가 맥락을 보고 명령을 검토합니다. 모든 단계를 지정하는 방식과 전부 맡기는 방식의 중간입니다.

1. **원격 인스턴스** 에이전트를 원격 머신에서 돌려 손이 닿는 범위를 물리적으로 좁힙니다.

1. **플러그인 가드레일** 회사 도메인 밖으로 메일이 나가지 못하게 막는 식으로 규칙을 코드에 겁니다.

세 방법은 모두 코덱스 문서에 올라 있는 기능입니다. 오토 리뷰는 5월 11일 전용 문서가 생겼는데, 에이전트가 샌드박스 경계를 넘으려 할 때 사람에게 묻는 대신 별도의 검토 에이전트에게 판단을 맡기는 방식입니다. 권한이 더 필요한 셸 명령, 막힌 네트워크 요청, 쓰기 허용 폴더 밖의 파일 수정, 승인이 필요한 MCP 도구 호출이 검토 대상이고, 검토 에이전트는 자격 증명을 외부로 보내거나 되돌리기 어려운 파괴적 작업을 하려는 시도를 막도록 짜여 있습니다.

문서는 오토 리뷰를 검토자를 바꾸는 장치라고 부르고, 쓰기 허용 범위나 네트워크 권한은 그대로 둔다고 적었습니다. 거절당한 에이전트는 확실히 더 안전한 다른 방법을 찾거나, 멈추고 사람에게 묻도록 돼 있습니다. 원격 인스턴스 쪽은 6월 25일 정식 출시된 Codex Remote가 맡습니다. ChatGPT 모바일 앱에서 연결된 맥이나 윈도우 호스트의 작업을 시작하고 이어 가는 기능이고, 같은 날 나온 DigitalOcean 플러그인은 코덱스가 직접 클라우드 서버(Droplet)를 만들어 원격 작업공간으로 붙이게 합니다.

규칙을 코드에 거는 장치는 5월 14일 정식 기능이 된 훅(hooks)입니다. 도구를 부르기 직전에 도는 PreToolUse 훅이 호출 내용을 검사해 막을 수 있습니다. 6월 30일에는 기존의 거친 샌드박스 모드를 대신할 권한 프로필도 나왔습니다. 오픈AI에서 코덱스와 ChatGPT 제품을 이끄는 티보 소티오(Thibault Sottiaux)는 파일 읽기·쓰기·금지 규칙을 운영체제 수준에서 강제하고, 여기에 도메인별 네트워크 규칙을 묶어 작업마다 최소 권한만 준다고 설명했습니다.

이 방향은 1년 전에도 예고돼 있었습니다. 소티오는 2025년 9월 오픈AI 팟캐스트에서 코덱스 CLI가 기본으로 샌드박스 안에서 돈다고 설명하면서, 사람이 언제 방향을 잡아 주고 어떤 행동을 승인할지 파악하는 데 계속 투자하겠다고 말했습니다. 오토 리뷰와 권한 프로필은 그 승인 가운데 일부를 규칙과 별도 에이전트에게 넘긴 결과입니다.

> 에이전트가 유용한 일을 하되 안전하게 하고, 운영자인 사람이 늘 통제권을 쥐게 하는 것이 무척 중요합니다.
> — 티보 소티오, 당시 오픈AI 코덱스 엔지니어링 리드 (2025년 9월 오픈AI 팟캐스트)

## 규칙을 길게 적으면 왜 덜 지켜지나

규칙을 많이 넣을수록 해답을 놓친다는 경험담에는 근거가 두 가지 있습니다. 하나는 코덱스의 규칙 파일 설정에서 나옵니다. 코덱스는 프로젝트 폴더의 AGENTS.md 파일을 규칙으로 읽는데, 여러 파일을 합친 크기가 기본값 32KiB에 이르면 그 뒤 파일은 더 읽지 않습니다. 문서는 이 한도에 걸리면 한도를 올리거나 지시를 하위 폴더로 나누라고 안내합니다.

한국어로 규칙을 쓰는 팀은 이 한도에 더 빨리 닿습니다. 한도는 글자 수가 아닌 바이트로 세고, UTF-8에서 영문자는 1바이트, 한글 한 글자는 3바이트를 차지합니다. 영어로 3만 2,000자 넘게 쓸 수 있는 분량이 한글만으로는 1만 자 남짓입니다.

다른 하나는 모델이 긴 입력을 읽는 방식입니다. 스탠퍼드 대학교의 넬슨 리우(Nelson F. Liu) 등이 2023년 발표한 「Lost in the Middle」은 검색 문서 20개(약 4,000토큰) 가운데 정답이 든 문서의 위치를 바꿔 가며 GPT-3.5-Turbo의 정답률을 쟀습니다. 정답 문서가 맨 앞에 있을 때 75.8%, 맨 뒤에 있을 때 63.2%였는데, 열 번째에 두자 53.8%로 떨어졌습니다. 문서를 하나도 주지 않고 답하게 했을 때의 56.1%보다도 낮았습니다.

![검색 문서 20개(약 4,000토큰) 가운데 정답 문서를 1번째부터 20번째까지 옮기며 잰 GPT-3.5-Turbo의 정답률 선 그래프. 1번째에서 76% 가까이로 가장 높고 10번째 부근에서 54% 남짓으로 가장 낮으며, 문서 없이 답한 경우의 정답률이 점선으로 표시돼 있습니다.](https://arxiv.org/html/2307.03172v3/figure1.svg)

2023년 모델로 잰 결과라 지금 모델에 숫자를 그대로 옮길 수는 없습니다. 연구진은 긴 입력을 받도록 따로 만든 모델에서도 가운데 놓인 정보를 잘 쓰지 못하는 경향이 나타났다고 적었습니다. 규칙 목록이 길어질수록 그 가운데 일부는 입력의 한가운데로 밀려납니다.

앞의 세 방법은 규칙을 프롬프트에 적지 않는다는 공통점이 있습니다. 오토 리뷰는 별도 에이전트가 판단하고, 원격 인스턴스는 접근할 수 있는 범위로 막고, 훅과 권한 프로필은 실행 단계에서 막습니다. 프롬프트에 적은 규칙은 모델이 읽고 따르기를 기대하는 문장이고, 코드에 건 규칙은 모델이 무엇을 읽었든 실행 자체를 멈춥니다.

## 기능이 적다는 지적에는 어떻게 답했나

한 오픈소스 하네스 개발자는 다른 도구들이 자동 코드 생성이나 동적 워크플로 같은 기능을 잔뜩 내세우는 데 비해 코덱스는 모델 성능에 더 기대는 것 같다고 물었습니다. 발표자는 화려한 기능보다 기초를 하나씩 정확히 쌓는 데 집중하고 있고, 목표는 가장 튼튼한 기초 하네스라고 답했습니다. 오픈소스라서 사용자들이 그 위에 자기 하네스를 얹을 수 있고, 서브에이전트나 메모리를 어떻게 구현했는지 궁금하면 저장소를 `git clone`해서 코덱스에게 직접 물어보라는 말도 덧붙였습니다.

코덱스 CLI는 2025년 4월 GitHub에 Apache-2.0 라이선스로 공개됐고, 소티오의 말로는 하네스의 뼈대를 Rust로 만들었습니다. 소티오는 6월 17일에도 코덱스 앱과 CLI, SDK를 오픈AI 모델 대신 오픈소스 모델과 함께 쓸 수 있다고 다시 알렸습니다.

모델에 더 기댄다는 인상은 오픈AI가 하네스를 다루는 방식에서 나옵니다. 하네스는 모델이 도구를 쓰고 결과를 받아 다음 행동을 정하게 하는 실행 틀입니다. 그레그 브록먼(Greg Brockman) 오픈AI 사장은 2025년 9월 팟캐스트에서 코딩은 쓴 글을 실행하고 도구에 연결해야 해서 하네스가 모델을 쓸모 있게 만드는 데 지능만큼 중요하다고 했고, 소티오는 하네스를 몸, 모델을 뇌에 빗댔습니다. 같은 대담에서 소티오는 GPT-5-Codex가 코덱스 하네스에 맞춰 최적화된 모델이라며, 모델과 도구 묶음을 하나의 에이전트처럼 가깝게 붙였다고 설명했습니다.

그레그 브록먼·티보 소티오, 오픈AI 팟캐스트 6화 (2025년 9월)

소티오는 같은 방송에서 도구와 실행 루프를 모델과 붙여 처음부터 끝까지 함께 훈련하면 모델이 스스로 행동하는 능력이 살아난다고 설명했습니다. 다른 도구들이 워크플로 코드로 따로 짜 넣는 동작을 오픈AI는 모델이 직접 하도록 훈련하는 쪽을 택했습니다. 소티오는 6월 20일 로컬과 원격 호스트 사이에서 작업을 넘기는 기능을 소개하면서, 모델에게 운전석을 맡기면 필요한 인프라가 오히려 줄어든다고 적었습니다.

반대쪽 근거도 있습니다. 릴리안 웽(Lilian Weng)이 7월 초 블로그에 정리한 연구 가운데에는 모델을 Claude 3.5 Sonnet으로 고정한 채 [하네스만 진화시켜 SWE-bench Verified를 20%에서 50%로 끌어올린 결과](/post/review-lilian-weng-harness-self-improvement)가 있습니다. 코덱스는 하네스를 모델과 함께 훈련하는 쪽을, 오픈소스 하네스 개발자들은 모델 밖에서 하네스를 고쳐 쓰는 쪽을 택했을 뿐, 두 쪽 모두 하네스가 성능을 움직인다는 사실에서 출발합니다.

## 벤치마크 1위는 무엇을 잰 숫자인가

모델을 어떻게 평가하느냐는 질문에 발표자는 공정성을 위해 다른 모델에도 같은 평가를 돌려 교차 검증한다고 답했습니다. 지금 벤치마크가 담지 못하는 과제가 많아 업계가 함께 쓸 동적 벤치마크가 필요하다고 했고, 발표에서 보여 준 작업 상당수가 코딩 밖의 일이라 사용자가 가장 정확한 평가자라고 덧붙였습니다.

밋업 당시 터미널 작업 벤치마크 Terminal-Bench 2.1 리더보드의 맨 위에는 코덱스 CLI와 GPT-5.5 조합이 있었습니다. 이 리더보드는 모델 하나의 점수 대신 하네스와 모델을 묶은 조합의 점수를 싣고, Terminal-Bench 팀이 결과를 직접 돌려 검증합니다.

| 순위 | 하네스 | 모델 | 정확도 |
| --- | --- | --- | --- |
| 1 | 코덱스 CLI | GPT-5.5 | 83.4% (±2.2) |
| 2 | Claude Code | Claude 5 Fable | 83.1% (±2.0) |
| 3 | Terminus 2 | Claude 5 Fable | 80.4% (±2.3) |
| 4 | Claude Code | Claude Opus 4.8 | 78.9% (±2.5) |
| 5 | Terminus 2 | GPT-5.5 | 78.2% (±2.4) |

Terminal-Bench 2.1 리더보드 7월 9일 보관본 기준이고, 표에 실린 제출은 모두 6월 17일까지 들어온 것입니다.

같은 GPT-5.5가 코덱스 CLI에서는 83.4%, 벤치마크 팀이 만든 공용 하네스 Terminus 2에서는 78.2%를 받아 5.2%포인트 차이가 났습니다. Claude 5 Fable도 Claude Code와 Terminus 2 사이에서 2.7%포인트가 벌어졌습니다. 1위와 2위의 차이 0.3%포인트는 두 결과의 오차 범위 안에 있어서, 이 표로 두 조합의 우열을 가리기는 어렵습니다.

하네스를 바꿔도 점수가 덜 흔들린다는 점을 강점으로 내세운 회사도 있습니다. 텐센트는 Hy3 정식판을 내면서 SWE-bench Verified에서 [CodeBuddy, Cline, KiloCode로 하네스를 바꿔 끼워도 정확도 차이가 4% 안](/post/news-tencent-hy3-apache-license)이었다고 밝혔습니다. 자기 하네스에서 가장 높은 점수를 내는 오픈AI와 어느 하네스에서든 비슷한 점수를 내려는 텐센트는 같은 벤치마크를 서로 다른 목표로 쓰고 있습니다.

사용자가 가장 정확한 평가자라는 답도 이런 표의 한계에서 나옵니다. Terminal-Bench는 터미널 안에서 끝나는 과제를, SWE-bench는 테스트로 통과 여부를 가릴 수 있는 코드 수정을 잽니다. 이날 발표에서 보여 준 문서 정리나 화면 조작 같은 일은 두 표 어디에도 들어가지 않습니다.

## CLI는 남고, 폰은 승인하는 데 쓴다

코덱스를 어디서 쓸 수 있느냐는 질문에는 폰이든 컴퓨터든 사용자가 있는 모든 기기라는 답이 나왔습니다. CLI는 레거시로 두고 데스크톱 앱에만 집중하느냐는 질문에는 CLI를 없애지 않고, 오히려 실험 기능이 CLI에서 먼저 나온다고 답했습니다. 사용법을 서로 공유하는 기능을 낼 계획이 있느냐는 질문에는 만들지 않는다고 잘라 말했는데, 커뮤니티가 이미 그 일을 하고 있고 생태계가 충분히 크다는 이유였습니다.

폰의 쓰임새는 5월과 6월 업데이트에 나와 있습니다. 5월 14일부터 ChatGPT 모바일 앱을 코덱스 앱이 깔린 맥에 연결해 쓸 수 있게 됐는데, 코덱스는 연결된 컴퓨터에서 돌기 때문에 그 컴퓨터의 프로젝트와 파일, 자격 증명, 플러그인, 설정을 폰에서 그대로 씁니다. 6월 25일 정식 출시 공지는 폰에서 작업을 시작하거나 이어 가고, 진행 상황을 확인하고, 행동을 승인한다고 적었습니다.

폰으로 승인하는 흐름과 오토 리뷰는 같은 문제를 양쪽에서 다룹니다. 에이전트가 오래 돌수록 승인 요청은 늘고, 사람은 그 요청을 폰으로 받아 직접 누르거나 검토 에이전트에게 넘깁니다. 7월 8일 현재 코덱스에는 두 길이 모두 열려 있고, 어떤 요청을 사람에게 올릴지는 승인 정책과 권한 프로필로 정합니다.

## 작년에는 AI가 벽에 부딪혔다고 하지 않았나

마지막 무렵 한 참석자가 작년에 다들 AI가 벽에 부딪혔다고 하지 않았느냐고 물었습니다. 발표자는 지난 1년의 진전을 보면 그 벽은 넘었다고 답했습니다. o1에서 시작한 테스트 타임 스케일링, 곧 답하기 전에 더 오래 생각하게 해 성능을 끌어올리는 방식으로 넘었다는 설명이었습니다.

AI 평가 기관 METR의 시간 지평(time horizon) 측정이 이 답을 숫자로 확인할 수 있는 자료입니다. 시간 지평은 사람 전문가가 끝내는 데 걸리는 시간을 기준으로, 모델이 절반의 확률로 해내는 작업의 길이를 잽니다.

| 모델 | 공개 | 50% 시간 지평 |
| --- | --- | --- |
| o1 | 2024년 12월 | 39분 |
| o3 | 2025년 4월 | 2시간 |
| GPT-5 | 2025년 8월 | 3시간 23분 |
| Claude Opus 4.5 | 2025년 11월 | 4시간 53분 |
| GPT-5.2 | 2025년 12월 | 5시간 52분 |
| Claude Opus 4.6 | 2026년 2월 | 11시간 59분 |
| Claude Mythos Preview 초기판 | 2026년 4월 | 17시간 25분 |

METR Time Horizon 1.1 측정값이고, 공개 시점은 METR 자료에 적힌 모델 출시일 기준입니다(출처: METR).

o1의 39분이 16개월 뒤 17시간 25분이 됐습니다. METR은 2023년 이후 시간 지평이 두 배로 느는 데 약 129일이 걸렸다고 추정합니다. 이 추세만 보면 벽은 넘었다는 발표자의 답에 근거가 있습니다.

다만 이 표에는 METR 스스로 붙인 조건이 있습니다. METR은 5월 8일 Mythos Preview 결과를 올리면서 지금의 과제 모음으로는 16시간 넘는 측정값을 믿기 어렵다고 밝혔습니다. 과제 228개 가운데 16시간 넘게 걸리는 것이 5개뿐이라, 맨 아랫줄의 17시간 25분은 이 과제 모음으로 잴 수 있는 길이의 끝에 걸린 값입니다. METR은 또 2시간짜리 과제를 사전 맥락이 거의 없는 신입이나 외주 인력이 2시간에 해낼 일로 보라고 설명합니다.

표에서 올해 가파르게 오른 쪽은 앤트로픽 모델이었습니다. 오픈AI 모델은 GPT-5.2의 5시간 52분 뒤로 GPT-5.3-Codex 5시간 50분, GPT-5.4 5시간 42분으로 비슷한 수준에 머물렀고, 밋업 시점에 누구나 쓸 수 있던 최신 모델 GPT-5.5는 아직 측정 전이었습니다.

일자리를 묻는 질문에는 발표자가 샘 올트먼 CEO의 표현을 빌려, 사람의 경험을 끌어올리는 도구를 만든다고 답했습니다. 도구가 사람의 경험을 넓힌다는 말과 일자리가 그대로 남는다는 말은 같은 뜻이 아니어서, 이 답은 회사의 방향을 밝힌 데 가깝습니다.

## 사람이 쥐고 있는 것

질의응답에서 나온 답을 문서와 대조하면 사람이 쥐는 것은 세 가지로 좁혀집니다. 맥락은 사이드챗으로 사람이 직접 떼어 내지만, 컴팩션이 압축한 내용은 사람이 읽을 수 없습니다. 경계는 샌드박스와 권한 프로필, 훅, 오토 리뷰처럼 코드로 긋고, 판정은 하네스와 모델을 묶어 매긴 리더보드 점수 위에 사용자가 직접 내립니다.

국내 팀이 당장 손댈 수 있는 것은 앞의 두 가지입니다. 한글로 쓴 AGENTS.md는 1만 자 남짓에서 기본 한도에 닿으니 폴더별로 나눠 두는 편이 낫고, 꼭 지켜야 할 규칙은 문서에 적는 대신 권한 프로필과 훅으로 거는 쪽이 확실합니다. 도구를 고를 때 Terminal-Bench 표의 하네스 이름까지 함께 보면 같은 모델이 어디서 몇 점을 받았는지가 드러납니다.

오픈AI는 6월 26일부터 일부 파트너에게만 열어 둔 GPT-5.6을 이번 주 목요일(한국 시각 10일 새벽) 정식으로 내놓습니다. 소티오도 밋업 당일 낮 X에 선글라스를 준비하라며 새 모델 Sol의 등장을 예고했습니다. Terminal-Bench 표의 맨 윗줄과 METR의 측정 목록에 새 모델이 오르면, 이날 나온 답들을 그 숫자와 한 번 더 대조해 보겠습니다.

읽어 주셔서 고맙습니다.

초이 드림
