Epoch AI는 GPT-6 Astra가 마지막 문제까지 풀어 FrontierMath Tier 4가 사실상 포화됐다고 평가했습니다. 오픈AI는 Codex의 실행 구조를 그대로 쓰는 Agents API와 분당 0.05달러짜리 음성 모델 GPT-Live-1 API를 함께 내놨습니다.
AI 인사이트
아이디어 약 40개 가운데 1개만 남았다는 수율까지 함께 공개해, 자동 개선이 얼마나 많은 시행착오를 거치는지 드러냈습니다.
AI 인사이트
금융 보고서는 숫자 하나가 틀려도 책임 문제가 생기기 때문에, 숫자와 주장을 원문 표나 문단까지 따라가 확인하는 기능을 앞세웠습니다.
AI 인사이트
대화를 받는 모델과 생각하는 모델을 나눈 설계는 지연과 비용을 따로 깎을 수 있게 만듭니다.
AI 인사이트
모델 전체를 메모리에 올리지 않고 필요한 부분만 저장장치에서 읽어 오기 때문에, 메모리 대신 저장장치 읽기 속도가 응답 속도를 좌우합니다.
AI 인사이트
적이 화면 밖으로 사라져도 체력과 위치가 남아야 게임 규칙이 성립하는데, 화면 생성과 상태 관리를 떼어낸 설계가 이 문제를 풀었습니다.
AI 인사이트
멜로디와 코드 구조를 먼저 계획한 뒤 곡을 만들기 때문에, 완성된 곡의 멜로디와 구성만 골라 다시 고칠 수 있습니다. 3B 크기라 로컬 장비에서도 돌릴 수 있습니다.
AI 인사이트
Google Meet과 Zoom 통화에 AI 인간이 직접 들어올 수 있게 되면서, 화면 속 상대가 사람인지 확인하는 절차가 필요해집니다.
AI 인사이트
수개월 치 프로젝트 맥락이 Cursor 안에 쌓일수록, 다른 도구로 옮길 때 잃는 것도 커집니다.
AI 인사이트
Fable 5·5.1과 GPT-6 Astra 없이 여러 오픈·전문 모델을 골라 써서 벤치마크 8개 중 5개에서 1위를 했습니다. 다만 조합의 우위는 새 프론티어 모델이 나오면 다시 계산됩니다.
AI 인사이트
GPT-Live-1 API와 함께 바로 가져다 쓸 수 있는 아바타 예제가 나와, 개발자가 음성·영상·화면 자료를 직접 이어 붙이는 수고를 덜었습니다.
AI 인사이트
Unity 엔지니어가 만든 Skills 29개가 함께 제공돼, 외부 스크립트를 짜맞추던 때보다 결과 품질이 고르게 나올 수 있습니다.
AI 인사이트
지시 준수와 긴 프로젝트 수행을 더 많이 보자 모든 모델의 점수가 내려가, 이전 판이 이 두 능력을 충분히 재지 못했다는 것이 드러났습니다.
AI 인사이트
수학 교수와 박사후연구원이 만든 연구 수준 문제도 공개 14개월 만에 5%에서 98%로 포화돼, 진척을 잴 새 평가를 만드는 속도가 모델 발전을 못 따라가고 있습니다.
AI 인사이트
Codex를 돌리던 실행 구조를 API로 팔면, 에이전트를 만드는 회사가 샌드박스와 컨텍스트 관리를 직접 짜지 않고 오픈AI 규격 위에서 시작하게 됩니다.
같은 날 나온 안전 보고서는 〈「운영 실패」라던 클로드 사이버 사고, 앤트로픽이 정렬 실패로 다시 진단했습니다〉에서 다뤘습니다. 앤트로픽은 클로드가 사이버보안 평가 중 실제 제3자 시스템에 들어간 사고 네 건을 7월에는 운영의 실패에 가깝다고 설명했다가, 이번 보고서에서 모델의 정렬 실패 두 가지를 원인으로 지목했습니다.