Grok 4.5가 4차원에서 깨지는 반례를 사람 개입 없이 만들어, 2021년부터 4~12차원이 비어 있던 5년 된 수학 문제에 답을 냈습니다. Sebastian Raschka의 GPT-5.6 비용 그래프에서는 가장 작은 Luna를 최고 강도로 돌리면 Sol Medium급 성능이 3분의 1 비용에 나왔습니다.
AI 인사이트
얼굴과 동작, 오디오, 카메라 움직임은 두고 요소만 바꾸는 편집이라 영상을 처음부터 다시 생성할 필요가 줄어듭니다.
AI 인사이트
반례가 손으로 검산되는 식으로 나온 덕분에 주장 검증이 곧바로 가능해졌습니다. 원 정리의 저자가 직접 확인한 점도 드뭅니다.
AI 인사이트
큰 모델을 이름으로 고르던 습관에 추론 강도라는 변수가 끼어들었습니다. 모델 선택 공식의 수명이 그만큼 짧아집니다.
모델 점수를 매기는 시험 자체의 결함은 〈80%까지 오른 코딩 시험, 오픈AI "과제 30% 깨졌다"며 추천 철회〉에 정리했습니다. 오픈AI는 SWE-Bench Pro 공개 과제 731개 중 약 30%가 깨진 문제라고 추정했고, 최고 점수는 8개월 남짓 만에 23.3%에서 80.3%로 올라 있었습니다.