오픈AI가 AtCoder 월드 투어 파이널 알고리즘 부문 5문제를 모두 풀었고, 하루 전 휴리스틱 부문에서는 오픈AI 코드가 결선의 인간 코드 대부분보다 짧고 단순했습니다. 중국 국가 취약점 데이터베이스는 클로드 코드 특정 버전에 백도어가 있다며 삭제나 업그레이드를 권고했습니다.
AI 인사이트
앤트로픽이 3월 증류 방지용으로 넣은 코드를 중국 국가 취약점 데이터베이스가 백도어로 분류했습니다. 며칠 전 알리바바의 사내 금지가 국가 경보로 커졌습니다.
AI 인사이트
오픈 모델을 기반으로 강화학습만 얹어 상위권에 붙는 경로가 반복되고 있습니다. SWE-1.7도 Kimi K2.7 위에 강화학습을 얹었고, 초당 1,000토큰 속도와 낮은 비용을 앞세웠습니다.
AI 인사이트
새벽 발표는 한국에서 다음 날 아침에야 내용을 확인하게 됩니다.
AI 인사이트
문제를 이미 정의한 사람에게 맞는 모델과 방향을 찾아 주는 모델이 갈라지고 있습니다. 고르는 기준은 작업의 명확도입니다.
AI 인사이트
Psyho는 인간 참가자 대부분이 에이전트로 코드를 대량 생성했고, 사람과 AI가 함께 만든 코드가 AI 혼자 짠 코드보다 지저분했다고 봤습니다.
AI 인사이트
라이다 없이 카메라만으로 움직인다면 로봇의 원가표가 통째로 내려갑니다. 시뮬레이션에서 배운 감각이 실제 바닥에서도 버티는지가 다음 숙제입니다.
AI 인사이트
상위 요금제에서도 한도가 10분 단위로 닳는다면 가격표가 아직 사용 실태를 못 따라가고 있습니다.
AI 인사이트
무거운 일은 데스크톱에 두고 폰은 지시와 승인 창구로 좁힌 설계입니다. 답은 사용자의 노션 문서와 데이터에서 끌어오고, 모델은 Claude, Gemini, GPT 중에 고릅니다.
AI 인사이트
작년 휴리스틱 부문에서는 인간이 AI를 눌렀지만, 올해는 휴리스틱에 이어 정답이 딱 떨어지는 알고리즘 부문까지 AI가 가져갔습니다.
AI 인사이트
특수 장치 없이 곧 풀릴 모델로 낸 성적이라면 성과를 만든 쪽은 하네스 설계입니다. 같은 조건이 곧 모두에게 열립니다.
AI 인사이트
Genie 3가 수 분 일관성을 보인 영역을 오픈 모델이 3D 공간 기억과 압축한 지난 프레임이라는 명시적 메모리로 따라잡았습니다.
AI 인사이트
같은 작업에서도 모델마다 멈추는 지점이 달라, 둘을 갈아 끼우는 편이 한쪽을 더 밀어붙이는 것보다 빠를 때가 있습니다.
AI 인사이트
한 시간 동안 일관성이 유지되면 월드 모델을 로봇 학습용 시뮬레이터로 쓸 수 있습니다. 소비자 GPU 한 장으로 도는 경량판도 함께 풀렸습니다.
AI 인사이트
길이가 30초에서 180초로 늘어도 3분 내내 인물과 배경이 유지되는지는 아직 확인되지 않았습니다.
Cursor와 함께 만든 Grok 4.5의 가격과 토큰 사용량은 〈Cursor와 만든 Grok 4.5, 출력 가격은 Opus 4.8의 4분의 1〉에 정리했습니다. SWE-Bench Pro 한 과제에 Grok 4.5는 출력 토큰 1만 5,954개, Opus 4.8은 6만 7,020개를 씁니다.